Alsace·AI Le Bretzel

IA ·

Phonon-2 : une heure d’audio transcrite en vingt secondes, sans cloud

Un modèle de reconnaissance vocale ouvert de 164 Mo qui tourne en local. En anglais seulement, pour l’instant.

Transcrire une heure d’enregistrement en une vingtaine de secondes, sur un ordinateur portable, sans envoyer un seul fichier dans le cloud : c’est la promesse de Phonon-2, un modèle de reconnaissance vocale publié le 29 septembre par Fermion Research. Il ne pèse que 164 Mo, une version comprimée d’un modèle de Nvidia quinze fois plus lourd, et ses poids sont libres de réutilisation, y compris commerciale, sous licence Creative Commons avec attribution. Selon ses auteurs, il se trompe moins que Whisper large-v3-turbo, la référence ouverte d’OpenAI, sur cinq des sept jeux de test usuels. Les vingt secondes ont été mesurées sur un MacBook Air récent, en utilisant sa puce graphique.

Deux réserves : ces performances n’ont pas encore été vérifiées de façon indépendante, et le modèle ne fonctionne officiellement qu’en anglais. Mais la direction est la bonne. Des modèles petits, sobres et capables de tourner en local, c’est moins d’énergie et des réunions ou des consultations qui ne quittent pas l’entreprise. Reste à voir arriver la même chose en français.

Sources

Open SourceProductivité IA

Vous êtes arrivé au bout — merci

Le Bretzel

La suite chaque lundi matin : le récap de la semaine passée en IA, noué en cinq minutes. Gratuit, sans pub, sans pistage.

Une lettre par semaine, le lundi matin. Votre adresse ne sert qu’à ça — confidentialité. Désinscription en un clic.

À lire ensuite