Transcrire une heure d’enregistrement en une vingtaine de secondes, sur un ordinateur portable, sans envoyer un seul fichier dans le cloud : c’est la promesse de Phonon-2, un modèle de reconnaissance vocale publié le 29 septembre par Fermion Research. Il ne pèse que 164 Mo, une version comprimée d’un modèle de Nvidia quinze fois plus lourd, et ses poids sont libres de réutilisation, y compris commerciale, sous licence Creative Commons avec attribution. Selon ses auteurs, il se trompe moins que Whisper large-v3-turbo, la référence ouverte d’OpenAI, sur cinq des sept jeux de test usuels. Les vingt secondes ont été mesurées sur un MacBook Air récent, en utilisant sa puce graphique.
Deux réserves : ces performances n’ont pas encore été vérifiées de façon indépendante, et le modèle ne fonctionne officiellement qu’en anglais. Mais la direction est la bonne. Des modèles petits, sobres et capables de tourner en local, c’est moins d’énergie et des réunions ou des consultations qui ne quittent pas l’entreprise. Reste à voir arriver la même chose en français.
