Whisper (système de reconnaissance vocale)
From Wikipedia, the free encyclopedia
| Créateur | OpenAI OpCo (d) et OpenAI |
|---|---|
| Développé par | OpenAI |
| Dépôt | github.com/openai/whisper |
| Type |
Bibliothèque logicielle Python (d) Modèle d'apprentissage automatique (d) |
| Licence | Licence MIT |
Whisper est un modèle d'apprentissage automatique pour la reconnaissance et la transcription vocales, créé par OpenAI et publié pour la première fois en tant que logiciel open source en septembre 2022 [1].
Il est capable de transcription en anglais, en français et dans d’autres langues, pour un total de 99 langues [2],[3] et peut également traduire vers l'anglais. OpenAI affirme que la variété des sources langagières mobilisées lors de son développement l’a rendu peu sensible aux différences d’accents, au bruit de fond et même à l’usage de jargons par rapport à d’autres logiciels développés antérieurement[4].
Whisper s’appuie sur les techniques propres à OpenAi, notamment l'apprentissage profond faiblement supervisé, réalisé à l'aide d'une architecture de transformateur codeur-décodeur.