Whisper (音声認識システム)
From Wikipedia, the free encyclopedia
| 作者 | OpenAI[1] |
|---|---|
| 初版 | 2022年9月21日 |
| 最新版 |
v20240930
/ 2024年10月1日 |
| リポジトリ | https://github.com/openai/whisper |
| プログラミング 言語 | Python |
| 種別 | |
| ライセンス | MITライセンス |
Whisperは、音声認識と文字起こしのための機械学習モデルであり、OpenAIによって開発され、2022年9月にオープンソースソフトウェアとして初めて公開された[2]。
英語を含む複数の言語で音声を文字起こしできる他[3]、英語以外の複数の言語を英語に翻訳することもできる。OpenAIは、開発において多様な訓練データを使用したことで、従来の手法と比較して、アクセント、背景雑音、専門用語の認識精度が向上したと主張している[4]。
Whisperは弱教師あり学習を用いた深層学習音響モデルであり、エンコーダ・デコーダトランスフォーマーアーキテクチャを使用して構築されている[5]。
Whisper V2は2022年12月8日にリリースされた[6]。Whisper V3は2023年11月のOpenAI Dev Dayでリリースされた[7]。
音声認識は長い研究の歴史を持つ。初期のアプローチでは、動的時間伸縮法や後に隠れマルコフモデルといった統計的手法が用いられていた。2010年代頃には、大規模データセット(「ビッグデータ」)の利用可能性と計算性能の向上により、音声認識モデルに深層ニューラルネットワークを用いるアプローチが一般的になった[8]。音声認識における深層学習の初期のアプローチには畳み込みニューラルネットワークが含まれていたが、系列データを捉えることができないという制限があった。そのため、後にSeq2seqアプローチが開発され、そこでは長・短期記憶を利用した回帰型ニューラルネットワークが用いられた[9]。
2017年にGoogleによって導入されたTransformerは、機械学習における多くの問題に対する従来の最先端のアプローチの多くに取って代わり、言語モデリングやコンピュータビジョンなどの分野における中核となるニューラルアーキテクチャになり始めた。弱教師あり学習を用いた音響モデルの学習アプローチは、2020年代初頭に深層ニューラルネットワークを用いた音声認識アプローチとして有望であると認識された[10]。
ニューヨークタイムズの報道によると、2021年にOpenAIは、大規模言語モデルの学習に使用する高品質データのソースを使い果たしたと考え、YouTube動画やポッドキャストの書き起こしでウェブスクレイピングテキストを補完することを決定し、このタスクを解決するためにWhisperを開発した[11]。