Whisper (音声認識システム)

From Wikipedia, the free encyclopedia

初版 2022年9月21日
最新版
v20240930 / 2024年10月1日 (16か月前) (2024-10-01)
Whisper (音声認識システム)
作者 OpenAI[1]
初版 2022年9月21日
最新版
v20240930 / 2024年10月1日 (16か月前) (2024-10-01)
リポジトリ https://github.com/openai/whisper
プログラミング
言語
Python
種別
ライセンス MITライセンス
テンプレートを表示

Whisperは、音声認識と文字起こしのための機械学習モデルであり、OpenAIによって開発され、2022年9月にオープンソースソフトウェアとして初めて公開された[2]

英語を含む複数の言語で音声を文字起こしできる他[3]、英語以外の複数の言語を英語に翻訳することもできる。OpenAIは、開発において多様な訓練データを使用したことで、従来の手法と比較して、アクセント、背景雑音、専門用語の認識精度が向上したと主張している[4]

Whisperは弱教師あり学習を用いた深層学習音響モデルであり、エンコーダ・デコーダトランスフォーマーアーキテクチャを使用して構築されている[5]

Whisper V2は2022年12月8日にリリースされた[6]。Whisper V3は2023年11月のOpenAI Dev Dayでリリースされた[7]

音声認識は長い研究の歴史を持つ。初期のアプローチでは、動的時間伸縮法英語版や後に隠れマルコフモデルといった統計的手法が用いられていた。2010年代頃には、大規模データセット(「ビッグデータ」)の利用可能性と計算性能の向上により、音声認識モデルに深層ニューラルネットワークを用いるアプローチが一般的になった[8]。音声認識における深層学習の初期のアプローチには畳み込みニューラルネットワークが含まれていたが、系列データを捉えることができないという制限があった。そのため、後にSeq2seqアプローチが開発され、そこでは長・短期記憶を利用した回帰型ニューラルネットワークが用いられた[9]

2017年にGoogleによって導入されたTransformerは、機械学習における多くの問題に対する従来の最先端のアプローチの多くに取って代わり、言語モデリングやコンピュータビジョンなどの分野における中核となるニューラルアーキテクチャになり始めた。弱教師あり学習を用いた音響モデルの学習アプローチは、2020年代初頭に深層ニューラルネットワークを用いた音声認識アプローチとして有望であると認識された[10]

ニューヨークタイムズの報道によると、2021年にOpenAIは、大規模言語モデルの学習に使用する高品質データのソースを使い果たしたと考え、YouTube動画やポッドキャストの書き起こしでウェブスクレイピングテキストを補完することを決定し、このタスクを解決するためにWhisperを開発した[11]

学習と能力

Whisperは、68万時間の多言語およびマルチタスクデータを用いて半教師あり学習で訓練されており、その約5分の1(11万7000時間)は英語以外の音声データである。WhisperはLibriSpeechデータセットに特化したモデルの性能を上回らないものの、多くのデータセットでテストした結果、他のモデルよりも堅牢で、エラーが50%少ない[12]

Whisperは、訓練データであまり表現されていない言語では単語エラー率が高くなるなど、言語によって異なるエラー率を示す[13]

このモデルは、音声認識とより一般的な音声認識のための統合モデルの基盤として使用されている[14]

アーキテクチャ

脚注

外部リンク

Related Articles

Wikiwand AI