雑音のある通信路モデル
From Wikipedia, the free encyclopedia
定義
アルファベット が与えられたとき、 を による全ての有限文字列の集合とし、有効な単語からなる辞書 を の部分集合(すなわち )とする。
雑音のある通信路は行列
- ,
である。ここで、 は意図した単語、 は実際に受信された乱された単語である。
例
英語のアルファベット を考える。いくつかの部分集合 は、有効な英語の単語の辞書を構成する。
入力中に、以下のような間違いが発生する可能性がある。
- 文字の脱落(例: letterがleterになる)
- 文字の追加(例: mistakeがmisstakeになる)
- 文字の入れ替え(例: receivedがrecievedになる)
- 文字の置換(例: finiteがfimiteになる)
雑音のある通信路行列 を構築するには、与えられた意図した単語(全ての と についての )について、それぞれの間違いの確率を考慮する必要がある。これらの確率は、 と の間のレーベンシュタイン距離を考慮して、あるいは、エッセイの草稿と手作業で綴りを編集したものとを比較することによって、集めることができる。
誤り訂正
関連項目
出典
- Brill, Eric; Moore, Robert C. (Jan 2000). “An Improved Error Model for Noisy Channel Spelling Correction”. Proceedings of ACL 2000.