Wikiwand AI

インターネット言語学

From Wikipedia, the free encyclopedia

インターネット言語学(インターネットげんごがく、英: Internet linguistics)は、イギリスの言語学者デイヴィッド・クリスタル(英語版)によって提唱された言語学の一分野である。インターネットや、ショートメッセージサービス(SMS)によるテキストメッセージといった他のニューメディアの影響のもとで生じた新しい言語のスタイルや形式を研究する。[1][2] ヒューマンコンピュータインタラクション(HCI)がコンピュータを介したコミュニケーション(CMC)やインターネットを介したコミュニケーション(IMC)へと発展して以来、グレッチェン・マカロック(英語版)[3]のような専門家は、ウェブインターフェースやユーザビリティの観点から、言語学がそこに寄与する役割を持つことを認めてきた。インターネット上に現れる言語を研究することは、概念的な体系化、翻訳、ウェブユーザビリティの改善に役立ちうる。こうした研究は、言語学者とウェブ利用者の双方に利益をもたらすことを目指している。[4]

インターネット言語学の研究は、社会言語学、教育、文体論、応用言語学という四つの主要な観点から行われうる。[1] さらに、技術の進歩の結果として新たな側面も発展しており、その中にはテキストコーパスとしてのウェブの発展や、マスメディアや文学作品を通じてインターネットの普及がもたらした文体的変異の広がりと影響が含まれる。インターネットに接続する利用者の数が増え続けるなか、新しいコンピュータ媒介技術が次々と登場し、人々がこれらの新しいメディアに合わせて言語を適応させていくため、インターネットの言語学的な将来はまだ定まっていない。[5] インターネットは、人々に言語の使用を促す面でも、逆に言語の使用から注意をそらす面でも、依然として重要な役割を果たし続けている。[6]

主要な観点

デイヴィッド・クリスタルは、さらなる研究のための四つの主要な観点を挙げている。すなわち、社会言語学的観点、教育的観点、文体的観点、応用的観点である。[2] これら四つの観点は事実上相互に関連しており、互いに影響し合っている。

社会言語学的観点

この観点は、社会がインターネットの発展が言語に与える影響をどのように捉えているかを扱う。[1] インターネットの登場は多くの点でコミュニケーションを一変させた。人々のコミュニケーションの仕方を変え、広範な社会的影響を持つ新たなプラットフォームを生み出した。重要な手段には、SMSによるテキストメッセージ、電子メール、チャットグループ、仮想世界、ウェブなどが含まれるが、これらに限られない。[2]

これらの新しいコミュニケーション手段の進化は、言語の使われ方に関して多くの懸念を呼び起こした。クリスタル(2005年)によれば、こうした懸念は根拠のないものでも歴史上前例のないものでもなく、新しい技術的突破が言語に影響を与えるときにほぼ必ず現れる。15世紀に印刷が導入されたとき、19世紀に電話が発明されたとき、20世紀に放送が社会に浸透し始めたときにも見られたとおりである。[2]

個人のレベルでは、SMSによるテキストメッセージや携帯端末による電子メール(プッシュメール)などのCMCは、即時的なコミュニケーションを大きく高めた。[2] その例としてiPhoneやBlackBerryが挙げられる。

学校では、教育者や生徒がコミュニケーションや交流のために個別の学校用電子メールアカウントを与えられることも珍しくない。授業での議論は、ますますディスカッションフォーラムという形でインターネット上に持ち込まれている。たとえば南洋理工大学では、学生は同大学のポータル「edveNTUre」で協調学習に取り組み、フォーラムでの議論やオンラインクイズに参加したり、講師が用意したストリーミングのポッドキャストを視聴したりしている。iTunes U(英語版)は2008年に大学との連携を始め、Appleの音楽サービスを、学術講義や学習教材を無料で提供するストアへと変えた。オックスフォード大学、ケンブリッジ大学、イェール大学を含む18か国600以上の教育機関と提携している。[7]

こうした学術的なソーシャルネットワーキングやメディアは、世界中の教育者が学生をより良く関与させる新しい方法を模索し続けるにつれて、増加すると見込まれている。ニューヨーク大学では、学生が「Skypeを通じて意見を述べるゲストスピーカー、インスタントメッセージで支援を提供する図書館スタッフ、学外から図書館資源にアクセスする学生」とやり取りすることが一般的である。[8] 学生と教師がこうしたCMCプラットフォームをより多く使うようになるにつれて、これは言語の使われ方に影響を及ぼす。[8]

職業的なレベルでは、企業がコンピュータやノートパソコンを(有線・無線のインターネット接続を通じて)インターネットに接続し、従業員が個別の電子メールアカウントを持つことが一般的な光景である。これは組織内(社員間)および組織外(他者)とのコミュニケーションを大きく促進する。スマートフォンのような移動体通信も、企業の世界にますます入り込んでいる。たとえば2008年、AppleはActiveSyncを用いて統合機能(プッシュ電子メール、カレンダー、連絡先管理)を合理化する技術的発展を背景に、企業がiPhoneを社内環境に取り入れるのを積極的に支援する意向を表明した。[7]

一般に、インターネットによって可能になったこれら新しいCMCは、人々の言語の使い方を変えた。非形式性が高まり、それに伴って言語の劣化への懸念が高まっている。しかしデイヴィッド・クリスタルが述べるように、これらは言語の創造性の力を反映するものとして肯定的にとらえるべきである。[2]

テーマ

インターネットの社会言語学は、相互に関連する五つのテーマを通じて検討することもできる。[9]

  1. 多言語主義 – インターネット上のさまざまな言語の普及度と地位に注目する。
  2. 言語変化 – 社会言語学的観点からは、言語変化は技術の物理的制約(例:入力されたテキスト)や、グローバル化のような社会経済的優先順位の変化によって影響される。時間の経過に伴う言語的変化を、インターネット用語に重点を置いて探究する。
  3. 会話ディスコース – インターネット上の社会的相互作用やコミュニケーション実践のパターンの変化を探究する。
  4. 文体的拡散 – インターネット用語や関連する言語形式が一般的な用法へと広がっていくことの研究を含む。言語が変化するにつれ、会話ディスコースと文体的拡散は言語文体論の側面と重なり合う。
    下記参照:文体的観点。
  5. メタ言語と民間言語学 – インターネット上のこれらの言語形式や変化がどのように名づけられ論じられているかに注目する(例:インターネット用語の影響がアポストロフィの「消滅」や大文字化の喪失をもたらしたこと)。

教育的観点

インターネット言語学の教育的観点は、インターネットが形式的な言語使用、特に標準英語に与える影響を検討し、それがひいては言語教育に影響する。[2] インターネット利用の台頭と急速な普及は、インターネットというプラットフォーム特有の新しい言語的特徴をもたらした。これには、非形式的な書き言葉の使用の増加、書き方や文体の不統一、インターネットのチャットやSMSテキストメッセージにおける新しい省略形の使用などが含まれるが、これらに限られない。文字数に対する技術的制約が新しい省略形の台頭に寄与した。[1] こうした頭字語は主に実用的な理由で存在する。すなわち、技術的制約とは別に、これらの媒体を通じてコミュニケーションするのに必要な時間と労力を減らすためである。一般的な頭字語の例には、lol(「laughing out loud」、笑いの一般的な表現)、omg(「oh my god」)、gtg(「got to go」)がある。[10]

教育的観点は、インターネットが言語教育に与える影響についての研究においてかなり確立されている。それは重要かつ決定的な側面であり、インターネット利用から生じる非形式的言語を、現在および将来の学生世代が適切かつ時宜にかなって使えるようにする教育に影響し、関わるからである。学生の学術論文における「guy」のようなくだけた語の使用や、「precede(先行する)」の代わりに「preclude(妨げる)」という語を選ぶことなど、非形式的な言語使用や誤った語の使用が学術的・形式的な状況へと浸透していくことへの懸念がある。教育者が指摘するように、学生の学術的成果物ではより高い頻度でつづりや文法の問題も生じており、「you」を「u」、「to」を「2」と省略するのが最も一般的である。[11]

エレノア・ジョンソンのような言語学者や教授は、書き言葉における広範な誤りがインターネット利用と強く結びついていると推測しており、教育者も同様に学生の成果物に新しい種類のつづりや文法の誤りが見られると報告している。しかし、提唱されるこの結びつきを裏付ける科学的証拠はない。[12] ナオミ・バロン(英語版)は著書『Always On』で、インターネットチャット、SMSテキストメッセージ、電子メールなどのインターネットを介したコミュニケーション(IMC)の使用が、学生の文章に与える影響はほとんどないと論じている。[13] 2009年に『British Journal of Developmental Psychology』が発表した研究では、日常的にテキストメッセージを送る(携帯電話でSMSを使ってメッセージを送る)学生ほど幅広い語彙を示すことが分かり、これが読解力の発達に良い影響を与える可能性がある。[14]

インターネットの利用は、学術的・形式的な言語使用にふさわしくないとされる文体をもたらしたものの、インターネット利用は言語教育を妨げるどころか、むしろそれを助けうる。インターネットは、特に第二言語や外国語学習において、言語学習を高める潜在的な利益をもたらしうることをさまざまな形で証明してきた。インターネット言語学に関連するインターネットを通じた言語教育は、最も重要には、コミュニケーションの側面(電子メール、ディスカッションフォーラム、チャットメッセンジャー、ブログなどの使用)を通じて応用される。[15] IMCは言語学習者とその言語の母語話者との間のより大きな交流を可能にし、より多くの誤り訂正と標準語のより良い学習機会を提供し、その過程で交渉や説得といった特定の技能の習得を可能にする。[15]

文体的観点

この観点は、インターネットとその関連技術が、特に文学において、言語における新しく異なる形の創造性をどのように促してきたかを検討する。[2] インターネットを、新しい言語現象が生じる媒体としてとらえる。この新しい言語様式は、話し言葉と書き言葉の両方の混合物であるため、研究する価値がある。たとえば、伝統的な書き言葉が静的であるのに対し、インターネット上の新しい言語は動的であり、コンピュータ画面上で語がさまざまな色やフォントサイズで現れうる。[16] しかし、この新しい言語様式には、自然言語には見られない他の要素も含まれる。一例は、電子メールやディスカッションフォーラムに見られる「フレーミング」の概念である。電子メールに返信する際、人々は一般に送信者のメッセージを枠組みとして自分のメッセージを書く。電子メールのある部分に返信し、他の部分は省くことを選べる。ディスカッションフォーラムでは、新しいスレッドを立ち上げることができ、物理的な場所にかかわらず誰もがインターネットを通じて示された考えに応答できる。これは通常、書き言葉には見られないものである。[16]

今後の研究には、インターネットとそのさまざまな技術が絶えず生み出している新しい種類の表現や、それらが書き言葉だけでなく話し言葉に及ぼす影響も含まれる。[2] インターネット言語のコミュニケーションスタイルは、以下のCMCチャネルで最もよく観察される。そこでは、伝送の時間差といった技術的制約を克服し、書かれたテキストではしばしば曖昧になる社会的手がかりを再確立しようとする試みがしばしば見られるからである。[9]

携帯電話

携帯電話は、基本的なコミュニケーション機能を超えた表現の可能性を持つ。これはガーディアンが開催したようなテキストメッセージ詩のコンテストに見ることができる。[2] 携帯電話が課す160字の制限は、それを克服するために利用者に言語的創造性を発揮させる動機を与えた。文字数制限を持つ新技術の同様の例がTwitterであり、280字の制限がある。利用者のツイートに導入されたこうした新しい省略形が「怠惰」なのか、それとも創造的なコミュニケーションの断片なのかについては議論があった。議論が続いているとはいえ、Twitterが新しい用語で言語的景観に貢献し、また新しい次元のコミュニケーションをもたらしたことは疑いない。[17]

携帯電話はまた、新しい文学ジャンル、すなわちケータイ小説を生み出した。典型的なケータイ小説はいくつかの章から成り、読者は短い分割配信としてダウンロードする。これらの小説は、伝統的な小説のような編集過程を経ないため「生」の形をとる。テキストメッセージに似た短い文で書かれる。[18] こうした小説の作者は、電子メールやオンラインのフィードバックチャネルを通じて、読者から感想や新しいアイデアを受け取ることもできる。伝統的な小説執筆とは異なり、読者のアイデアがストーリーに取り込まれることもあれば、作者が小説の需要や人気(通常はダウンロード数で測られる)に応じて筋書きを変えることを決める場合もある。[19] その人気にもかかわらず、これらの小説の「語彙の多様性の欠如」や貧弱な文法に関する批判もあった。[20]

ブログ

ブログの登場は日記を書く新しい方法をもたらした。言語学的観点からは、ブログで使われる言語は「その最も『裸の』形」[2]にあり、正式な編集過程を経ずに世界に向けて公開される。ほぼ他のすべての印刷された言語が何らかの編集や標準化を経ているため、これがブログを際立たせている。[21] デイヴィッド・クリスタルは、ブログを「書き言葉の進化における新しい段階の始まり」と述べた。[2] ブログは非常に人気を博し、フォトブログ、ビデオブログ、音声ブログ、モブログの登場とともに、書かれたブログを超えて拡大した。[22] こうしたインタラクティブなブログの発展は新しい言語的慣習やスタイルを生み出しており、今後さらに多くが現れると見込まれている。[21]

仮想世界

仮想世界は、利用者がこれらの新しい媒体内でのコミュニケーションのために自然言語の使用をどのように適応させているかについての知見を与える。テキストベースのチャットルームやコンピュータでシミュレートされた世界での利用者の相互作用を通じて生じたインターネット言語は、デジタル共同体内でのスラングの発展をもたらした。その例には「pwn」や「noob」がある。顔文字は、利用者がサイバースペースのコミュニケーションの制約に合わせてさまざまな表現を適応させてきたさらなる例であり、その一つが「情動性の喪失」である。[23]

マルチユーザードメイン(英語版)(MUD)のロールプレイングゲーム(RPG)や仮想世界といったニッチにおけるコミュニケーションは、速度、簡潔さ、自発性に重点を置いた、高度に双方向的なものである。その結果、CMCは一般により生き生きとし、変わりやすく、構造化されておらず、開かれている。会話の筋や短いターンのつながりには、しばしば複雑な連鎖や交換構造の組織が見られる。用いられるCMCの方策には、EMPHASISのような語の大文字化、*stress*のように語をアスタリスクで囲む使用、???!?!?!?のような句読点の創造的な使用などがある。[9] 記号はディスコース機能にも使われ、たとえばアスタリスクは会話修復の標識として、矢印やキャレットはダイクシスや指示対象の標識として用いられる。[24][25] 言語のこれら新しい形に貢献するほか、仮想世界は言語を教えるのにも使われている。仮想世界言語学習(英語版)は、学生に実生活環境のシミュレーションを提供し、言語技能を高める創造的な方法を見つけさせる。仮想世界は、若い学習者にとって、すでにそうした場所を「学び遊ぶ自然な場所」と見ているため、言語学習の良い道具である。[26]

電子メール

この観点のもとで研究される最も人気のあるインターネット関連技術の一つが電子メールであり、それは多くの点で言語の文体を拡張してきた。電子メールの言語的特徴に関する研究は、書式、文法、スタイルの点で話し言葉と書き言葉のスタイルの混成があることを示している。[27] 電子メールは、その利便性、速度、自発性のため、伝統的な手紙書きに急速に取って代わりつつある。[28] それは一時的に感じられ、簡単に削除できるため、しばしば非形式性と結びつけられる。しかし、この通信媒体が成熟するにつれ、電子メールはもはや友人や親戚の間で非形式的なメッセージを送ることに限られなくなった。むしろ、業務上のやり取りもますます電子メールで行われるようになっている。求職者も潜在的な雇用主に履歴書を送るのに電子メールを使っている。より形式的な用法へと向かう動きの結果、この媒体は形式的なものから非形式的なものまで幅広い文体を表すものとなる。[21]

電子メールは学生の文章における非形式的言語の使用増加の責を負わされてきたが、デイヴィッド・クリスタルは、電子メールは「言語教育にとって脅威ではない」と論じている。豊かな文体的表現力を備えた電子メールは、言語学習者が責任をもって自らの言語的選択を行う領域として機能しうるからである。さらに、若い世代の電子メール使用への高い傾向は、デジタル媒体を通じてであっても自分の考えを組み立てる努力ゆえに、彼らの文章力やコミュニケーション能力を向上させうる。[28]

インスタントメッセージ

他のオンラインコミュニケーションの形式と同様に、インスタントメッセージも独自の頭字語や短縮形を発展させてきた。しかしインスタントメッセージは、参加者が私的に会話しながらリアルタイムで互いに交流できる点で、電子メールやチャットグループとはかなり異なる。[29] インスタントメッセージでは、参加者間の親しさという次元が加わる。この親密さの高まりは、言語における非形式性や「表記上の特異性」を大きくする。参加者の年齢差が非常に大きいこともあるため、文体的変異の出現も多い。たとえば孫娘がインスタントメッセージで祖母と近況を語り合える。共通の関心で集まるチャットグループとは異なり、ここでは言語を合わせるという圧力がない。[21]

応用的観点

2020年の言語別インターネット利用者数(百万人)。[30]

  英語 (25.9%)
  中国語 (19.4%)
  スペイン語 (7.94%)
  アラビア語 (5.17%)
  ポルトガル語 (3.75%)
  マレー語 (4.32%)
  フランス語 (3.31%)
  日本語 (2.59%)
  ロシア語 (2.53%)
  ドイツ語 (2.03%)
  その他 (23.06%)

応用的観点は、インターネットの言語的活用を、そのコミュニケーション能力の良い面と悪い面の観点からとらえる。[1] インターネットは利用者が多言語主義を経験できるプラットフォームを提供する。英語は依然としてインターネット上で支配的に使われる言語であるが、他の言語も利用者数を徐々に増やしている。[9] 世界のインターネット利用のページは、言語、国籍、地理別のインターネット利用者数についての情報を提供している。より多くの言語共同体がインターネットに接続するにつれ、この多言語環境は多様性を増し続けている。したがってインターネットは、少数言語や危機言語が言語使用の復興や認識喚起を図りうるプラットフォームである。これは、これらの言語に二つの重要な点、すなわち言語記録と言語復興において前進の機会を提供する二つの事例に見ることができる。[1]

言語記録

第一に、インターネットは言語記録を促進する。音声や映像の記録といったメディアのデジタルアーカイブは、言語記録の保存に役立つだけでなく、インターネットを通じた世界的な普及も可能にする。[31] 危機言語についての広報は、言語記録への世界的な関心を刺激するのに役立ってきた。

アルカディアから資金提供を受けたハンス・ラウジング危機言語プロジェクト(HRELP)のような財団も、言語記録への関心を育てるのに役立っている。HRELPは、危機言語を記録し、記録資料を保存・普及させることなどを目指すプロジェクトである。収集された資料は、その危機言語アーカイブ(英語版)(ELAR)プログラムのもとでオンラインで利用可能になっている。

言語記録を支える他のオンライン資料には、危機言語に関する話題のニュースや記事を提供する Language Archive Newsletter がある。エスノローグのウェブ版も、世界の既知の現存するすべての言語の簡単な情報を提供している。危機言語や言語記録の資源や情報をインターネット上で利用可能にすることで、研究者はこれらの資料の上に構築でき、ひいては危機言語を保存できる。

言語復興

第二に、インターネットは言語復興を促進する。長年にわたり、デジタル環境は仮想的な接触を可能にするさまざまな洗練された形で発展してきた。電子メールからチャット、インスタントメッセージまで、これらの仮想環境はコミュニケーションを行う者の間の空間的距離を橋渡しするのに役立ってきた。電子メールの使用は、会議形式などのさまざまなスタイルで学生に会話させ、議論を生み出すために語学講座に取り入れられてきた。[32] 同様に、電子メールの使用は、母語が話されていない場所に移った少数言語の話者がインターネットを利用して家族や友人と連絡を取り、母語の使用を維持できるという意味で言語復興を促進する。Skypeのような電話ブロードバンド通信の発展と利用の増加により、インターネットを通じた言語復興はもはや読み書きのできる利用者に限られなくなった。[1]

ハワイの教育者は、言語復興プログラムでインターネットを利用してきた。[33] グラフィカルな電子掲示板システム Leoki(力強い声)は1994年に設立された。システムの内容、インターフェース、メニューはすべてハワイ語である。イマージョン・スクール・システム全体に導入され、電子メール、チャット、辞書、オンライン新聞などの要素を含む。Leokiシステムがまだ導入されていない大学などの高等教育機関では、教育者は Daedalus Interchange、電子メール、ウェブなど他のソフトウェアやインターネットツールを使って、ハワイ語の学生をより広い共同体とつなげている。[34]

インターネットの別の使い方には、少数言語の学生が遠くの読者に向けて自らの母語で母文化について書くことがある。また、言語と文化を守ろうとする試みとして、オック語の話者は世界中の他のオック語話者に手を伸ばすためにインターネットを利用してきた。これらの方法は、少数言語でコミュニケーションすることによって、その言語を使う理由を提供する。[35][36] さらに、若い世代が「かっこいい」と考えるデジタル技術の使用は、彼らを引きつけ、ひいては母語への関心と使用を維持させる。[1]

インターネットの悪用

インターネットはテロリズム、インターネット詐欺、児童に対するインターネット犯罪(英語版)といった活動にも悪用されうる。近年、匿名を保つのが比較的容易であることから、電子メールやInternet Relay Chat(IRC)などインターネットの使用が関わる犯罪が増加している。[37] こうした陰謀は安全と保護に関する懸念をもたらす。法言語学的観点からは、探究すべき潜在的領域が多くある。検索語のフィルタリングに基づくチャットルームの児童保護手続きの開発は有効であるが、この課題を助ける言語学的志向の文献はまだ乏しい。[1] 他の領域では、セマンティック・ウェブが個人のデータ保護のような課題に関与し、詐欺の防止に役立っていることが観察されている。[38]

諸側面

この節で扱う側面には、コーパスとしてのウェブの検討や、言語識別と正規化の問題が含まれる。日常生活へのインターネット言語学の影響は、インターネット文体の広がりと影響、インターネット上の言語変化の傾向、会話ディスコースのもとで検討される。

コーパスとしてのウェブ

ウェブがデータと資源の巨大な貯蔵庫であるため、言語科学者や技術者はますます言語データを求めてウェブに向かっている。[5] コーパスが計算言語学の分野で正式に言及されたのは、1989年のバンクーバーでのACL会議が最初であった。理論的な整合性を欠くとして多くの論争を呼び、この分野での役割に多くの懐疑を招いたが、[5] 1993年に学術誌『Using Large Corpora』が刊行されて[39]、計算言語学とコーパスの関係が広く受け入れられるようになった。[5]

ウェブがコーパスであるかどうかを確かめるには、マッケナリーとウィルソン(1996年、21頁)が確立した定義に立ち返る価値がある。[40]

原理的には、複数のテキストの集まりはいかなるものもコーパスと呼びうる。……しかし「コーパス」という用語は、現代言語学の文脈で用いられる場合、この単純な定義が示すよりも特定の含意を持つことが最も多い。それらは四つの主要な見出しのもとで考えることができる。すなわち、標本抽出と代表性、有限の大きさ、機械可読の形式、標準的な参照である。 — トニー・マッケナリーおよびアンドリュー・ウィルソン、Corpus Linguistics

コーパスとしてのウェブにより近く関連して、マニングとシュッツェ(1999年、120頁)[41]はこの定義をさらに簡潔にしている。

統計的NLP(自然言語処理)では、それがどう構成されているかについて何ら発言権を持たないまま、ある関心領域からある量のデータをコーパスとして受け取ることが一般的である。そうした場合、より多くの訓練データを持つことは、通常、バランスに関するどんな懸念よりも有用であり、利用可能なテキストをすべて使えばよい。 — クリストファー・マニングおよびヒンリッヒ・シュッツェ、Foundations of Statistical Language Processing

慎重に構成された検索エンジンのクエリのヒット数が、語義曖昧性解消エンジンへの入力として、語義の頻度の順位を特定するために用いられた。[42] この方法は、ローカル言語と主要言語に並行して存在する既存のウェブページをまとめる並行コーパスの概念の導入によってさらに探究された。[43] ある特定の言語による単一の文書から、その言語に固有のコーパスを構築することが可能であることが示された。[44]

テーマ

コーパスとしてのウェブという領域で起こりうる発展について、多くの議論がなされてきた。語義曖昧性解消のためのデータ源としてウェブを使う開発は、2002年のEU MEANINGプロジェクトで提起された。[45] それは、ある領域内では語がしばしば単一の意味を持ち、領域はウェブ上で識別可能であるという仮定を用いた。これは、Word Expert のウェブサイトで手作業による語義注釈を集めるためにウェブ技術を用いることによってさらに探究された。

言語モデルの領域では、ウェブはデータの疎性に対処するために用いられてきた。前置詞句の係り受けを解決するために語彙統計が集められ、[46] 一方でウェブ文書はコーパスのバランスを求めるために用いられた。[47]

情報検索の領域では、共同体のTREC評価イニシアチブの一構成要素としてWebトラックが統合された。この作業に用いられたウェブの標本は約100GBに達し、大部分は .gov トップレベルドメインの文書から成っていた。[48]

イギリス国立コーパス

イギリス国立コーパス(英語版)には、英語の中核をなす1万語について、支配的な意味と用法のパターンに関する豊富な情報が含まれている。

イギリス国立コーパスの語数(約1億)は、言語学者や辞書編集者が言語について学ぶための多くの経験的方策にとって十分であり、[5][49]、語の振る舞いに関する量的情報を入力として利用する技術(構文解析)にとって満足のいくものである。[50][51]

しかし他のいくつかの目的には、語の頻度のジップ的な性質の結果として不十分である。語彙ストックの大部分はイギリス国立コーパスで50回未満しか現れないため、そのような語について統計的に安定した結論を導くには不十分である。さらに、より稀な語、一般的な語の稀な意味、語の組み合わせについては、データが見つからない。研究者は、非常に大量のデータに基づく確率的言語モデルは、より小さく整理されたデータセットからの推定に基づくものよりも優れていることを見出している。[5]

多言語ウェブ

ウェブは早くも2013年には多言語コーパスとして明確に認識されていた。[52] インターネット上の言語・文化多様性観測所によれば、2024年時点で約750の言語がデジタルの符号化を持ち、2億の稼働中のウェブサイトによる推定500億のウェブページのうち、約20%が英語、19%が中国語で、以下スペイン語(7.7%)、ヒンディー語(3.8%)、ロシア語(3.7%)、アラビア語(3.7%)、フランス語(3.4%)、ポルトガル語(3.1%)と続く。同じ情報源は、言語族ごとにデータをまとめ、インターネットがこれまで存在した中で最も多言語的な領域であるという事実を強調する「言語のサイバー地理学」の数値にも言及している。今日、95%以上の人が第一言語または第二言語でインターネットと関わることができるが、既存の言語の90%は、主に少数言語や危機言語であり、デジタル上の存在を持たないままである。

課題

言語モデルの領域では、テキストの種類によって統計が異なるため、いかなる言語モデルの適用可能性にも限界がある。[53] 言語技術のアプリケーションが実際に使われる(新しいテキストの種類に適用される)とき、その言語モデルが訓練コーパスに適用されたときと同じように機能するかは定かでない。訓練コーパスが変わると、モデルの性能に相当の変動があることが分かっている。[54] この理論の類型の欠如は、言語モデリングの有用性の評価を制限する。

ウェブのテキストは(費用と時間の点で)容易に生成され、多くの異なる著者が手がけるため、しばしば正確さへの配慮が乏しくなる。文法上・表記上の誤りは「誤った」形式とみなされ、ウェブを汚れたコーパスにする。とはいえ、多少の雑音があっても依然として有用でありうる。[5]

下位言語を含めるべきかどうかの問題は未解決のままである。含めるべきだとする論者は、すべての下位言語を除くと言語の見方が貧弱になると主張する。言語は語彙、文法、そして多種多様な下位言語から成るため、それらを含めるべきだという。しかし、それが現実的な選択肢となったのはごく最近のことである。一部の下位言語を含めて中間をとることは、どれを含めどれを含めないかが恣意的な問題であるため、議論を呼ぶ。[5]

コーパスに何を含めるかの決定はコーパス開発者に委ねられ、それは実用主義的に行われてきた。[5] イギリス国立コーパスに用いられた要件と基準は、代表的であることに焦点を置く代わりにバランスがとれていることに焦点を置いて、汎用・一般言語コーパスの良いモデルとして役立つ。[55][5]

Googleのような検索エンジンは、ウェブとその幅広い言語資源にアクセスする既定の手段として役立つ。しかし、コーパスの分野で働く言語学者にとっては、いくつかの課題がある。これには、検索エンジンが提示する事例数の制限(最大1,000件または5,000件)、各事例の文脈の不足(Googleは約10語の断片を提供する)、(言語学的観点から)ゆがんだ基準に従って選ばれる結果(タイトルや見出しの検索語がしばしば上位を占める)、語の見出し形や語類といった言語学的基準に従って検索を指定できないこと、検索エンジンの負荷やその他多くの要因によって結果が変わる統計の信頼性の低さなどが含まれる。現時点では、異なる利害関係者間の優先順位の対立を考えると、最良の解決策は、言語学者自身がこれらの問題を修正しようと試みることである。それが、ウェブの豊かな潜在能力を活用する領域における多くの可能性を開くことにつながる。[5]

代表性

ウェブの巨大さにもかかわらず、それは依然として世界のすべての言語や領域を代表していないかもしれず、他のコーパスも同様である。しかし、非常に幅広い話題について多数の言語と言語型で書かれた膨大な量のテキストは、コーパス研究において多くの可能性を開く良い出発点となる。[5]

広がりと影響のインパクト

インターネット利用から生じる文体は、ニューメディアを超えて、映画、音楽、文学作品を含む(がこれらに限られない)他の領域やプラットフォームへと広がっている。大衆がこれらの作品に触れることで、標準的またはより形式的な言語形式では受け入れられないかもしれない特定のインターネット固有の言語スタイルが強化されるため、インターネット文体の浸透は重要である。

インターネットスラングのほか、文法上の誤りや表記上の誤りも、インターネットやその他のCMCチャネルにおける書き言葉の特徴である。インターネットの利用者がこれらの誤りに慣れるにつれ、それは書き言葉と話し言葉の両方の形で日常の言語使用へと徐々に浸透していく。[1] ニュース記事の誤植から、広告の文法上の誤り、さらにはドラマの台詞のインターネットスラングまで、マスメディア作品でそうした誤りを目にすることも一般的である。

インターネットが日常生活に組み込まれるほど、それが形式的な言語に与える影響は大きくなる。これは、スマートフォン、タブレット、ソーシャルメディアの使用を通じて、現代の言語技術(ランゲージアーツ)の授業で特に当てはまる。学生はかつてないほどインターネットの言語にさらされており、その結果、インターネットの文法構造やスラングが彼らの形式的な文章に染み出している。言語への完全な没入は、常にそれを学ぶ最良の方法である。マーク・レスターは著書『Teaching Grammar and Usage』で次のように述べている。「初級の書き手が誤りに対処するための成功する方策を身につけるうえで抱える最大の単一の問題は、単に形式的な書き言葉の英語に触れる機会の欠如である……外国語に広く触れることなくそれを習得することを学生に期待するのは、ばかげていると私たちは思うだろう。」[56] 学生はインターネット言語に没入しているため、それが彼らが映し出す形式と構造なのである。

加えて、インターネットの台頭と人々のそこへの全般的な没入は、日々公衆に影響を与える新しい波のインターネット・アクティビズムをもたらした。[57]

ミーム

「ミーム」という語の起源は、動物行動学者リチャード・ドーキンスにさかのぼる。彼はそれを「文化的伝達の単位、または模倣の単位という考えを伝える名詞」と説明した。[58] この語は後にデイヴィッド・ベスコウ、スメート・クマール、キャスリーン・カーリー(英語版)によってインターネットの領域に適応され、彼らはインターネット・ミームを「文化を伝えるあらゆるデジタル単位」と名づけた。[59] シフマンのインターネット・ミームの定義には、それが「(a) 内容、形式、および/または立場の共通の特徴を共有するデジタル項目の集団であり、(b) 互いを意識して作られ、(c) 多くの利用者によってインターネットを通じて流通・模倣・変形されたもの」という地位も含まれる。[60]

マスメディア

日常の言語使用へのインターネット文体の浸透を強めながら、テレビ広告がインターネットスラングを使う事例があった。たとえばアメリカ合衆国のシンギュラー・ワイヤレスの広告では、「BFF Jill」(「Best Friend Forever, Jill」の意)のような頭字語が使われた。より多くの人がインターネットや他のCMCプラットフォームを使って育つにつれ、彼らとよりよく関わりつながろうと、より多くの企業が広告でインターネットスラングを採用するようになった。[61] こうした広告は視聴者から比較的熱狂的な反応を受けた。[61]

インターネット用語の使用は音楽の領域にも広がっており、特にポピュラー音楽に顕著に見られる。最近の例はトレイ・ソングスの「LOL :-)」の歌詞で、多くのインターネット用語やTwitter・テキストメッセージへの言及を取り入れている。[62]

インターネット言語学の広がりは、商業映画とインディペンデント映画作家の双方によって作られる映画にも見られる。主に映画祭で上映されるが、インディペンデント映画のDVDは有料ライブストリーミングを含めインターネット上で購入できることが多く、映画へのアクセスを一般により容易にしている。[63] 商業映画が公共の映画館で上映されるというまさにその性質は、主流の大衆への広い露出を可能にし、インターネットスラングのより速く広い普及をもたらす。最新の商業映画は「LOL」(Laugh Out Loud または Laughing Out Loud の頭字語)と題され、マイリー・サイラスとデミ・ムーアが主演する。[64] この映画は、リサ・アズエロス(英語版)の2008年の人気フランス映画で同じく「LOL (Laughing Out Loud)」と題された作品の2011年のリメイクである。[65]

インターネットスラングの使用は英語に限られず、他の言語にも及ぶ。朝鮮語はスラングの形成に英語のアルファベットを取り入れており、また速い入力から生じる一般的な誤字から形成されたものもある。新しい韓国のインターネットスラング(英語版)は、2009年に公開された「天井を突き抜けろ」のようなメロドラマやコメディドラマといったテレビ番組によってさらに強化され、日常の言語使用に取り込まれている。

インターネットの言語学的将来

より大きなコンピュータ/インターネット媒介コミュニケーションシステムの登場に加え、より技術的に洗練された世界の新しい要求に応じて人々がすぐに適応することも相まって、利用者は新しいコミュニケーションの次元に合わせて言語使用を変える圧力のもとにあり続けると予想される。[5]

インターネット利用者の数が世界中で急速に増えるにつれ、利用者間の文化的背景、言語習慣、言語の違いが、はるかに速いペースでウェブに持ち込まれる。インターネット利用者間のこうした個人差は、特に多言語ウェブの側面において、インターネット言語学の将来に大きな影響を与えると予測されている。2000年から2010年にかけて見られたように、インターネットの普及は中国、インド、アフリカ諸国のような非英語圏で最大の成長を経験し、[66]、その結果、英語以外のより多くの言語がウェブに浸透している。

また、英語と他の言語との相互作用は、重要な研究領域になると予測されている。[67] 世界の利用者が互いに交流するにつれ、異なる言語への参照が増え続け、言語をまたぐ新しいインターネット文体の形成をもたらすかもしれない。中国語と朝鮮語はすでに英語の浸透を経験し、多言語のインターネット用語の形成に至っている。[68]

現状では、インターネットは少数言語のための教育や振興の一形態を提供している。しかし、言語間の相互作用が英語の中国語・朝鮮語への浸透をもたらし新しいスラングを形成したのと同様に、[68] 少数言語もインターネット上でより一般的に使われる言語(英語やスペイン語など)の影響を受ける。言語の相互作用は少数言語の本来の標準の喪失を引き起こしうるが、多数言語への親しみもまた、少数言語に悪影響を与えうる。[6] たとえば、少数言語を学ぼうとする利用者は、多数言語でそれについて読んで理解し、そこで止まることを選ぶかもしれず、その結果、少数言語の潜在的話者の増加ではなく喪失をもたらす。[69] また、少数言語の話者は、より多くの資源にアクセスするためにウェブで使われるより一般的な言語を学ぶよう促され、ひいては自らの言語の使用の減少につながるかもしれない。[70] インターネットの普及を踏まえた危機的少数言語の将来は、なお観察が待たれる。

関連項目

出典

参考文献

Related Articles

Timelines

Top Qs

Fact Checks