科学者たちは、歌詞付きの歌を聞くと読書の妨げになりやすいのと同じように、音声信号とテキスト信号が脳に入るときにいくつかの処理経路を共有することに長い間気づいていました。関連する探検は、100年以上前にある若者の偶然の発見にまで遡ることができます。
1874年、カール・ウェルニッケは有名な神経病理学者セオドア・マイナートのもとで学んでいました。彼は2人の奇妙な患者を記録した。彼らは何らかの言語障害を抱えているようでしたが、症状は典型的な表現性失語症とはまったく異なっていました。彼らは流暢に話したり書いたりすることができましたが、言葉はすべて意味不明でした。ウェルニッケは最終的に、現在では感覚失語症と呼ばれているこの症状が、側頭葉の後部と上部の脳損傷に起因すると結論付けた。患者の言語理解能力が破壊されるため、患者は自分が言ったことや書いたことを忘れてしまうことがよくあります。「何を言おうとしていたのだろう?」現代の科学者は、脳の活動を観察する過程で、ついに脳内に音声とテキストの「収束領域」が存在することを確認しました。これらの領域は、音声とテキストの両方の理解を担っています。 外国語の映画を見るとき、字幕を見ればスムーズに映画を見ることができます。ここでの字幕は音声翻訳技術を利用しており、ソース言語の音声をターゲット言語(母国語など)のテキストに翻訳します。 しかし、コンピューターにとって、音声とテキストは非常に異なる方法で表現されます。テキストは通常、数十個の記号で構成されているだけですが、音声は数百万個にも及ぶ連続した音の波形で構成されています。同じ言葉を発しても、誰が、どのような環境で、どのような状況で発するかによって、まったく違って聞こえることがあります。さらに、音声とテキストは異なる方法でエンコードされます。テキストの単語は語根と接辞で構成されています。スピーチは一連の形態素で構成され、強調とイントネーションによって補完されます。 人間にとって簡単なことでも、人工知能にとっては非常に難しい場合があります。テキストと音声の違いは非常に大きいため、テキスト処理の研究は実りある成果を上げている一方で、音声のパフォーマンスは大きく遅れをとっています。このギャップを埋めるには、私たちの脳と同じように、音声とテキストを均一に理解する必要があります。 現在、人工知能を研究する際には、解剖学や神経学からインスピレーションを得てモデルを最適化するようになり、人工知能はますます私たちに近づいてきています。 |
>>: 人工知能の時代では、女の子よりも男の子の方が失業する可能性が高いです!
翻訳者 |陳俊レビュー | Chonglou今日、人工知能ツール (AI) は非常に強力です。開発チ...
「ディープラーニングフレームワークは人工知能技術システムの真ん中にあり、下のチップと上のアプリケーシ...
過去 2 年間で、生成型人工知能 (GenAI) の出現により、産業プロセス分析に刺激的な新しい可能...
機械学習モデルは全部でいくつありますか?分かりません。誰も数えたことがありません。すべての変種を含め...
多くの小売業者にとって、2020年のコロナウイルスの流行は、その存続と運営に深刻な影響を及ぼしました...
家が施錠されていなければ、誰でも勝手に入ることができ、暗号化なしでデータを勝手に変更できてしまうと、...
[[349437]]導入機械学習/ディープラーニングは広大な研究分野です。まだ若い分野ではありませ...
この記事はLeiphone.comから転載したものです。転載する場合は、Leiphone.com公式...
最近、ワールドモデルという概念が大きな盛り上がりを見せており、自動運転の分野もただ黙って見ているわけ...
人工知能 (AI) とモノのインターネット (IoT) の統合により、技術革新と機能の新しい時代が到...
近年、サイバーセキュリティ業界では人工知能技術が話題になっています。セキュリティ オーケストレーショ...