科学者たちは、歌詞付きの歌を聞くと読書の妨げになりやすいのと同じように、音声信号とテキスト信号が脳に入るときにいくつかの処理経路を共有することに長い間気づいていました。関連する探検は、100年以上前にある若者の偶然の発見にまで遡ることができます。
1874年、カール・ウェルニッケは有名な神経病理学者セオドア・マイナートのもとで学んでいました。彼は2人の奇妙な患者を記録した。彼らは何らかの言語障害を抱えているようでしたが、症状は典型的な表現性失語症とはまったく異なっていました。彼らは流暢に話したり書いたりすることができましたが、言葉はすべて意味不明でした。ウェルニッケは最終的に、現在では感覚失語症と呼ばれているこの症状が、側頭葉の後部と上部の脳損傷に起因すると結論付けた。患者の言語理解能力が破壊されるため、患者は自分が言ったことや書いたことを忘れてしまうことがよくあります。「何を言おうとしていたのだろう?」現代の科学者は、脳の活動を観察する過程で、ついに脳内に音声とテキストの「収束領域」が存在することを確認しました。これらの領域は、音声とテキストの両方の理解を担っています。 外国語の映画を見るとき、字幕を見ればスムーズに映画を見ることができます。ここでの字幕は音声翻訳技術を利用しており、ソース言語の音声をターゲット言語(母国語など)のテキストに翻訳します。 しかし、コンピューターにとって、音声とテキストは非常に異なる方法で表現されます。テキストは通常、数十個の記号で構成されているだけですが、音声は数百万個にも及ぶ連続した音の波形で構成されています。同じ言葉を発しても、誰が、どのような環境で、どのような状況で発するかによって、まったく違って聞こえることがあります。さらに、音声とテキストは異なる方法でエンコードされます。テキストの単語は語根と接辞で構成されています。スピーチは一連の形態素で構成され、強調とイントネーションによって補完されます。 人間にとって簡単なことでも、人工知能にとっては非常に難しい場合があります。テキストと音声の違いは非常に大きいため、テキスト処理の研究は実りある成果を上げている一方で、音声のパフォーマンスは大きく遅れをとっています。このギャップを埋めるには、私たちの脳と同じように、音声とテキストを均一に理解する必要があります。 現在、人工知能を研究する際には、解剖学や神経学からインスピレーションを得てモデルを最適化するようになり、人工知能はますます私たちに近づいてきています。 |
>>: 人工知能の時代では、女の子よりも男の子の方が失業する可能性が高いです!
私たちは「技術の爆発」と「共有とオープンソース」の時代に生きています。先進技術の更新と反復の速度は、...
2018 年は人工知能と機械学習にとって「収穫」の年でした。特にヘルスケア、金融、音声認識、拡張現実...
この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...
5月15日、世界有数のIoTロック企業であるnokelockの製品発表会が北京金宇シェラトンホテルで...
[[404642]]この記事はWeChatの公開アカウント「roseduanの執筆場所」から転載した...
この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...
GPT や DALL-E などの大規模な生成モデルが自然言語処理やコンピューター ビジョンの研究に革...
機械学習モデルのトレーニングは通常、一連の入力機能と出力ターゲット間のマッピングを学習することによっ...
人工知能 (AI) と機械学習 (ML) のテクノロジーは、サイバーセキュリティを含め、今や私たちの...
自然言語処理は、人工知能研究における中心的な課題の 1 つです。最近、Salesforceによる買収...
この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...
量子力学の基本方程式の一つとして、シュレーディンガー方程式は常に幅広い注目を集めてきました。昨年、D...