最先端技術の共有:脳の信号を音声に変換するAIアルゴリズムは、失語症の人が正常に話すことを助けることが期待されています

最先端技術の共有:脳の信号を音声に変換するAIアルゴリズムは、失語症の人が正常に話すことを助けることが期待されています

カリフォルニア大学サンフランシスコ校の神経科学者チームは、ネイチャー誌に最近発表した研究で、脳の活動に基づいて自然な音声を合成できるニューラルデコーダーを紹介した。

この研究は、チャン研究室の言語科学者ゴパラ・アヌマンチパリ氏と生物工学大学院生ジョシュ・シャルティエ氏が主導した。これは、カリフォルニア大学の脳神経外科教授エドワード・チャン氏の研究室で開発されている。

なぜこのニューラルデコーダーを導入するのでしょうか?

多くの人が、脳卒中、外傷性脳損傷、またはパーキンソン病、多発性硬化症、筋萎縮性側索硬化症などの神経変性疾患により、話す能力を失います。

現在、非常に微細な目や顔の筋肉の動きを追跡する補助装置により、重度の発話障害を持つ人々が自分の考えを一語一語表現することが可能になっています。しかし、このようなデバイスを使用してテキストや合成音声を生成するのは、時間がかかり、手間がかかり、エラーが発生しやすいことがよくあります。これらのデバイスのもう 1 つの制限は、1 分間に最大 10 語しか生成できないことです。

この研究は、脳の活動によって制御できる人の声の合成バージョンを生成することが可能であることを示しています。研究者たちは、将来この装置を使って重度の言語障害を持つ人々が流暢にコミュニケーションできるようになるかもしれないと考えている。人間の声の「音楽性」の一部を再現し、話者の感情や個性を表現することもできます。

「この研究は、個人の脳活動に基づいて完全な音声文章を生成できることを示している」とチャン氏は語った。 「これは、すでに手の届く範囲にある技術を使って、言語障害を持つ患者に臨床的に実現可能なデバイスを構築できるはずであるという、エキサイティングな原理実証です。」

システムはどのように機能しますか?

この研究は、ジョシュ・シャルティエとゴパラ・K・アヌマンチパリによる別の研究に基づいており、その研究では、脳内の発声中枢が唇、顎、舌、その他の発声器官の動きを調整して滑らかな発声を生み出す仕組みが示されています。

新しい研究では、アヌマンチパリ氏とシャルティエ氏は5人の患者にいくつかの文章を声に出して読むように依頼した。これらの患者は、脳神経外科手術に備えて発作の原因を特定するために脳に電極を埋め込まれます。同時に、研究者たちは言語生成に関与することが知られている脳領域の活動を記録しました。

研究者たちは、ボランティアの声の録音を使用して、これらの音を出すために必要な声道の動きを理解しました。科学者たちは、この詳細な発声解剖図を使って、脳の活動によって制御できる現実的な仮想発声器官を各ボランティアのために作成した。

このシステムは 2 つのニューラル ネットワークで構成されています。

  • 発話中に生成される脳活動のパターンを仮想声道の動きに変換するデコーダー。
  • シンセサイザーを使用して、これらの声道の動きをボランティアの声の合成近似値に変換します。

研究者たちは、このシステムがボランティアの脳活動から直接解読した音声よりも大幅に優れた合成音声を生成したことを観察した。

このシステムはまだ初期段階です。シャルティエ氏は、その限界について次のように説明しています。「話し言葉を完全に模倣するには、まだ道のりが長いです。『sh』や『z』のようなゆっくりした音声を合成したり、音声のリズムやイントネーション、話し手の性別やアイデンティティを維持したりするのは得意ですが、『b』や『p』のような急激な音声は、少し不明瞭になります。それでも、ここで実現した精度レベルは、現在利用可能なものと比較して、リアルタイム通信の驚くべき改善となるでしょう。」

<<:  もうひとつ:なぜ消費者向けロボット企業は失敗しているのか?

>>:  12倍に増加しました!香港バプティスト大学とMassGridが低帯域幅で効率的なAIトレーニングのための新しいアルゴリズムをリリース

ブログ    
ブログ    

推薦する

...

...

「公平性」、人工知能はこれを達成できるのか?

2020年の東京オリンピックはこれまで以上に盛り上がっています。 7月28日に行われた男子体操個人...

人工知能アプリケーションのための6つの主要技術、ついに誰かがわかりやすく説明

[[338620]]画像はPexelsよりこの記事はWeChatの公開アカウント「Big Data ...

多くの銀行は顔認識の安全性を確保する方法について警告を発している。

11月28日、北京ビジネスデイリーの記者は、今年初めから、平安銀行、中国光大銀行、綿陽市商業銀行、...

人工知能とモノのインターネット (AIoT) を組み合わせた場合の威力とは?

モノのインターネット (IoT) や人工知能 (AI) について聞いたことがあると思います。しかし、...

人工知能が高等教育を支援する:変化と持続

[[434825]]人工知能が教育に浸透する中で、我々は「静をもって動を制御する」という決意を持ち、...

ドローン配送の価値は強調されていますが、完全に普及するには何が欠けているのでしょうか?

現在、飛行制御、ナビゲーション、通信などのさまざまな技術が継続的に進歩しており、ドローンの開発はます...

初期の携帯電話で使用されていたGPRS暗号化アルゴリズムが意図的に弱められていたことが明らかになった。

[[406364]]ヨーロッパの複数の大学の研究者チームが論文の中で、初期の携帯電話で使用されてい...

統合はテクノロジー分野で強力なトレンドとなるだろう

人工知能、エッジ コンピューティング、移動中のデータの統合は、業界を変革し、コンピューティング シス...

...

...

AIが高収入の仕事を生み出すと同時に仕事を代替できる理由

自動化、特に人工知能とロボット工学の進歩が、今日の労働者にとって問題となるかどうか。この議論は毎日繰...

1300億のパラメータを持つ中国初の大規模数学モデルMathGPTがリリースされました!複数のベンチマークがGPT-4を上回る

数学的 AI ビッグモデルはこの分野の将来を変える可能性があります。本日、中国初の兆スケール数学モデ...