科学者たちは、脳波を3%という低いエラー率で直接テキストに変換する「心を読む」方法を開発した。

科学者たちは、脳波を3%という低いエラー率で直接テキストに変換する「心を読む」方法を開発した。

この記事はLeiphone.comから転載したものです。転載する場合は、Leiphone.com公式サイトにアクセスして許可を申請してください。

カリフォルニア大学サンフランシスコ校の科学者たちは、被験者の脳波をリアルタイムで直接文章に翻訳できるアルゴリズムを訓練し、そのエラー率はわずか3%だった。

ネイチャー・ニューロサイエンス誌に掲載されたこの研究では、4人のボランティアを募集し、電極で脳の活動を記録しながら、30~50の決まった文章を複数回読むように依頼した。 [1]

[[320752]]

[Leifeng.com 注: 人間は脳についてほとんど何も知りません。画像ソース: Pixabay所有者: Gerd Altmann 】

このデータは機械学習アルゴリズムに入力され、各文の脳活動データが数字と文字列の列に変換されました。

次に、システムはこの脳活動データから音を推測し、実際に録音された音声と比較します。その後、数字と文字列がシステムにフィードバックされ、単語のシーケンスに変換されます。

最初、システムは意味をなさない文章を吐き出します。しかし、システムが各単語の並びを実際に声に出して話された文章と比較するにつれて、数字の並びが単語とどのように関連しているか、どの単語が文脈上関連しているかを学習し、システムは向上していった。

アルゴリズムは、機械翻訳と同様に、発話中の脳の活動から書かれたテキストを生成できるようになるまでトレーニングされます。

新しいシステムは以前の方法よりもはるかに正確です。正確さは人によって異なりましたが、あるボランティアの場合、平均して各文のわずか 3% に訂正が必要でした。これは速記者の 5% の単語誤り率よりも高い値です。

もちろん、このシステムには依然として大きな制限があり、アルゴリズムは少数の文しか処理できません。このシステムは、文章を声に出して話す人の脳の活動を記録することに依存しているため、話す能力を失った重度の障害を持つ患者には使用できません。

しかし、各ボランティアのトレーニングには 40 分もかからず、限られた小さなデータセットにもかかわらず、これまでで最高の精度を達成しました。

脳コンピューターインターフェース

人間の脳信号から外部デバイスへの接続経路を確立することは新しいことではなく、脳コンピューターインターフェースの研究は 30 年にわたって行われてきました。

[[320753]]

[Leifeng.com 注記: 脳コンピューターインターフェースは、30 年近くにわたって研究のホットスポットとなっています。画像ソース: Pixabay所有者: aytuguluturk 】

過去 10 年間、音声信号の解読は可能でしたが、分離された音素または単音節のみであり、100 語の連続音声の場合、正しく解読される語は 40% 未満でした。

今回、科学者たちは、機械翻訳に似たアルゴリズムを採用するという、より直接的な方法を発見しました。機械翻訳は、ある言語から別の言語へのテキストのアルゴリズム翻訳ですが、今回は入力テキストが脳波信号になる点が異なります。今回発表された論文「エンコーダー・デコーダーフレームワークを使用した皮質活動のテキストへの機械翻訳」では、このプロセスについて詳しく説明しています。

システムをあるボランティアで訓練した後、別のボランティアで訓練したところ、解読結果が向上した。これは、この技術が人々の間で移転可能であることを示唆している。

論文に対応するコードは GitHub に置かれています。

ニューラルデータから音声をテキストにデコードするための ecog2txt モジュール。トピック間の転移学習の高度な機能を Python コードで実装します。 [2]

[Leifeng.com 注記: ecog2txt は、この論文に対応するオープンソース実装モジュールです]

トレーニング自体は、TensorFlow でシーケンス間ネットワークを実装する別の machine_learning パッケージを介して実行されます。 [3]

ソフトウェア パッケージは、現在 UCSF 統合神経科学センターの研究科学者である共著者の Joseph Makin 博士によって作成されました。彼の専攻は電気工学とコンピュータサイエンスで、脳コンピュータインターフェースのアルゴリズム開発を含む制御理論を専門としています。 [4]

[[320754]]

[Leifeng.com 注記: 上の写真は張愛徳博士です]

この論文のもう一人の共著者は、てんかん、脳腫瘍、三叉神経痛、片側顔面けいれん、運動障害を患う成人の治療を専門とする脳神経外科医のエドワード・チャン医学博士である。彼は現在、UCSF ワイル神経科学研究所の脳神経外科教授であり、麻痺や言語障害などの神経疾患患者の機能を回復させるための神経工学および補綴センターも指揮しています。 [5]

ユーザーコメント

科学者たちはかつて、脳の信号を理解可能な音声に変換するには数十年かかると考えていたが、現在ではその期間は数年単位で測定できる。 Redditの科学セクションでは、このニュースに3万件以上の「いいね!」と数千件のコメントが寄せられた。 [6]

ネットユーザーのderlumpenhundは、これは思考読み取りマシンが発明されたことを意味するものではないとコメントした。これは、口と舌の動きに対応する大脳皮質の活動を解読することに大きく依存しており、特定のトピックに関するデータの収集と事前のトレーニングが必要です。思考活動を直接解読するものではありません。そうは言っても、この発展は注目に値する。

ネットユーザーのboointhehouseさんは、この技術がもっと早くスティーブン・ホーキング博士に使われていれば、彼は生涯でもっと多くの研究を成し遂げることができただろうと語った。

<<:  もう学べないの? MIT CSおよびEEオンラインコースが利用可能になりました

>>:  5Gが普及しつつある中、人工知能は「取り残される」ことになるのか?

ブログ    
ブログ    
ブログ    

推薦する

2021年に最も役立つ顔認識ソフトウェア9選をチェック

この記事は公開アカウント「Reading Core Technique」(ID: AI_Discov...

人工知能市場の収益は今年1560億ドルに達する見込み

調査によると、人工知能(AI)ソリューションは現在急速に成長している市場であり、2020年までに1,...

【ビッグネームが勢揃い、第1話】新小売時代のスマートミドルプラットフォーム

小売業界は急速に進化しています。フロントエンドの入り口とバックエンドのテクノロジーは、変革のたびに絶...

ITリーダーはAIパワーの変化する需要とトレードオフを乗り切る

2023 年は世界中の IT 部門に多くの変化をもたらしました。これまでのところ、最大の驚きは Ge...

...

プリンストン大学とインテルは、ResNetよりも大幅に高速で正確なParNetを提案している。

[[434088]]深さはディープ ニューラル ネットワークの鍵となりますが、深さが増すと、順次計...

Python で機械学習を簡単に

ナイーブ ベイズ分類器を使用して、現実世界の機械学習の問題を解決します。ナイーブベイズナイーブベイズ...

研究者はAIを活用して新型コロナウイルスの理解を深める

[[319373]]新型コロナウイルスが昨年12月に中国・武漢で発生して以来、過去数か月間に2,00...

...

製造業の変革を促進、産業改革のためのAI主導ソリューション

製造業において、インダストリー 4.0 は単なる流行語ではなく、新たな現実となっています。新型コロナ...

ロボットは「赤ちゃんを作る」こともできる:世界初の生きたロボットが生命の新たな繁殖方法を生み出す

[[437620]]彼らは何百もの自由細胞を集めて、「パックマン」の形をした「口」の中に「次世代」を...

ステップバイステップ | ニューラルネットワーク初心者ガイド

[[252981]]ビッグデータダイジェスト制作編纂者:李磊、大潔瓊、雲周過去数年間にブラウザを開い...

クラウド コンピューティングの 10 年間のベテランが、ディープラーニング手法をゼロから始める

[[206505]]人工知能は現在、熱く議論されている業界であり、ディープラーニングは最もホットな、...

李開復、胡宇、張亜琴の GMIC 2018 対談: AI 戦略と AI 人材育成における中国と米国の違いは何ですか?

[[227402]]人工知能が急成長を遂げている現在、AI人材の不足は中国だけでなく、世界全体が直...

Microsoft は、全二重音声インタラクションにおいて画期的な進歩を達成しました。ロボットは本当に「人間」になる

マイクロソフト(アジア)インターネットエンジニアリングアカデミーは、新世代の音声インタラクション技術...