エア入力方式！浙江大学の最新研究：空中で指を動かすことでスマートウォッチにテキストを入力できる

この記事はAI新メディアQuantum Bit（公開アカウントID：QbitAI）より許可を得て転載しています。転載の際は出典元にご連絡ください。

多くの人が日常生活でスマートウォッチを使用しており、テキスト入力は音声、タイピング、手書きのいずれかに依存しています。

[[442637]]

しかし、時には話すことができないかもしれませんし、このような小さな画面でキーボードを打つのが少し「窮屈」に感じるかもしれません。

ではどうすればいいでしょうか?

「エアタイピング」法を試してみるのもいいかもしれません。

浙江大学はAirTextというアプリケーションを開発した。指と手首を動かすだけで、時計が空中の文字を3.9%という低いエラー率で認識する。

スペル入力を高速化するための連想機能や推奨機能も搭載しています。

スマートウォッチに「エアタイピング」機能を搭載

AirText の開発における大きな課題は、手首の動きと指先のスペリングの動きの対応を理解させることでした。

下の図に示すように、文字を綴るときの手首の軌道は、通常の文字を綴るときとはまったく異なります。

これを実現するために、研究チームはまず、赤外線センサーを使用してジェスチャーを追跡できる市販のツール「Leap Motion」を使用しました。

その後、8人のボランティアが5つの異なるスマートウォッチを使用して25,000以上の文字を綴り、Leap Motionが関連する手首と指の動きのデータを収集しました。

その後、データはニューラルネットワークモデルに入力されてトレーニングされ、最終的に AirText はユーザーの手首の動きのわずかな変化に基づいて指先の軌道を推測できるようになります。

推定された軌跡は、スマートウォッチのみを使用して、対応する文字として効率的かつ正確に認識できます。

スペル入力を高速化するために、単語予測機能と推奨機能もシステムに搭載しました。

予測された単語は時計の画面の 4 方向に表示されます。時計を上下左右に傾けて選択できます (時計を振るとバックスペースが使えます)。

単語誤り率は3.9%でした

まず、AirTextの精度テストを見てみましょう。

測定指標はWER （Word Error Rate）で、誤った単語を正しく認識された単語に変換して計算されます。

誤った単語には、欠落している単語（I で示され、正しいスペルに校正するときに挿入する必要がある単語の数）、余分な単語（D で示され、削除する必要がある単語の数）、および誤った単語（S で示され、置き換える必要がある単語の数）の 3 種類があります。

AirText を 2 つのベースラインメソッド (IMU-CNN と BLSTM) と比較すると、AirText は最終的に最低スコアを達成し、最高の精度を示しました。

3つの平均スコアはそれぞれ3.9%、30.9%、57.1%でした。

上記は単一ユーザー、単一デバイスでの評価結果です。

より正確にするために、複数のユーザーと複数のデバイスもテストされ、結果は次のとおりです。

左の図では、同じユーザーが 5 つの異なるスマートウォッチを使用して AirText をテストし、それぞれ 8.3%、7.5%、6.5%、7.7%、3.9% の精度スコアを取得しました。

研究者らは、7%のWERは平均して15語ごとに1つの認識エラーがあることを意味し、これはエアライティングでは許容範囲内であると述べた。

右の図では、8 人の異なるユーザーが同じ時計を使用して、11.2%、5.9%、4.3%、4.0%、3.6%、5.9%、4.7%、3.9% の WER を取得しました。

このことから、デバイスの違いよりもユーザーの違いの方が精度に大きな影響を与えることがわかります。

しかし研究者らは、モデル更新コンポーネントの助けにより、AirTex はさまざまなユーザーに対して依然として高い精度を達成できると述べています。

次に速度テストを行います。

BLSTM ベースラインの WER は約 57% でエラー率が高すぎるため、研究者は AirText と IMU-CNN の速度のみを比較しました。

測定指標はWPM（1分あたりの単語数）で、入力した単語の総数を誤った単語の数/時間で割って算出されます。

その結果、AirText は平均 8.1 WPM を達成しましたが、IMU-CNN ベースラインはわずか 4.6 WPM しか達成しませんでした。

研究者らは、この入力速度は両手タッチスクリーンベースのテキスト入力方法（実際のアプリケーションではこれらの方法は 9.1 WPM と 9.8 WPM である）に匹敵すると指摘した。

全体的に、AirText の精度は良好ですが、速度を改善する必要があります。

遅くなる主な理由は、各文字を入力した後、しばらく一時停止する必要があることです。

研究者たちはそれを解読する方法を研究しており、最終的にはAirTextを商品化することに関心を示している。

著者について

浙江大学コンピュータサイエンス学部の助教授である Gao Yi 氏は、浙江大学で博士号を取得しました。彼の研究分野には、組み込みソフトウェア、ワイヤレスおよびモバイルコンピューティング、センサーネットワーク、サイバーフィジカルシステムなどがあります。

責任著者は浙江大学コンピュータサイエンス学部の准教授兼博士課程指導者である Dong Wei です。彼は浙江大学で博士号も取得しています。彼の研究対象は、モノのインターネットシステムとネットワーク、エッジコンピューティング、ワイヤレスコンピューティングとモバイルコンピューティングです。

Google Scholar の引用数は合計 3,000 件を超えます。

論文の宛先:
https://ieeexplore.ieee.org/document/9625777

<<: リバースエンジニアリングの後、Transformer は数学的なフレームワークに「変換」します | 25 人の学者が記事を執筆しました

>>: ロボティックプロセスオートメーション (RPA) を構築するための基本知識とベストプラクティス

エア入力方式！浙江大学の最新研究：空中で指を動かすことでスマートウォッチにテキストを入力できる

スマートウォッチに「エアタイピング」機能を搭載

単語誤り率は3.9%でした

著者について

ICLR 2020 におけるナレッジグラフ研究の包括的な概要

「AI Beanプロジェクト」は、人工知能を活用して、故郷の貧しい女性たちに雇用機会を創出し、彼女たちが仕事と子育てを同時に行えるようにするプロジェクトです。

2024年に向けて誰もが準備すべきAIトレンドトップ10

ベースラインモデルから始めます。最初はモデルが醜く見えるかもしれませんが、心配しないでください。

AIが材料科学を覆す！ディープマインドの主要な研究がネイチャー誌に掲載され、220万の結晶構造を予測し、人類より800年も先を行く

無料ですか?寄生？ ChatGPTに夢中です！

ヤン・ルカン：私は畳み込みニューラルネットワークの父ですが、その特許にも縛られてきました

アリババ機械知能チームの3年間の取り組みの概要

2020 年に爆発的に増加する 9 つの AI マーケティングトレンド

推薦する

おそらく2030年までに、量子コンピューティングのChatGPTの瞬間が到来するだろう

人工知能は暗記学習を「終わらせる」ことはない

Twitterはボットアカウントのラベルをテスト中

生成AI投資分析：テック大手はベンチャーキャピタルよりも積極的であり、コンピューティングパワーの支出は起業のハードルを押し上げる

今後5年間の産業AIの8つの主要な発展トレンド

文勝ビデオの次の目的地であるメタはすでにビデオ制作を開始している

OpenAI Microsoftが訴えられる！ニューヨークタイムズはAIが著作権を侵害していると非難し、侵害モデルとトレーニングデータの破棄を要求している。

ソニーはプレイヤーの感情を感知できるコンパニオンロボットを開発中

ビッグデータ処理における人工知能の活用方法

OpenAIがMicrosoftに反旗を翻す！アルトマン氏が「ChatGPTのカスタマイズ」を企む。AI市場の未来はまた変わるのか？

AIと新技術が商業用不動産投資に革命を起こす

YouTube 動画推奨アルゴリズムを破る方法

今年のAI論文は8つの分野でブレークスルーを達成。ビデオブロガーが最も好まれ、国境を越えた出力が非常に流行している。