Google: より多くのデータはより優れたアルゴリズムに勝ります!

Google: より多くのデータはより優れたアルゴリズムに勝ります!

Google が発表した新しい研究論文では、音声検索や YouTube 動画へのテキスト説明やタグの追加など、音声認識プログラムの背後にあるデータ サイエンスが詳しく説明されています。ほとんどの人はアルゴリズムを習得できませんが、その考え方は完全に理解できます。この論文の出発点は、人々がビッグデータに魅了される理由と、仕事に適したデータセットを選択することの重要性です。

Google は、データが多ければ多いほど良いと常に信じてきました。製品開発ディレクターの Peter Norvig 氏の言葉を借りれば、「データが多ければ多いほど、アルゴリズムが優れているよりも良い」のです。ノルヴィグの評価にはアルゴリズムに関する細かい指摘がまだ残っているものの、この論文を受け入れた人が増え、ビッグデータの分野で白熱した議論が巻き起こったことは明らかだ。モデルが学習するデータが増えるほど、たとえ最初は最も正確でなかったとしても、モデルの精度は高まります。

では、これ以上前置きせずに、音声認識システムの改善において、より多くのデータが果たす役割について見ていきましょう。研究者らは、データセットと大規模言語モデル(Google の開発に関わった n グラム モデルの Wikipedia による説明)により、最初の単語を受け取った後に次の単語を推測する際のエラー率を削減できることを発見しました。たとえば、Google の上級研究員は 10 月 31 日の研究に関するブログ投稿で次のような例を挙げています。「優れたモデルであれば、最初の 2 つの単語が「ニューヨーク」の場合、次の単語を推測する際に「グラノーラ」ではなく「ピザ」を選択する可能性が高くなります。」音声検索を行う際、彼のチームは、モデルのサイズが 2 桁増加するごとに、関係語のエラー率が 10% 減少することを発見しました。

ここで重要なのは、データセットの種類に関係なく、どのタイプのデータセットがモデルにとって有益であるかということです。検索テストでは、Google は google.com への匿名クエリのランダム サンプルを使用して、スペル修正に表示されなかった 230 語を検索しました。人間の話し方や書き方は通常の入力による検索方法とは異なるため、YouTube のモデルのデータはニュース レポートの録音や大規模な Web サイトからのスクレイピングから取得されます。 「純粋に言語モデル化の観点から言えば、トピックや話し方の多様性により、大規模なウェブクロールは言語モデル化に適した選択肢となる」と彼らは書いている。

この研究は必ずしも画期的なものではありませんが、ビッグデータとデータサイエンスが今日これほど注目を集めている理由を説明しています。消費者がよりスマートなアプリケーションとよりシームレスなユーザー エクスペリエンスを要求するにつれて、あらゆるデータの選択と各データに対応する分析ソリューションが間違いなく最優先事項になります。

<<:  ルーティングテーブルとルーター選択アルゴリズム

>>:  基本的なアルゴリズムについての簡単な説明: AVL ツリーとスプレイ ツリー (パート 3)

ブログ    

推薦する

あなたは統計学者になれますか?トランスフォーマーの強力な学習メカニズム「自動アルゴリズム選択」

ChatGPT などの大規模な Transformer ベースの言語モデルには、非常に強力なコンテ...

...

...

Googleは、ニュースコンテンツを作成するために生成AIツールを使用するためにいくつかの出版社と提携していると報じられている。

2月28日、Adweekは、Googleがいくつかの出版社と、ニュースコンテンツを作成するための新...

ヘルスケアに影響を与える5つのテクノロジートレンド

過去数年間、世界中の地域の医療システムは、他のほとんどの業界よりも大きな変化を遂げてきました。パンデ...

ディープラーニングの成果は収穫されようとしているのでしょうか? 11人の専門家がAIの現在(2018年)と未来(2019年)について語る

KDnuggets は、学界と産業界のさまざまな分野の機械学習と AI の専門家 11 名に相談し、...

...

...

Midjourneyに匹敵します!なぜミャオヤカメラは突然人気が出たのでしょうか?

編纂者:ユン・ジャオ、ワン・ルイピン、ノア「家族の写真がついに出てきました…」最近、ミャオヤカメラの...

...

ChatGPT を使用すると、わずか 3 時間で高品質の論文を書くことができます。

1. 論文のテーマと研究の方向性を決定するディスカッションと詳細化: ChatGPT で論文のトピ...

...

人工知能と機械学習における13の共通概念

[[422893]] 01 人工知能アラン・チューリングは人工知能を次のように定義しました。カーテン...

神々の中年の戦いが始まった。どの国内大型モデルが華山の頂上を勝ち取ることができるのか?

2023年も半ばを過ぎた現在、ビッグモデルは爆発後のメタバースのように冷めることなく、ますます活発...