Google は、AI 言語モデルの自己修正機能の向上を支援する BIG-Bench Mistake データセットをリリースしました。

Google は、AI 言語モデルの自己修正機能の向上を支援する BIG-Bench Mistake データセットをリリースしました。

IT Homeは1月15日、Google Researchが最近、独自のBIG-Benchベンチマークテストを使用して「BIG-Bench Mistake」データセットを確立し、関連データセットを使用して市場で人気のある言語モデルの「エラー確率」と「エラー修正能力」に関する一連の評価研究を実施したと報じた。

Googleの研究者らは、これまで大規模言語モデルの「エラー確率」や「自己修正能力」を評価できるデータセットがなかったため、評価テスト用に「BIG-Bench Mistake」という専用のベンチマークデータセットを作成したという。

研究者らはまず、PaLM言語モデルを使用して独自のBIG-Benchベンチマークタスクで5つのタスクを実行し、次に生成された「思考の連鎖」の軌跡を修正して「論理エラー」部分を追加し、それをモデルに戻して思考の連鎖の軌跡のどこにエラーがあったかを判断したと報告されています。

データセットの精度を向上させるために、Google の研究者は上記のプロセスを繰り返し実行し、最終的に「255 個の論理エラー」を含む「BIG-Bench Mistake」と呼ばれる専用のベンチマーク データセットを作成しました。

研究者らは、「BIG-Bench Mistake」データセットの論理エラーは比較的「単純かつ明確」であるため、言語モデルが単純な論理エラーから練習を開始し、エラーを識別する能力を徐々に向上させるのに役立つ優れたテスト標準として使用できると述べています。

研究者らはデータセットを使用して市場のモデルをテストし、言語モデルの大部分は推論中に発生する論理エラーを識別して自己修正できるものの、このプロセスは「理想的ではない」ため、モデル出力のコンテンツを修正するには通常、人間の介入が必要であることを発見しました。

▲ 画像出典: Google Research プレスリリース

IT Homeはレポートから、Googleが「現時点で最も先進的な大規模言語モデル」と主張するものの自己修正能力も比較的限られていることを発見した。関連するテスト結果で最も優れたパフォーマンスを示したモデルは、論理エラーの52.9%しか見つけられなかった

Google の研究者らは、この BIG-Bench Mistake データセットはモデルの自己修正能力の向上にも役立つと主張している。関連するテスト タスクでモデルを微調整した後、「通常、小さなモデルでも、サンプル プロンプトがゼロの大きなモデルよりもパフォーマンスが向上します。」

これを踏まえて、Googleは、モデルのエラー修正という点では、独自の小さなモデルを使って大きなモデルを「監督」できると考えています。大きな言語モデルに「自身のエラーを修正」することを学習させるのに比べて、大きなモデルの監督専用の小さな専用モデルを展開することは、効率の向上、関連するAI展開コストの削減、微調整の容易化につながります

<<:  ソフトウェア開発者ガイド: 独自のデータで ChatGPT をトレーニングする

>>:  インテリジェントな変革の時代を迎える: AIでビジネスの未来をリードする

ブログ    
ブログ    
ブログ    
ブログ    

推薦する

2022年秋の採用戦争:アルゴリズム職は混み合い、Java開発も後退を余儀なくされる

[[411043]]コンピュータサイエンスの卒業生にとって、アルゴリズム関連の職は基本的に「高給」と...

機械学習を妨害する10のサイバー攻撃

サーセイ・ラニスターの策略やサー・ジョラー・モーモントの父親のような保護をもってしても、攻撃者が H...

...

米国版「テンセントがアプリのアップデートを停止」、米国が「AIアルゴリズム」を法制化、未審査の公開を禁止

数日前、テンセントの製品に違反があり、合計4回に分けて報告されました。工業情報化部はテンセントに対し...

人工知能がリスク管理分野に参入すると、生身の人間は職を失うことになるのでしょうか?

スティーブ・ジョブズの「電話の再発明」は携帯電話を再定義しただけでなく、世界を変え、人類をモバイルイ...

ドローンの応用シナリオに関する簡単な説明

技術の発展に伴い、ドローンの応用シナリオは絶えず拡大しています。ドローンが様々な業界で活用されている...

今後の企業イノベーションを牽引する10の優れたテクノロジー

エンタープライズ テクノロジーの将来は、業界を変えるほどの大きな革新をもたらすでしょう。 5G から...

PyTorch がなぜ人気があるのでしょうか?創業者スーミスが成長の秘訣を語る

PyTorch は、ディープラーニング分野で最も人気のあるフレームワークの 1 つです。最初のバージ...

人工知能がウェブホスティング業界に優位性をもたらす

近年、ウェブホスティング業界は劇的に変化しました。そして、業界を永遠に変える可能性のあるいくつかのト...

速報です! OpenAIがByteDanceアカウントを禁止!コンテンツ生成のための GPT の不正使用に関する内部告発

ノアが編集海外メディアのザ・ヴァージは北京時間今朝未明、生成AIをめぐる熾烈な競争の中で、バイトダン...

あらゆる人間の声を再現できるAI技術

ポッドキャスト業界は、よりリラックスした、自然でカジュアルなオーディオストーリーテリングへと移行して...

機械学習の再考: 人工知能はどのようにして「記憶を失う」ことを学ぶのか?

この記事はLeiphone.comから転載したものです。転載する場合は、Leiphone.com公式...

AISpeechは多角的な視点からAIエコロジカルバリアを構築し、AIチップはラストマイルを切り開く

最近、シビチェンがチップスを製造しているというニュースが大きな騒ぎを引き起こしました。 [[2547...

OpenAIの年間収益は13億ドルに達し、月間1億ドル以上となり、夏に比べて30%増加した。

10月13日、The Informationは現地時間12日、複数の関係者の話として、OpenAI...

金融ロボットの解読:毒ではなくアシスタント

[[231414]]会計、税務、監査などの業務でロボットが人間に取って代わったらどうなるか想像してみ...