GPT-3.5 を選択すべきでしょうか、それとも Llama 2 などのオープンソース モデルを微調整すべきでしょうか?総合的に比較した結果、答えは

GPT-3.5 を選択すべきでしょうか、それとも Llama 2 などのオープンソース モデルを微調整すべきでしょうか?総合的に比較した結果、答えは

GPT-3.5 の微調整には非常にコストがかかることはよく知られています。この論文では、手動で微調整されたモデルが、わずかなコストで GPT-3.5 のパフォーマンスに近づくことができるかどうかを実験的に検証します。興味深いことに、この記事はまさにそれを行っています。

この論文では、SQL タスクと機能表現タスクの結果を比較して、次のことがわかりました。

  • GPT-3.5 は、両方のデータセット (Spider データセットと Viggo 機能表現データセットのサブセット) で、Lora で微調整された Code Llama 34B よりもわずかに優れたパフォーマンスを発揮します。
  • GPT-3.5 はトレーニングに 4 ~ 6 倍のコストがかかり、展開にもコストがかかります。

この実験の結論の 1 つは、GPT-3.5 の微調整は初期検証作業には適しているが、その後は Llama 2 のようなモデルが最適な選択肢になる可能性があるということです。簡単にまとめると、

  • 特定のタスク/データセットに対して微調整が適切なアプローチであることを検証する場合、または完全に管理された環境が必要な場合は、GPT-3.5 を微調整します。
  • コストを節約したい場合、データセットから最大限のパフォーマンスを引き出したい場合、トレーニングおよびデプロイメント インフラストラクチャの柔軟性を高めたい場合、または一部のデータを非公開にしたい場合は、Llama 2 などのオープン ソース モデルを微調整してください。

次に、この記事がどのように実装されているかを見てみましょう。

下の図は、SQL タスクと機能表現タスクで収束するようにトレーニングされた Code Llama 34B と GPT-3.5 のパフォーマンスを示しています。結果は、GPT-3.5 が両方のタスクで優れた精度を達成することを示しています。

ハードウェアの使用に関しては、実験では A40 GPU が使用され、1 時間あたり約 0.475 ドルのコストがかかりました。

さらに、この実験では、Spider データセットのサブセットと Viggo 機能表現データセットという、微調整に非常に適した 2 つのデータセットが選択されました。

GPT-3.5 モデルと公平に比較​​するために、Llama は最小限のハイパーパラメータの微調整を受けました。

私たちの実験における 2 つの重要な選択は、完全なパラメータの微調整ではなく、Code Llama 34B と Lora の微調整を使用することです。

実験は、Lora ハイパーパラメータの微調整に関するルールにほぼ従いました。Lora アダプターは次のように構成されました。

次に、SQL ヒントの例を示します。

SQLプロンプトは部分的に表示されています。完全なプロンプトについては元のブログを参照してください。

この実験では完全なSpiderデータセットは使用しなかった。

 department : Department_ID [ INT ] primary_key Name [ TEXT ] Creation [ TEXT ] Ranking [ INT ] Budget_in_Billions [ INT ] Num_Employees [ INT ] head : head_ID [ INT ] primary_key name [ TEXT ] born_state [ TEXT ] age [ INT ] management : department_ID [ INT ] primary_key management.department_ID = department.Department_ID head_ID [ INT ] management.head_ID = head.head_ID temporary_acting [ TEXT ]

この実験では、sql-create-context データセットと Spider データセットの交差部分を使用することを選択します。モデルに提供されるコンテキストは、次のような SQL 作成コマンドです。

 CREATE TABLE table_name_12 (class VARCHAR, frequency_mhz VARCHAR, city_of_license VARCHAR)

SQL タスク コードとデータ アドレス: https://github.com/samlhuillier/spider-sql-finetune

機能表現のヒントの例を以下に示します。

機能表現のヒントは部分的に表示されています。完全なヒントについては元のブログをご覧ください。

出力は次のようになります。

 verify_attribute(name[Little Big Adventure], rating[average], has_multiplayer[no], platforms[PlayStation])

評価フェーズでは、2 つの実験はすぐに収束しました。

機能表現タスクコードとデータアドレス: https://github.com/samlhuillier/viggo-finetune

詳細については、元のブログをご覧ください。

<<:  OpenAIは静かにその中核となる価値観を改訂し、汎用人工知能の構築に注力する

>>: 

ブログ    

推薦する

マシンビジョン: 2D ビジョンと 3D ビジョンのどちらを選択するか?

マシンビジョンは、人工知能の重要な分野として、今日最も注目されているテクノロジーの 1 つとなってい...

貨物ドローンは宅配業界に革命を起こす:より重い荷物を運び、より遠くまで飛ぶ

貨物ドローンは、高効率、環境保護、低コストなど、多くの利点を備え、宅配業界に革命をもたらそうとしてい...

研究によると、GPT-4モデルはエラーを自己修正する能力があり、AIコードのさらなる商業化を促進することが期待されています。

7月5日、マサチューセッツ工科大学(MIT)とマイクロソフトの研究者らは、GPT-4モデルには優れ...

企業が生産性向上のためにAIを活用しようとする中、最高AI責任者の必要性が高まっている。

Foundry の 2023 年 AI 優先事項調査では、組織内で AI および AIGC テクノ...

顔認識の時代に顔を守る方法

シャオ・ワンは最近少しイライラしている。毎日仕事が終わったらすぐにジムに行って運動していたのですが、...

...

アイウェア市場は1000億円規模を超えるか? 3Dプリントで「顔のカスタマイズ」を実現

私たちの日常生活には、近視用メガネ、サングラス、サングラス、遠視用メガネ、ゴーグルなど、視力矯正、視...

企業がAIをビジネスに統合する際の課題を克服する方法

調査データによると、AI 対応テクノロジーを導入して活用する準備が完全に整っている企業は世界中でわず...

大規模なマルチモーダルモデルは、学習しすぎると能力が低下しますか?新しい研究:教育省+の一般専門家が紛争を解決

微調整により、一般的な大規模モデルを特定の業界のアプリケーションにより適したものにすることができます...

インターネットの未来のために: AI が生み出すものと破壊するもの

編集者注: この記事はNetEase Intelligenceからのものです。翻訳|: NetEas...

BigDL-LLMを使用して、数百億のパラメータを持つLLM推論を即座に加速します。

私たちは、顧客サービス、仮想アシスタント、コンテンツ作成、プログラミング支援などのさまざまなアプリケ...

...

人工知能が銀行業界の変革を加速します!ビッグデータにより各ユーザーの信用格付けが提供されます!

[[221188]]将来、人工知能が 380 万人以上の銀行員の仕事を全て置き換える日が来るのでし...

...