GPT-4 パラメータは 10 兆に達します!この表は、新しい言語モデルのパラメータが GPT-3 の 57 倍になると予測しています。

GPT-4 パラメータは 10 兆に達します!この表は、新しい言語モデルのパラメータが GPT-3 の 57 倍になると予測しています。

機械学習の場合、パラメータはアルゴリズムの鍵となります。パラメータは、履歴入力データであり、モデルトレーニングの結果であり、モデルの一部です。

一般的に言えば、NLP の分野では、パラメータの数と複雑さのレベルの間には正の相関関係があります。 OpenAI の GPT-3 は、1,750 億のパラメータを持つ、現在までに最大規模の言語モデルの 1 つです。

それで、GPT-4 はどのようなものになるのでしょうか?

最近、一部のネットユーザーがGTP-4とその「オープンソース版」GPT-NeoXについて大胆な予測を立てました。

著者は、GPT-4 のパラメータは現在の GPT-3 モデルの 57 倍以上である 10T に達する可能性があると考えています。一方、GPT-NeoX の規模は GPT-3 と同等になる可能性があります。

待ってください、もしそうだとしたら、プログラマーはGPT-NeoXのパラメータを喜んで調整できるのでしょうか?

モデル

リリース時間

トークン

パラメータ

1.75Tの割合

トレーニングテキスト

GPT-2

(オープンAI)

2019年2月

10B

15億

0.09%

40GB

GPT-J

(エレウサーAI)

2021年6月

400B

6B

0.34%

800GB

GPT-3

(オープンAI)

2020年5月

499B

175B

10.00%

570GB

盤古(中国語)

2021年4月

40B

200B

11.43%

1.1TB

HyperCLOVA(韓国語)

2021年5月

560B

204B

11.66%

1TBですか?

武道 2.0 (中国語)

2021年6月

500B?

1.75T

100.00%

2.4TB

ラムダ

(グーグル)

2021年6月

1Tですか?

200B?

11.43%

1TBですか?

GPT-4

(オープンAI)

未定

20T?

10T?

571.43%

5TBですか?

GPT-NeoX

(エレウサーAI)

未定

500B?

175B?

10.00%

825GBですか?

データセット分析

現在最も広く使用されている GPT-3 のトレーニング コーパスは、膨大な量の構造化テキストから作成されています。すべてのデータセットはインデックス付け、並べ替え、フィルタリング、重み付けされ、多くの重複が削除されます。

GPT-3 は、OpenAI 専用に構築され、Microsoft Azure でホストされている、世界で最も強力なスーパーコンピューターの 1 つでトレーニングされました。このスーパーコンピューティング システムには 285,000 個を超える CPU コアと 10,000 個を超える GPU があり、400Gbps で動作します。

GPT-3

Wikipedia DataSet は、Wikipedia の英語コンテンツです。その品質、文体、幅広さにより、言語モデリングのための高品質テキストの標準的なソースとなっています。

WebTextデータセット (およびその拡張バージョン WebText2) は、関連する投稿に 2 つ以上の賛成票が付けられた Reddit の 4,500 万を超える Web ページのテキストです。

月間アクティブユーザー数が 4 億 3,000 万人を超えるこのデータセットのコンテンツは、最も「人気のある」 Web サイトの意見と見なすことができます。

Books1Books2は、インターネットに基づく 2 つの書籍データセットです。類似のデータセットには以下が含まれます。

  • BookCorpus は、未出版の著者が書いた無料のフィクション本のコレクションで、少なくとも 10,000 冊の本が含まれています。
  • Library Genesis (Libgen) は、科学論文、フィクション、ノンフィクション書籍の膨大なコレクションです。

Common Crawl は、50 億を超える Web ページのメタデータと抽出されたテキストのオープン ソース アーカイブです。

  • 8 年間分のペタバイト (数千テラバイト、数百万ギガバイト) のデータ。
  • 250億のウェブサイト。
  • 何兆ものリンク。
  • 英語75%、中国語3%、スペイン語2.5%、ドイツ語2.5%など。
  • 上位 10 ドメインのコンテンツ: Facebook、Google、Twitter、Youtube、Instagram、LinkedIn。

GPT-3で使用されるデータセット

GPT-Neo と GPT-J

今年 3 月、Eleuther AI は GitHub 上で GPT-Neo オープンソース プロジェクトを立ち上げました。これは Colab で微調整できます。

GPT-Neo は、GPT-3 (13 億と 27 億) に比べてパラメータ数はまだ少ないですが、オープンソースで無料であり、依然として「同性の友達」という認識を持っています。

今年6月、Eleuther AIは再びGPT-Neoの強化版ともいえるGPT-J-6Bをリリースしました。名前の通り、モデルのパラメータ数が6Bに増加しました。

GPT-J は、22 個の小規模で高品質なデータセットで構成される 825 GB の多様なオープンソース言語モデリング データセットである The Pile データベースでもトレーニングされています。

HackerNews、Github、Stack Exchangeなどの専門的なフォーラムやナレッジベース、プレプリントウェブサイトArXivに加えて、The PileにはYoutubeの字幕やEnron Emailsコーパスも含まれています。

GPT-NeoとGPT-Jで使用されるデータセット

ゼロショットタスクでは、GPT-J のパフォーマンスは 67 億のパラメータを持つ GPT-3 に匹敵します。また、GPT-J は、さまざまな下流のゼロショットタスクで現在利用可能な最高のパフォーマンスを発揮する Transformer 言語モデルでもあります。

この観点から、GPT-3と同規模のGPT-NeoXのパフォーマンスに期待が持てます。

ユーザーコメント

GPT-4 はなぜこんなに大きいのでしょうか?

「GPT-3はすでにトークンあたりの理論上の最大効率に近づいています。OpenAIモデルが正しく動作すれば、より大きなモデルは計算能力の無駄遣いに過ぎません。」

あるネットユーザーはこう答えた。「規模は確かに改善をもたらすことができます。本質的には関係性のメタファーモデルであるため、『関係性についてより多くを知る』ということは、より多くのことやより微妙な方法で対応できるようになることを意味します。もちろん、これはマーケティング手法でもあります。」

<<:  CVサークル対決:GoogleがViTGANを提案、GANをトレーニングするためにビジュアルトランスフォーマーを使用

>>:  FacebookはCNN Transformerの利点を組み合わせ、誘導バイアスを柔軟に利用するConViTを提案している

ブログ    
ブログ    
ブログ    
ブログ    

推薦する

データがなければ自動運転の未来はない: 自動運転車にビッグデータが必要な理由

[[320195]]ビッグデータにより自動運転の未来が可能になります。自動運転は自動車メーカーの間で...

マイクロソフトの「Office の新時代」イベント プレビューでは AI が紹介される: 新しい描画アプリ、ゲーム フレーム レートの向上など

マイクロソフトは3月8日、北京時間3月22日午前1時にオンライン新製品発表会を開催することを決定した...

周洪義:人工知能には多くのセキュリティ上の弱点がある

3月5日、中国人民政治協商会議全国委員会委員で、360グループ会長兼CEOの周鴻毅氏は、今年の「両会...

ChatGPTに加えて、知っておくべき14の大きなモデルがあります

多くの上司は人工知能を未来と見ており、多くのテクノロジーリーダーは ChatGPT を人工知能と同義...

AIがサイバーセキュリティにできること、できないこと

過去数か月間にネットユーザーを最も怖がらせたものは何かと問われれば、それは以下のウイルス攻撃だろう。...

Google X、手作業でラベル付けすることなく一目で対象部品を見つけられるグリッパーアームをオープンソース化

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

...

スーパー人工知能とは何ですか?

進化し続けるテクノロジーの世界において、魅力的であると同時に不安も抱かせる概念の出現が、スーパー人工...

AI 開発の方向性に関する大論争: ハイブリッド AI?強化学習?実践的な知識と常識をAIに統合する?

[[396127]]著者: Ben Dickson はソフトウェア エンジニアであり、テクノロジー...

...

...

人工知能が巨大な応用価値を生み出す

飛行機搭乗時の「顔スキャン」から無人スーパーマーケットまで、多機能巡回ロボットからスマート医療まで....

機械学習により暗号通貨は追跡可能になるか?

[[349063]] [51CTO.com 速訳] 機械学習技術を使って仮想通貨を追跡できるのか?...

あなたは私の目です!人工知能が障害者にバリアフリーのインターネットアクセスを提供する

この記事は公開アカウント「Reading Core Technique」(ID: AI_Discov...