「ビッグモデル予選コンペティション」チャットボット アリーナの公式リストが更新されました: Google Bard は GPT-4 を上回り、GPT-4 Turbo に次ぐ 2 位にランクされました。 しかし、多くのネットユーザーはこれに対して「不満」や「不公平」といった意見を表明した。 Google AIの責任者であるジェフ・ディーン氏は、Bardに新しい大型モデルであるGemini Proスケールが搭載されたことにより、そのパフォーマンスが大幅に向上したことを明らかにした。 これは、「予選ゲーム」でプレイするバードがインターネットに接続できることを意味します。 ネットユーザーの疑問は、次の点に集中している。
ハギング・フェイスの「チーフ・アルパカ・オフィサー」オマール・サンセビエロ氏も次のように語った。
さまざまな疑問に直面して、Imsys は公式に回答し、次のように指摘しました。
ネットユーザーが最も懸念している、バードに抜かれたGPT-4が非インターネット版であるという点について、イムシスは「リアルタイムデータへのアクセスがユーザー体験を向上させることができるなら、ランキングはそれを反映するだろう」と述べた。 彼はまた、OpenAI、Bing、Microsoft の幹部である Mikhail Parakhin に直接 @ を送り、GPT-4 のネットワーク バージョンや Bing Copilot の分野で喜んで参加すると述べました。 最新ニュースとしては、OpenAI の最新モデル gpt-4-0125-preview が現在アリーナに登場しており、ユーザーの投票を待っているところです。 Bard はどのようにして GPT-4 を上回ったのでしょうか?Chatbot Arena は、カリフォルニア大学バークレー校の研究者が率いる Imsys (Large Model Systems Organization) によって作成された大規模モデルの権威あるリストです。 このランキングは匿名の 1V1battle 投票ルールを採用しており、Elo レーティング システムに基づいてランク付けされます。 具体的には、投票ページは以下のようになります。モデルAとモデルBはどちらも匿名です。ユーザーは複数の質問をした後、モデルの回答を評価します。選択肢は全部で4つあります。Aの方が良い、Bの方が良い、AとBは同じくらい良い、AもBも良くない、です。 なお、質疑応答の過程でモデルの身元が漏洩した場合、投票は無効となります。 現在のリストによると、アリーナには 56 個の大型モデルがあります。 これまで、GPT-4 は「はるかにリードする」スコアで長い間ランキングを独占していました。しかし、Bard の新バージョンがリリースされた後、GPT-4 の 2 つのバージョンを直接上回り、1 位の GPT-4 Turbo にわずか 34 ポイント差で 2 位に躍り出ました。 さらに詳しく言うと、同点のないモデル A 対 B のすべての対戦では、モデル A の勝利の割合は次のようになります。 各モデルのペアのヘッズアップマッチ(同点なし)の数は次のとおりです。 さらに、Chatbot Arena リーダーボードでは、ブートストラップ法を使用して、Elo レーティング推定値のランダム サンプルを 1,000 個実行し、信頼区間などを評価します。 単一モデルと他のすべてのモデルとの比較における平均勝率は次のとおりです。 ただし、アリーナのランキングはリアルタイムであることは注目に値します。バードは現在2位ですが、合計投票数は3,000票強しかありません。 それに比べて、GPT-4 Turbo は 30,000 票以上を獲得しており、上回った 2 つのバージョンは Bard よりも数倍多くの票を獲得しています。 GPT-4の最新バージョンが市場に投入されたので(ランキングはまだ更新されていませんが)、フォローアップの結果を待つ必要があります〜 参考リンク: https://twitter.com/lmsysorg/status/1752035632489300239. |
<<: AIGC教育産業パノラマレポート:AIティーチングアシスタントと家庭教師が現実のものとなり、学習マシンが新たな機会をもたらす
この記事は公開アカウント「Reading Core Technique」(ID: AI_Discov...
ラボガイドインターネットの発展により、企業はより多くのデータを入手できるようになりました。これらのデ...
現在「ホットスポットの中のホットスポット」として、人工知能は絶大な人気を誇っています。モバイルインタ...
[51CTO.com からのオリジナル記事] 今日、メディア業界はデジタル技術の影響を受けて新たな旅...
製造業は大きなデジタル変革を遂げています。従来のモデルはインダストリー 4.0 へと進化しています。...
7月21日、鄭州市の西40キロにある米河鎮は停電、インターネット、道路が遮断され、完全な情報孤島とな...
近年、我が国の文化産業は人工知能などのハイテクをますます重視しており、文化と技術が深く有機的に融合す...
「周囲の車両や歩行者は、次の数秒で何をするだろうか?」これは、安全な自動運転を実現するために答えな...
[[245913]]現在、製造業の発展は新たな歴史的時期を迎えており、世界各国間の競争の焦点となって...
進化するヘルスケアとテクノロジーの世界では、「感情 AI」と呼ばれる画期的なイノベーションが変化の兆...
[[429116]]最近、福島邦彦氏が2021年度バウアー賞および科学業績賞を受賞したというニュース...
人工知能(AI)は、人間の知能特性を備えたタスクを実行できるコンピューティングプログラムを指します。...
この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...
データ センターとは何ですか。どのように使用しますか。具体的には、データ センターにはどのような種類...