2月8日、マイクロソフトの急速な発展と比較すると、AppleのAI分野における展開ははるかに控えめであるように思われるが、これはAppleがこの分野で成果を上げていないことを意味するものではない。 Appleは最近、自然言語の指示に基づいて画像を編集できる「MGIE」と呼ばれる新しいオープンソースの人工知能モデルをリリースした。 画像出典: VentureBeat および Midjourney MGIE の正式名称は MLLM ガイド付き画像編集であり、マルチモーダル大規模言語モデル (MLLM) を使用してユーザーの指示を解釈し、ピクセルレベルの操作を実行します。 MGIE は、ユーザーが指定した自然言語コマンドを理解し、Photoshop スタイルの変更、写真のグローバル最適化、ローカル編集などの操作を実行できます。 Appleとカリフォルニア大学サンタバーバラ校の研究者は協力し、人工知能研究のトップカンファレンスの1つである2024年国際学習表現会議(ICLR)でMGIE関連の研究成果を発表する予定です。 MGIE を紹介する前に、まず MLLM を紹介したいと思います。 MLLM は、テキストと画像を同時に処理できる強力な AI モデルであり、指示ベースの画像編集機能を強化します。 MLLM はクロスモーダル理解と視覚知覚応答生成において優れた能力を示していますが、画像編集タスクではまだ広く使用されていません。 MGIE は、2 つの方法で MLLM を画像編集プロセスに統合します。まず、MLLM を使用して、ユーザー入力から表現指示を導き出します。説明は簡潔で、編集プロセスに関する明確なガイダンスを提供します。 たとえば、入力が「空をもっと青くする」である場合、MGIE は「空の領域の彩度を 20% 上げる」という命令を生成できます。 次に、MLLM を使用して、望ましい編集の潜在的な表現である視覚的な想像力を生成します。この表現は編集の本質を捉えており、ピクセルレベルの操作をガイドするために使用できます。 MGIE は、命令推論、視覚的想像力、画像編集モジュールを共同で最適化するための新しいエンドツーエンドのトレーニング スキームを採用しています。 MGIE は、単純な色調整から複雑なオブジェクト操作まで、幅広い編集状況に対応できます。モデルは、ユーザーの好みに応じてグローバル編集とローカル編集を実行することもできます。 MGIE の機能と特徴の一部を以下に示します。
MGIE は GitHub 上のオープンソース プロジェクトであり、ユーザーはコード、データ、事前トレーニング済みモデルを見つけることができます。このプロジェクトでは、MGIE を使用してさまざまな編集タスクを実行する方法を示すデモ ノートブックも提供されます。 |
>>: 今日から彼は、黄仁訓院士です!米国工学アカデミーの2024年会員リストが発表され、清華大学の黄一東氏らが外国人会員に選出される
一般的に、ディープラーニング ネットワークをトレーニングする方法には、教師あり学習、教師なし学習、半...
【51CTO.comオリジナル記事】まとめ本研究では、ディープフィードフォワードシーケンスメモリニュ...
[[245713]]黄金の9月と銀の10月、観光業界は好景気の日々を待ち望んでいました。一方では、...
先日終了した双十一では、天猫の取引額は2,684億元に達し、前年比25.7%増加した。この成果の裏に...
過去数年間、機械学習 (ML) と人工知能 (AI) の専門家は、以前は完全に人間が実行できると考え...
1. 感情分析感情分析とは、ツイート、製品レビュー、顧客からのフィードバックなどのテキストの背後にあ...
各種の大規模モデルやディープニューラルネットワークの登場により、人工知能の発展に対応し、高い計算能力...
このシリーズの最初の記事では、人工知能、機械学習、ディープラーニング、データサイエンスなどの分野間の...
人間の思考(合理性や心を含む)とはいったい何なのかという問いは、哲学者や科学の巨匠たちを常に悩ま...
マドゥ・ネール博士とアシャ・ダス博士は、人工知能 (AI) モデルを使用して患者の組織サンプルのスキ...
[51CTO.com クイック翻訳]今日、プロセス自動化にはさまざまな形があります。また、ツールの...
人工知能は将来人類に大きな可能性をもたらすでしょうが、もちろんいくつかの面では人類にリスクをもたらす...