ディープラーニングはフロントエンド開発ツールになりました:UI設計図に基づいてコードを自動生成します

ディープラーニングはフロントエンド開発ツールになりました:UI設計図に基づいてコードを自動生成します

UI デザイナーとフロントエンド エンジニアの間にニューラル ネットワークが必要になる場合があります。

最近、コペンハーゲンに拠点を置くスタートアップ企業Uizard Technologiesが「pix2code」と呼ばれるシステムを開発しました。このシステムはディープラーニングを使用することで、入力されたグラフィカル ユーザー インターフェイス (GUI) のスクリーンショットに基づいて対応するコードを直接出力できるため、フロントエンドでの手動コード記述のプロセスが不要になります。

現在、pix2code によって生成されたコードの精度は 77% に達しており、これらのコードは Android、iOS、Web インターフェイスの 3 つのプラットフォームと互換性があります。

すごいですね。詳しくは下のビデオをご覧ください。

UIzard の創設者 Tony Beltramelli 氏は、このニューラル ネットワークを開発するために、R&D チームが 3 つの大きな困難を克服しなければならなかったと述べています。

  • 1 つ目はコンピューター ビジョンのレベルです。コンピューターは与えられたオブジェクトやシーンを自動的に認識して理解することはできませんし、それらの位置や特徴を判断することもできません。

  • 2 つ目は言語レベルです。ニューラル ネットワークにテキストを理解してもらい、正確なサンプルを作成できるようにする必要があります。

  • 最後に、ニューラル ネットワークは、コード、テキスト、および対応する画像間の関係を理解する必要があります。

ベルトラメリ氏はまた、将来的には生成的敵対ネットワーク (GAN) を使用して pix2code をさらに改良する可能性があると述べた。 GAN はシーケンスや画像の生成においてその利点が実証されていますが、この分野の研究はまだ比較的初期段階にあるため、ニューラル ネットワークのトレーニングにはまだ多くの時間がかかります。

添付書類の宛先:

https://arxiv.org/abs/1705.07962

GitHub アドレス:

https://github.com/tonybeltramelli/pix2code

さらに、GitHub では、Beltramelli 氏が pix2code に関連するよくある質問に回答しました。量子ビットはこのセクションを次のようにコンパイルします。

Q: データセットはいつ利用可能になりますか?

A: 私たちは今年の NIPS に論文を提出しました。論文が受理されるか却下されるかが決まれば、データセットは 9 月に一般公開される予定です。その時点で、データセットに含まれる GUI のスクリーンショット、関連する DSL コード、iOS、Android、Web インターフェースの 3 つのターゲット コードが提供されます。

Q: ソースコードはいつリリースされますか?

A: 当初の論文に書かれていた通り、コードをオープンソース化する予定はありませんでした。しかし、このプロジェクトがこれほど注目を集めるとは予想していなかったため、論文に記載されている pix2code 実装コードとデータセットをオープンソース化することにしました。

Q: pix2code は他のターゲット プラットフォーム/言語もサポートしますか?

A: いいえ、pix2code は単なる研究プロジェクトであり、論文に記載されているとおりに残ります。このプロジェクトは、Uizard Technologies で私たちが行っている仕事のほんの小さなデモンストレーションにすぎません。もちろん、他のターゲット プラットフォーム/言語でフォークして自分で実験することも歓迎します。

Q: フロントエンド プロジェクトで pix2code を使用できますか?

A: いいえ、pix2code は単なる実験的なプロジェクトであり、特定のケースで使用することはまだできません。しかし、私たちはそれを商業的に利用できるようにするために一生懸命取り組んでいます。

Q: モデルのパフォーマンスはどのように測定されますか?

A: 論文で報告されている正確な結果または不正確な結果は、生成されたトークンと予想されるトークンを比較することによって DSL レベルで得られます。両者の長さに不一致がある場合もエラーとみなされます。

Q: このモデルのトレーニングにはどのくらいの時間がかかりますか?

A: NVIDIA Tesla K80 GPU では、データセットに含まれる 109 * 10^6 個のパラメータを最適化するのに 5 時間もかかりません。したがって、このモデルを 3 つのターゲット プラットフォームでトレーニングする場合、約 15 時間かかります。

Q: 私はフロントエンド開発者ですか?もうすぐ仕事がなくなってしまうのでしょうか? (私はこの質問を何度も誠意を持って尋ねてきました...)

A: AI がフロントエンドエンジニアに取って代わることはそうすぐにはないでしょう。

あらゆるプラットフォーム/言語で 100% 正確にコードを生成する pix2code の成熟バージョンがあったと仮定しても、優れたフロントエンドには、ロジック、インタラクティブ性、高度なグラフィックスとアニメーション、およびユーザーが好むその他のすべてのものが必要になります。

これを実行する目的は、UI/UX デザイナーとフロントエンド開発者を置き換えることではなく、両者の間のギャップを埋めることです。私たちは、デザイナーがより良いものを作成できるようにし、開発者がコア機能に多くの時間を費やせるようにしたいと考えています。

私たちは、将来 AI が人間に取って代わるのではなく、人間と協力するようになると信じています。

---------------------------------------------------

編集:唐旭

量子ビットレポート | パブリックアカウント QbitAI

<<:  7,346 人が参加したアルゴリズム コンテストは JD.com に何をもたらしたのでしょうか?

>>:  データが少ないとディープラーニングは使えないなんて誰が言ったのでしょうか?私はこのことについて責任を負わないよ!

ブログ    
ブログ    
ブログ    

推薦する

ウナギの下半身は切り落とされた後もまだ動きます。ロボット: 受け取ってください。

[[418811]]この記事はAI新メディアQuantum Bit(公開アカウントID:QbitA...

AIとロボット工学でオフショア業務を効率化する方法

長い間、肉体的に過酷で危険な仕事が特徴とされてきた石油産業は、変革を遂げつつある。この変化は、通信技...

英国メディア:シリコンバレーの一部の人々はAIに熱心すぎて「学習は無意味だ」と言っている

6月13日のニュース、人工知能の急速な発展に伴い、シリコンバレーは、人間の行動は予測可能であり、スキ...

機械学習の運用はサイバーセキュリティに革命をもたらす可能性がある

機械学習運用 (MLOps) とは、運用環境での機械学習モデルの展開、管理、監視を簡素化するために使...

外国人の機械学習エンジニアは失業に直面しているのに、なぜ彼らはまだMLの学習にこだわるのでしょうか?

機械学習の分野では悲観的な見通しが広がっています。機械学習の人材の採用は減速しています。 [[334...

Metaは、すべての製品のビデオ推奨エンジンをサポートする巨大なAIモデルを構築しています。

3月7日水曜日、Metaの上級幹部は米国時間、同社がFacebookを含む傘下のさまざまなプラット...

NVIDIA はフーリエ モデルを使用して前例のない天気予報精度を実現

現代の数値天気予報 (NWP) は 1920 年代にまで遡ります。今日では、数値天気予報はいたるとこ...

...

イタリア首相がマスク氏と会談、AIや出生率などを議論

6月16日のニュースによると、テスラのCEO、イーロン・マスク氏は木曜日にイタリアのメローニ首相と会...

強化学習と3Dビジョンを組み合わせた新たなブレークスルー:高性能オンラインパレタイジングロボット

国立防衛技術大学、クレムソン大学、Seebit Robotics の研究者らが協力し、深層強化学習を...

テスラは、Dojo スーパーコンピューターの秘密を盗み、偽のコンピューターを使用して検査を欺いたとして元エンジニアを訴える

テスラは、元エンジニアのアレクサンダー・ヤツコフ氏を提訴した。同氏は、同社内部のスーパーコンピュータ...

ディープラーニング:新興技術の限界を押し広げる

ビッグデータや人工知能などの新興技術は猛烈な勢いで発展しており、その一因はディープラーニングの驚異的...

物理学と機械学習が出会うとき: 物理学の知識に基づく機械学習のレビュー

物理学情報に基づく機械学習(PIML)とは、物理学(高度に抽象的な自然現象や歴史上の人間の行動)に関...