人工知能の分野は継続的に進歩しており、自然言語処理、自然言語生成、コンピュータービジョンなどのサブフィールドは、その幅広い使用例により急速に人気を集めています。光学文字認識 (OCR) は、コンピューター ビジョンにおいて成熟し、広く研究されている分野です。文書のデジタル化、手書き文字認識、シーンテキスト認識など、さまざまな用途があります。数式認識は、学術研究で広く注目されている OCR の分野です。 PDF は最も広く使用されている形式の 1 つであり、書籍に保存されたり、学術雑誌に掲載されたりすることがよくあります。 PDF はインターネット上で 2 番目に多く使用されているデータ形式で、情報の 2.4% を占めており、文書の配信によく使用されます。 PDF ファイルは広く使用されていますが、特に科学研究論文のような高度に専門化された資料を扱う場合には、PDF ファイルから情報を抽出することが困難な場合があります。数式が多数含まれているため、現在の OCR では数式の意味情報が失われる可能性があります。 Meta AI の研究者チームは、「Neural Optical Understanding for Academic Documents (学術文書のニューラル光学理解)」の略称である Nougat と呼ばれるソリューションを考案しました。科学テキストの光学文字認識 (OCR) の場合、Nougat は VIT モデルです。その目的は、これらのファイルをマークアップ言語に変換して、より簡単にアクセスし、機械で読み取り可能にすることです。 このアプローチの有効性を示すために、研究チームは新しい学術論文のデータセットも作成しました。このアプローチは、デジタル時代における科学的知識のアクセシビリティを向上させるための実行可能な答えを提供します。これは、人間が簡単に読める文書と、コンピューターが処理および分析できるテキストとの間のギャップを埋めます。 Nougat は基本的に、ドキュメント ページ (特に PDF) の画像をフォーマットされたマークアップされたテキストに変換するための Transformer ベースのモデルです。 チームは主な貢献を次のようにまとめています。 事前トレーニング済みモデルのリリース: PDF をシンプルなマークアップ言語に変換できる事前トレーニング済みモデルを作成します。この事前トレーニング済みモデルは GitHub で公開されており、誰でもこのモデルと関連コードにアクセスできます。 データセット作成パイプライン: PDF ドキュメントとそれに関連するソース コードを組み合わせたデータセットを構築する方法について説明します。このデータセット開発のアプローチは、Nougat モデルのテストと改善に非常に重要であり、将来のドキュメント分析の研究とアプリケーションにも役立つ可能性があります。 ページの画像のみに依存します。つまり、このモデルでは PDF のスクリーンショットのみが必要なため、元のドキュメントがデジタル テキスト形式で利用できない場合でも、さまざまなソースからコンテンツを抽出するための柔軟なツールとなり、スキャンした紙や書籍で処理できます。 Nougat は、VIT モデルの力を活用して OCR の新しい時代を先導したと言えます。複雑な科学文書を理解し、それを構造化マークアップ言語に変換する能力は、シームレスな情報アクセスへの道を開き、人間の理解と機械分析の間のギャップを埋めます。このイノベーションは学術研究だけでなく、それ以外の分野にも大きな可能性を秘めており、デジタル時代における AI 主導のソリューションの変革力を実証しています。 上記のスクリーンショットは公式サイトからのものです。左の写真は画像ファイル、右の写真はLaTeX構文で生成された数式です。 論文と公式ウェブページはこちらです: https://facebookresearch.github.io/nougat/ ちょっとした不満:FBのプロジェクト管理は相変わらず混乱している
ここ数日の内紛とコンピューティングパワー競争のニュースが裏付けられていることがわかります。 |
>>: 推理力が2倍にアップ!プリンストン大学と北京大学の卒業生がロング「メデューサ」を提供、33Bモデルは13Bと同等の速さ
ChatGPT に回答を出す前に手順について考えてもらうことで、精度を向上させることができます。では...
[[385749]]写真はロボット最近、メディアの報道によると、人類の生存を脅かすと言われる米国の...
[[383159]]新しいテクノロジーの適用には、多くの場合、プラスの影響とマイナスの影響の両方が伴...
この記事はLeiphone.comから転載したものです。転載する場合は、Leiphone.com公式...
▲ 液体生検は費用対効果が高く、生検全体のプロセスを大幅に簡素化できます。 Wikipedia によ...
人工知能に必要な条件:ディープラーニングモデル、ビッグデータ、計算能力著者: マイケル・チャン201...
デビッド・リンシカム編纂者 | Yan Zheng制作:51CTO テクノロジースタック(WeCha...
AI時代では、DevOpsとAIが共有結合します。 AI はビジネス ニーズに基づいてソフトウェアの...
2000年前に生きていた古代人が1000年前に戻ったとしても、適応できるものは多くないかもしれません...
8月9日、BlackBerryは新たな調査レポートを発表し、現在、世界中の企業の75%が職場でのCh...
最適化はあらゆる分野で重要です。一部の最適化は初期化から始まり、その後ソリューションを繰り返し更新し...
機械学習の基本的な概念を説明するとき、私はいつも限られた数の図に戻ってしまいます。以下は、私が最も啓...
[[391530]]二分木問題の分析バイナリツリーは動作効率が高いですが、問題点もあります。次のバ...