Amazon Transcribe について

Amazon Transcribe について

Amazon Transcribe は、開発者がアプリケーションに音声テキスト変換機能を簡単に追加できるようにする自動音声認識 (ASR) サービスです。 Amazon Transcribe API を使用すると、Amazon S3 に保存されている音声ファイルを分析し、サービスから文字起こしされた音声のテキストファイルを返すことができます。

[[241018]]

Amazon Transcribe は、カスタマー サービス コールの文字起こしや、オーディオおよびビデオ コンテンツの字幕生成など、多くの一般的なアプリケーションに使用できます。このサービスでは、WAV や MP3 などの一般的な形式で保存された音声ファイルを書き起こし、各単語にタイムスタンプを添付して、テキストを検索することで元のソース内の音声を簡単に見つけることができます。 Amazon Transcribe は、言語の進化に合わせて継続的に学習し、改善しています。

主な特徴

人間に優しい文字起こし

ほとんどの音声認識システムの出力は、句読点のないテキストのストリームです。 Amazon Transcribe はディープラーニングを使用して句読点や書式設定を自動的に追加し、出力をよりわかりやすくして、さらに編集することなくすぐに使用できるようにします。

カスタム語彙

Amazon Transcribe を使用すると、音声認識語彙を拡張およびカスタマイズできます。基本語彙に新しい単語を追加して、製品名、ドメイン固有の用語、個人名など、ユースケースに固有の非常に正確な文字起こしを生成できます。

タイムスタンプを生成する

Amazon Transcribe は各単語のタイムスタンプを返すため、テキストを検索することで元の録音内の音声を簡単に見つけることができます。

複数の話者を識別する

Amazon Transcribe は話者の抑揚を認識し、それに応じてトランスクリプトを作成します。これにより、電話、会議、テレビ番組など、複数の話者がいる音声を書き起こすために必要な労力を大幅に削減できます。

幅広いユースケースをサポート

Amazon Transcribe は、さまざまな品質のオーディオに対して正確な自動文字起こしを提供するように設計されています。あらゆるビデオ ファイルやオーディオ ファイルのキャプションを生成できるほか、カスタマー サービス通話などの低品質の電話録音を書き起こすこともできます。

チャンネル合成(近日公開予定)

Amazon Transcribe は、音声をより適切に処理するために、各話者の音声を個別のチャネルで録音します。コンタクトセンターは、Amazon Transcribe に単一のオーディオファイルを送信すると、2 つのチャネルを識別して分離し、各チャネルの音声を書き起こし、チャネルラベルを使用して調整された統合された書き起こしを作成するというメリットを得られます。

ユースケース

Amazon Transcribe は、カスタマーサービス、字幕作成、検索、コンプライアンスなど、幅広いユースケースに対応する文字起こしサービスを提供します。

顧客サービスの向上

Amazon Transcribe は、音声入力をテキストに変換することで、音声入力を検索および分析できるテキスト分析アプリケーションの構築に役立ちます。カスタマーコンタクトセンターは、Amazon Transcribe を使用して音声通話を書き起こし、Amazon Comprehend などの他の AWS 製品を使用してデータをマイニングし、会話から意味と意図を抽出することで洞察を得ることができます。

字幕ワークフロー

Amazon Transcribe は、ビデオコンテンツと一緒に表示されるタイムスタンプ付きの字幕を自動的に生成することで、コンテンツ作成者やメディア発行者がリーチとアクセスを拡大するのに役立ちます。

オーディオアーカイブカテゴリー

このサービスを使用すると、オーディオおよびビデオ資産を完全に検索可能なアーカイブに書き起こして、コンプライアンス監視とリスク管理に役立てることができます。お客様は、Amazon Transcribe を使用して音声をテキストに変換し、Amazon ElasticSearch Service を使用して音声/ビデオライブラリのインデックスを作成し、テキストベースの検索を実行できます。

<<:  Amazon Translateについて

>>:  Amazon SageMaker について

推薦する

SafetyNet: 自動運転における機械学習戦略のための安全な計画アプローチ

[[427712]] 2021年9月28日にarXivにアップロードされた論文「SafetyNet:...

大規模言語モデルと知識グラフに関する共同研究のレビュー:2つの相補的な技術的利点

大規模言語モデル (LLM) はすでに強力ですが、さらに強力になる可能性があります。 LLM は、ナ...

...

人工知能と仮想現実のつながり

バーチャルリアリティ(VR)は、新しい実用的な技術です。バーチャルリアリティ技術は、コンピュータ、電...

Protobufを勉強していたら、良いアルゴリズムを見つけました - ZigZag

[[434311]]もともと Protobuf の原理を勉強したかったのですが、研究の過程で Pr...

二足歩行ロボットは撮影以外にも応用シーンが多すぎて問題になっている

揚子江は東に流れ、その波はすべての英雄たちを押し流す。ジャッキー・チェン、ジェット・リー、ジャン=ク...

ソフトウェアエンジニアの年収は930万ドル! Googleの給与が明らかに:15億6千万ドルは史上最高額

シリコンバレーの大企業の中でも、グーグルの従業員はテクノロジー業界で最も高給を得ている社員の一部であ...

顔認識の3つの主要技術と4つの主要機能

2016年百度世界大会が開幕し、百度創始者の李承燁氏は大会で「人工知能」をテーマに講演し、最新製品「...

インターネットの未来のために: AI が生み出すものと破壊するもの

編集者注: この記事はNetEase Intelligenceからのものです。翻訳|: NetEas...

行列乗算の3Dインサイト: これがAIの思考法

行列乗算の実行プロセスを 3D で表示できれば、行列乗算を学ぶのはそれほど難しくないでしょう。今日で...

Beike Renting: 業界に力を与え、レンタル部門の基準の再構築を推進

[原文は51CTO.comより] 国家の不動産市場マクロコントロール政策の導入以来、住宅購入の敷居は...

ChatGPT をベースにしたインテリジェントな顧客サービス アシスタント

導入従来の顧客サービス分野は、手作業に大きく依存し、データ集約的であることが特徴です。大量のユーザー...

YouTubeの有名人動画を機械学習で分析したら、視聴数急増の秘密が分かった

この記事はLeiphone.comから転載したものです。転載する場合は、Leiphone.com公式...

...

...