AI音声翻訳ツール:あらゆる録音を280以上の言語でテキストや字幕に変換

Smartcatの画像翻訳エージェント(Image Translation Agent)を使えば、多言語のビジュアルを瞬時に作成し、各市場へより迅速に展開しながら、すべての画像でブランドイメージと一貫性を維持できます。
あらゆるファイルを翻訳。数秒で。
画像、ドキュメント、動画、音声、コース — 形式を選んでファイルをドロップしてください。
ここに音声をドロップ
または ファイルを参照 · .mp3, .wav, .m4a, .aac などに対応
翻訳元
翻訳先

翻訳

1,000社以上のエンタープライズブランド が録音・録画コンテンツの翻訳においてSmartcatを信頼しています

音声ファイルはどのように翻訳しますか?

SmartcatのAI音声翻訳ツールは4つのステップで動作します。

  • 文字起こし — ファイル(MP3、MP2/M2A、M4A、AAC、OGG、FLAC、WMA)内の音声を、タイムスタンプおよび話者ラベル付きのテキストに変換します。

  • 修正 — 何かが翻訳される前に、その文字起こしを確認し、聞き間違いによる名前や用語を一度だけ修正します。

  • 翻訳 — 修正された文字起こしは280以上の言語に対応し、プロジェクトに紐づけられた用語集や翻訳メモリを再利用することで、プロジェクト内のすべての録音において一貫した用語が維持されます。

  • エクスポート — 翻訳済みドキュメント、音声が動画やポッドキャストのものである場合は字幕ファイル(SRTまたはVTT)、あるいは35の吹き替えロケールのいずれかによるAI音声トラック。

料金は録音の長さではなく、文字起こしの原文1単語につき1 SmartwordとしてSmartwords単位で従量課金されます。そのため、発話の少ない長時間の録音は、台詞が詰まった短時間の録音よりも安価になります。AI吹き替えは、1単語につき10 Smartwordsで請求されます。

エクスポートする前に、任意の言語を人間のプロのレビュアーにルーティングすることができます。

1

録音をアップロードしてください

ファイルをドロップするか、一度に複数ドロップしてください — 1つのプロジェクトに追加できるファイル数に制限はなく、数百個のファイルの一括アップロードにも対応しています。

制限はファイル数や録音時間ではなく、ファイルごとのサイズであり、これはすべてのプランで共通です。

2

文字起こしを確認してください

Smartcatはタイムスタンプと話者ラベル付きで文字起こしを行います。聞き間違いによる用語を、あらゆる言語に翻訳される前に、ここで一度修正してください。

3

言語と出力先を選択

280以上の言語に対応した翻訳テキストや字幕、または35の吹き替え地域に対応したAIボイストラック。

4

エクスポート — または先にレビューへ送信

結果をダウンロードするか、同じワークフロー内で審査済みのレビュアーに対象言語のレビューを依頼してください。一括で翻訳しますか?プロジェクトを選択して一度にダウンロード:Smartcatは、各ファイルを元のフォーマットのままフォルダごとに整理し、1つのZIPファイルにまとめて返します。

対応言語と費用について

280+

テキストと字幕の言語

翻訳された文書およびSRT/VTT字幕ファイルは、Smartcatが対応する280以上の言語のいずれでも、双方向で利用可能です。

35

AIナレーションのロケール

合成音声の出力はテキストよりも範囲が狭く、ElevenLabsの技術を採用した35のロケールに対応しています。ロケールに音声がない場合は、代わりにテキストまたは字幕をエクスポートしてください。

1

原文1単語あたりのSmartwords

音声は録音時間ではなく、文字起こしの単語数で測定されます。そのため、ナレーションがまばらな60分のウォークスルー動画の方が、台本のある10分の広告よりも費用が安くなる場合があります。AI吹き替えは、1単語につき10Smartwordsで従量制課金されます。詳細は料金ページに記載されています。

“

Smartcatが動画の音声から字幕を自動抽出し、完璧なAI翻訳とレビュープロセスのために原文をすばやく編集できる新機能をリリースしたことで、当社のファイル準備時間は瞬時に70%も削減されました!

”

バーバラ・フェドロヴィッツ

スミス・アンド・ネフュー 翻訳部マネージャー

MP3をそのままの状態でアップロードしてください

事前の変換も、文字起こしの準備も不要。MP3はそのままの状態でアップロードされます。1つのエピソードでも、それらがまとまったフォルダー全体でもドロップするだけ。1つのプロジェクト、1つの用語集、そして1つの翻訳メモリによって、すべてのファイルで繰り返し登場する名前を完全に一致させることができます。

なぜ音声は、ほとんどの翻訳ツールが対応できないファイル形式なのか?

録音を翻訳しようとするときに生じる問題は3つあるが、そのいずれも翻訳そのものではない。

あなたには音声があり、ツールはテキストを求めている。大半の翻訳者は文書での依頼を受け付けているため、録音データはまず手作業で文字起こしされることになります。翻訳を開始する前に、音声1時間につき1時間の入力作業が発生するのです。

一つの聞き間違いが、十二の誤りを生む。音声テキスト変換が製品名や頭字語を一度誤認すると、その誤りがそのまま忠実にすべての翻訳先言語へと訳出されてしまいます。地域の同僚からその製品の名称を尋ねられたときに、それが見つかります。

みんなの言葉がひとつに統合されます。2人での通話やパネルディスカッションが一続きの塊として返ってくるため、誰が何に同意したのか誰にも判別できません。

1,000+

Smartcatを利用するエンタープライズブランド

7

直接対応している音声形式

6GB

ファイルあたりの最大サイズ

制限なし

プロジェクトあたりのファイル数、または録音時間に関して

Smartcatがお客様のワークフローにどのように適合するかをご覧ください

パーソナライズされたデモを予約して、音声翻訳用のメディア翻訳エージェントをはじめとするSmartcatのAIエージェントライブラリが、チームの規模拡大、ローカライズ、そしてグローバルコンテンツの迅速な配信をどのように支援できるかをご確認ください。

録音・録画されたコンテンツを大規模に翻訳するチーム

2〜3日

10日から短縮された納期

スミス・アンド・ネフューは、同等のコース長におけるeラーニングの翻訳納期を、従来の外部業者による平均10日間から2〜3日へと短縮しました。録音された教材や動画コースの教材も、そのコンテンツセットの一部でした。

最大70%

翻訳コストの削減

スタンレー・ブラック・アンド・デッカーは、翻訳コストを1,000語あたり200〜300ドルから1.20ドルへと、最大70%削減しました。

31時間

毎月の節約額

バベル(Babbel)のマーケティングチームおよび人材育成・能力開発(L&D)チームは、毎月31時間を削減しています。

アップロードする前に:クオリティを左右する3つの要素

まずは音源をお聴きください。話者が1人で明瞭な音声ほど、文字起こしの精度が最も高くなります。処理速度を上げるため、1GBを超えるものはすべて分割してください。開始する前に用語集を読み込んでおけば、すべてのファイルを通じて、繰り返し登場する名前や用語の表記が統一されます。そして文字起こしを一度修正すれば、その修正がすべての言語に反映されます。

録音データの次の送信先

同じ書き起こしデータが、字幕、吹き替え、ナレーション、あるいはプレーンな翻訳テキストといった、あらゆるメディアワークフローに活用されます。実際に手元にあるものに合った道具を選んでください。

あらゆる録音を、あらゆる言語で理解可能に

ファイルをアップロードし、一度文字起こしを修正すれば、必要な言語数のテキスト、字幕、または音声をエクスポートできます。15,000Smartwords付きで15日間無料 — 翻訳機能をフルでご利用可能、クレジットカード不要。

音声翻訳 — 詳細情報(注意事項)

無料の音声翻訳ツールはありますか?

Smartcatはクレジットカード不要で15日間無料でお試しいただけます。15,000Smartwordsとすべての翻訳機能を完全にご利用いただけます。永久無料プランはありません。その後は、分単位やファイル単位ではなく、翻訳された文字数(ワード数)単位でのお支払いとなります。

アップロード可能な音声フォーマットは何ですか?

MP3、MP2/M2A、M4A、AAC、OGG、FLAC、WMA。ファイルサイズは最大6GBまで対応していますが、処理を高速化するため、1GBを超えるものはパーツに分割することをお勧めします。音声が動画コンテナ内にある場合は、代わりにAI動画翻訳ツールをご利用ください。このフローはMP4、MOV、MKV、AVI、その他ドキュメントに記載されている動画形式に対応しています。

録音(録画)はどのくらいの長さまで可能ですか?

公開されている再生時間の制限はありません。Smartcatは音声について、分単位または時間単位の最大長を文書化していません。実際に存在する制限はファイルサイズです。1ファイルあたり最大6GBまでであり、1GBを超えるものは分割する価値があります。つまり、2時間のインタビューというのは長さの問題ではなく、規模の問題なのです。

1つのプロジェクトにいくつのファイルを入れることができますか?

ファイル数に上限はありません。プロジェクトは、1件の録音から数百件のファイルの一括アップロードまで多岐にわたりますが、これはプランによって変わることはありません。プランの階層による違いは、アップロード制限ではなく、連携機能やMarketplaceの請求形態にあります。唯一の上限は、ファイルごとのサイズです。

同一プロジェクト内のファイルは用語集や翻訳メモリも共有するため、繰り返し登場する話者名や製品用語がファイルごとにブレることなく、すべてのファイルで同一の訳語として出力されます。

YouTube動画の音声を翻訳することはできますか?

リンクを貼り付けることによってではなく。記録されるすべてのルートはファイルから始まります。コンピューターから音声をアップロードするか、Smart Driveから選択します。ですから、YouTubeの動画の場合はまずファイルをダウンロードします。そして、音声だけでなく動画もあるのであれば、AI動画翻訳ツールを使用する方がスムーズです。音声だけでなく、字幕やタイミングの調整も処理してくれるからです。

歌を翻訳してもいいですか?

はい、文字通り、歌詞の正確な翻訳がテキストとして得られます。詩も同様に扱われます。つまり直訳されるため、韻律を整えた訳文を受け取るのではなく、その作品が何を語っているかを知ることができるのです。提供されないのは、韻を踏んで歌えるバージョンです。これはクリエイティブな翻案であり、デモの予約を通じて人間の言語学者に依頼することができます。

翻訳は音声で受け取れますか、それともテキストですか?

エクスポート時の選択肢:翻訳されたドキュメント、SRT/VTT字幕ファイル、または対象言語のAI生成ボイストラック。3つともすべて同じ文字起こしから作成されているため、再翻訳することなく複数の形式でエクスポートできます。音声トラックに関するひとつの制限事項:合成音声は原稿をうまく読み上げることはできますが、演技をすることはできません。そのため、感情豊かな表現や演技を伴う表現には、人間の声優やナレーターを起用してください。

私が使用する前に、人間がその翻訳をチェックすることはできますか?

はい。同じワークフロー内で、Smartcatのマーケットプレイスから審査済みのプロの校正者に任意の言語を割り当てることができ、彼らの修正内容は次回の翻訳メモリのトレーニングに活用されます。

正直なところ、文字起こしの精度はどの程度ですか?

モデルよりも録音状態によります。明瞭な単一話者の音声は非常に高い精度で文字起こしされますが、BGM、複数人の同時発話、強い訛りは精度を低下させます。そして、誤った文字起こし結果は、もっともらしく誤った翻訳を生み出してしまいます。

そのため、このフローでは文字起こしと翻訳の間に編集可能な書き起こしテキストを配置しています。増殖する前に、現実を一度修正するのです。それに応じた予算を組んでください。ノイズが非常に多い音源や訛りの強い音源は、クリアな音源に比べて編集作業により多くの時間が必要となります。

私の録音(記録)は機密として扱われますか?

SmartcatはSOC 2 Type IIに準拠しています。ファイルは転送時および保存時に暗号化され、ワークスペースは分離されており、アクセスはロールベースで管理されています。詳細はセキュリティページをご覧ください。

お探しの質問への回答がここにありませんか?デモを予約 — 個別相談、契約の義務はありません。

情報源

  1. SmartcatSmartcat AIがスミス・アンド・ネフューによるeラーニング翻訳の納期短縮をどのように実現したか。スミス・アンド・ネフューの事例紹介。

  2. Smartcat。スタンレー・ブラック&デッカーが翻訳コストを最大70%削減した方法スタンレー・ブラック・アンド・デッカーのケーススタディ。

  3. SmartcatBabbelのチームが毎月31時間を節約する方法。Babbelの事例研究。