AI 文字起こし

音声と動画を テキストに変換

主な30言語で高い認識精度を目指すAI音声・動画文字起こし。その他の一部の言語にも対応していますが、誤認識が増える場合があります。

3GP, AAC, AMR, AWB, FLAC, M4A, MKA, MKV, MOV, MP2, MP3, MP4, MPG, OGA, OGG, OPUS, TS, WAV, WEBA, WEBM, WMA, WMV

3 ステップで文字起こし

録音からすぐ使えるテキストまで、シンプルな流れで進められます。

01

録音をアップロード

音声・動画ファイルをブラウザにドラッグ&ドロップできます。最大 2 GB、22 種類の形式に対応しています。

02

AI が文字起こし

UUScribe が音声、タイムスタンプ、話者の切り替わりを処理します。

03

確認してエクスポート

結果を確認し、必要な形式でダウンロードします。

用途に合わせて自由にエクスポート

作業に合った形式で文字起こしをダウンロードできます。シンプルなテキストからプロ向け字幕形式まで対応しています。

  • 文書用:TXT、PDF、DOCX
  • 字幕用:SRT、VTT
  • データ分析用:CSV
.TXT
.PDF
.DOCX
.SRT
.VTT
.CSV

プランを選択

無料で始めて、文字起こしの利用量に合わせてアップグレードできます。

無料

$0

UUScribe を試すために

  • 月 120 分
  • 1 日 3 ファイル
  • 各ファイルは最大 30 分
  • 基本 TXT エクスポート

従量課金

$9.9 一回払い
  • 1200 分付き
  • AI 要約とマインドマップ
  • 柔軟なアップロード
  • すべてのエクスポート形式
  • 話者分離
  • API アクセス
  • 優先サポート

Pro

$10 月額

  • 月 2000 分
  • 1タスクにつき最大3回翻訳
  • AI 要約とマインドマップ
  • 柔軟なアップロード
  • すべてのエクスポート形式
  • 話者分離
  • API アクセス
  • 優先サポート

Max

$20 月額

  • 月 4800 分
  • 翻訳回数無制限
  • AI 要約とマインドマップ
  • 柔軟なアップロード
  • すべてのエクスポート形式
  • 話者分離
  • API アクセス
  • 優先処理
  • 優先サポート

法人向け機能が必要ですか?プライベート環境への導入、カスタム連携、専任サポートをご提供します。 お問い合わせ

よくある質問

どのファイル形式に対応していますか?
UUScribe は MP3、WAV、M4A、FLAC、MP4、MOV、MKV、WEBM など22種類の音声・動画形式に対応しています。1ファイルの長さは最大12時間(無料プランは30分)、音声ファイルのサイズは最大2 GBです。パソコンのブラウザでは動画を音声に変換してからアップロードします。スマートフォンでは元の動画を直接アップロードするため、動画も2 GB以内にしてください。アップロードを速くするには、事前にご自身で動画を音声に変換することをおすすめします。
何言語に対応していますか?
UUScribe は主に次の30言語に対応しており、一般的に認識精度が高くなります:中国語、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語、ノルウェー語。その他の一部の利用者が少ない言語にも対応していますが、誤認識が増える場合があります。精度は録音品質、アクセント、背景雑音にも左右されます。
無料プランはありますか?
はい。無料プランには毎月 120 分の文字起こしが含まれます。
YouTube 動画を文字起こしできますか?
はい。YouTube URL を貼り付けるだけで、タイムスタンプ付きの完全な文字起こしを作成できます。
無料プランで API を利用できますか?
無料プランには API アクセスは含まれません。
ファイルはどのくらい保存されますか?
元の音声は初期設定で365日保存されます。ログインしたユーザーは保存期間を短くするか、自動削除しない設定を選べます。文字起こし、要約、エクスポートファイルはユーザーが削除するまで保存されます。詳細はプライバシーポリシーをご覧ください。
話者分離を使う場合、録音時間はどれくらいが適切ですか?
話者分離を使う場合は、2時間以内の録音をおすすめします。長い録音では話者の識別精度が下がる場合があります。これは品質上の推奨であり、ファイルの最大時間は12時間です。