speech-to-text(音声認識)とは?
speech-to-text(自動音声認識、ASR)とは、音声や動画の録音に含まれる話し言葉を文字テキストに変換する技術です。発話の音を解析して文字起こしを生成し、多くの場合は誰がいつ話したかも示します。最新のシステムは複数の話者、多数の言語、さまざまな録音状況に対応しますが、背景雑音、マイクからの距離、強い訛り、声の重なりがあると精度は下がります。
speech-to-text は、録音された会話を読んだり検索したり引用したりできる形に変えるために使われます。会議、インタビュー、講義、ポッドキャスト、通話、動画などが対象です。ひと言を探すためにファイルを再生し直す代わりに、数秒で目を通せて共有もできる文字記録が手に入ります。
ひと目でわかる
| 入力 | 音声・動画(30以上の形式)をアップロード、または対応リンクを貼り付け。当社サーバーで処理 |
|---|---|
| 話者ラベル | 対応。話者ごとに分けてラベル付け |
| タイムスタンプ | 単語単位。行をクリックするとその箇所を再生 |
| 検索 | 1つの文字起こし内の検索と、ライブラリ全体のキーワード検索 |
| AIパス | 要約、重要な引用、アクション、決定事項、リスク、期限(無料アカウント) |
| 書き出し | TXT・JSONは無料。PDF・DOCX・SRT・VTTは有料プラン。元の音声は無料 |
| 言語 | 90以上の言語。エディターからの翻訳(アカウント必要) |
| 無料の上限 | 50MBまで無料・登録不要。24時間以内に削除。AI学習には一切使用しない |
| ライブ/リアルタイム文字起こし | なし。アップロードが前提で、話しながらではなく処理後にテキストが表示 |
実際の音声のために作られた文字起こしツール
Whisper搭載の音声認識
当ツールの音声認識はOpenAI Whisperをベースに構築。訛りや背景ノイズ、専門用語にも強く、発話を句読点付きのきれいなテキストに変換します。


聞きながら同期して読む
再生に合わせてテキストがリアルタイムにハイライト。文をクリックすればその瞬間にジャンプ。1時間の音声確認が数分で終わります。
あなたの音声を、好きなテキスト形式で
仕上がったテキストを必要な形で出力:整ったドキュメント、任意のエディタ用プレーンテキスト、タイムスタンプ付き字幕ファイル。NotionやGoogle Docsへのコピーも可能。

実際の例
2人の話者の録音を文字起こしして要約した例。説明用です。
これは説明用の例です。AIは固定テンプレートを埋めるのではなく、録音で実際に話された内容を要約するため、表現や項目は内容によって変わります。
speech-to-text と voice-to-text の違い
ここでの speech-to-text は、広い意味での音声認識を指します。会議、インタビュー、通話、講義、ポッドキャスト、動画など、あらゆる媒体の録音音声を文字起こしし、複数の話者を分離します。ファイルに複数の声があれば、それぞれにラベルが付きます。すでに存在する録音のための汎用の認識ツールです。
voice-to-text は通常、1人がマイクに向かって話して文章を作成する口述入力を指します。それをお探しなら、voice-to-text のページがその流れを扱います。このページは、1人または複数人の既存の録音を、読みやすく検索できる文字起こしに変えるためのもので、自分の口述を取り込むためのものではありません。
どちらの場合も、まずアップロードから始まります。録音をアップロード(または対応リンクを貼り付け)すると、処理後に文字起こしが返ってきます。TranscribeThis は話しながらのライブ文字起こしは行わず、ブラウザのマイクからの録音もありません。音声の再生に合わせて1行ずつハイライトされる文字起こしは、完成した文字起こしを見直すための別の実在する機能であり、リアルタイム文字起こしではありません。

3ステップで音声をテキストに
録音をアップロードするだけ——インストール不要。
音声・動画ファイル(MP3、WAV、M4A、MP4——30以上の形式)をドラッグ&ドロップするか、対応リンクを貼り付けてください。
音声認識エンジンが数分でテキスト化。タイムスタンプ、句読点、話者検出付きです。
内蔵エディタで仕上げて、PDF、TXT、DOCX、SRT、VTTでダウンロード——どこへでもコピーできます。
TranscribeThisの他のツール
よくある質問
音声文字起こしはどう動作しますか?
録音をアップロードすると、Whisper AI音声認識が句読点とタイムスタンプ付きのテキストに変換し、編集・書き出しできます。ファイルは当社サーバーで処理され、インストールは不要です。
このツールは無料ですか?
はい。登録不要で、50MBまでのファイルを無料で文字起こしできます。有料プランではより長いファイルや大量処理、高度な機能が利用できます。
Whisperの精度はどのくらいですか?
クリアな発話では、Whisperベースの認識は最大99%の精度に達します。背景ノイズや強い訛りのある録音はそれを下回ります。精度は音質・言語・発言の重なりによって変わります。
音声の録音をアップロードできますか?
はい。30以上の形式のいずれかで音声・動画の録音をアップロードすると、句読点とタイムスタンプ付きの文字起こしが得られ、編集・書き出しできます。TranscribeThisはアップロードされた録音を文字起こしします。話している最中にリアルタイムで文字起こしはしません。
対応言語は?
90ヶ国語以上を自動判定。完成した文字起こしのワンクリック翻訳にも対応しています。
どの形式のファイルをアップロードできますか?
MP3、WAV、M4A、MP4、MOVなど30形式以上の音声・動画に対応。音声が入っていればテキスト化できます。
変換したテキストはダウンロードできますか?
はい。PDF、TXT、DOCX、SRT、VTTで出力でき、NotionやGoogle Docsに直接コピーすることもできます。
録音のプライバシーは守られますか?
ファイルは通信中も保存中も暗号化され、無料プランでは24時間以内に自動削除。AIモデルの学習に使われることはありません。
