音声文字起こし — 無料オンライン変換

あらゆる音声録音を数分で正確で編集可能なテキストに。Whisper AI音声認識を採用——ファイルをアップロードすれば文字起こしが返ってきます。インストール不要です。

音声・動画ファイルをアップロード
またはここにドラッグ&ドロップ
無料 · 最大50MB · 登録不要
最大99%の精度90以上の言語1時間の音声を2分で30以上のファイル形式
4.8 ratingTrustpilotG2SOC 2GDPRSSL

speech-to-text(音声認識)とは?

speech-to-text(自動音声認識、ASR)とは、音声や動画の録音に含まれる話し言葉を文字テキストに変換する技術です。発話の音を解析して文字起こしを生成し、多くの場合は誰がいつ話したかも示します。最新のシステムは複数の話者、多数の言語、さまざまな録音状況に対応しますが、背景雑音、マイクからの距離、強い訛り、声の重なりがあると精度は下がります。

speech-to-text は、録音された会話を読んだり検索したり引用したりできる形に変えるために使われます。会議、インタビュー、講義、ポッドキャスト、通話、動画などが対象です。ひと言を探すためにファイルを再生し直す代わりに、数秒で目を通せて共有もできる文字記録が手に入ります。

ひと目でわかる

入力音声・動画(30以上の形式)をアップロード、または対応リンクを貼り付け。当社サーバーで処理
話者ラベル対応。話者ごとに分けてラベル付け
タイムスタンプ単語単位。行をクリックするとその箇所を再生
検索1つの文字起こし内の検索と、ライブラリ全体のキーワード検索
AIパス要約、重要な引用、アクション、決定事項、リスク、期限(無料アカウント)
書き出しTXT・JSONは無料。PDF・DOCX・SRT・VTTは有料プラン。元の音声は無料
言語90以上の言語。エディターからの翻訳(アカウント必要)
無料の上限50MBまで無料・登録不要。24時間以内に削除。AI学習には一切使用しない
ライブ/リアルタイム文字起こしなし。アップロードが前提で、話しながらではなく処理後にテキストが表示

実際の音声のために作られた文字起こしツール

Whisper AIエンジン

Whisper搭載の音声認識

当ツールの音声認識はOpenAI Whisperをベースに構築。訛りや背景ノイズ、専門用語にも強く、発話を句読点付きのきれいなテキストに変換します。

クリアな音声で最大99%の精度
訛り・ノイズ・声の重なりに対応
自動句読点と話者ラベル
Whisper搭載の音声認識
聞きながら同期して読む
同期再生

聞きながら同期して読む

再生に合わせてテキストがリアルタイムにハイライト。文をクリックすればその瞬間にジャンプ。1時間の音声確認が数分で終わります。

音声とテキストが同期し続けます
文をクリックして再生位置を移動
AI要約で要点を把握
簡単エクスポート

あなたの音声を、好きなテキスト形式で

仕上がったテキストを必要な形で出力:整ったドキュメント、任意のエディタ用プレーンテキスト、タイムスタンプ付き字幕ファイル。NotionやGoogle Docsへのコピーも可能。

共有に便利なPDFダウンロード
TXT・DOCXでどこでも編集
タイムスタンプ付きSRT/VTT字幕
あなたの音声を、好きなテキスト形式で

実際の例

2人の話者の録音を文字起こしして要約した例。説明用です。

文字起こし
00:04:12
話者1
試験運用は6週間実施して、応答時間がおよそ3分の1短くなりました。
00:04:29
話者2
有望ですね。増員した人員が抜けたあとも、その改善は続きましたか?
00:04:41
話者1
おおむね続きました。20パーセント前後の改善で落ち着いていて、持続可能だと考えています。
00:05:03
話者2
これをまとめて、月末までに取締役会の決定を取り付けましょう。
AIの出力
要約
6週間の試験運用で応答時間が約3分の1短縮。臨時人員が抜けたあとも改善は20%前後で落ち着き、話者はこれを持続可能と見ている。
重要な引用
「20パーセント前後の改善で落ち着いていて、持続可能だと考えています。」— 話者1(00:04:41)
アクション
試験運用の結果をまとめて取締役会に提出する。(話者2)
期限
月末までに取締役会の決定。

これは説明用の例です。AIは固定テンプレートを埋めるのではなく、録音で実際に話された内容を要約するため、表現や項目は内容によって変わります。

speech-to-text と voice-to-text の違い

ここでの speech-to-text は、広い意味での音声認識を指します。会議、インタビュー、通話、講義、ポッドキャスト、動画など、あらゆる媒体の録音音声を文字起こしし、複数の話者を分離します。ファイルに複数の声があれば、それぞれにラベルが付きます。すでに存在する録音のための汎用の認識ツールです。

voice-to-text は通常、1人がマイクに向かって話して文章を作成する口述入力を指します。それをお探しなら、voice-to-text のページがその流れを扱います。このページは、1人または複数人の既存の録音を、読みやすく検索できる文字起こしに変えるためのもので、自分の口述を取り込むためのものではありません。

どちらの場合も、まずアップロードから始まります。録音をアップロード(または対応リンクを貼り付け)すると、処理後に文字起こしが返ってきます。TranscribeThis は話しながらのライブ文字起こしは行わず、ブラウザのマイクからの録音もありません。音声の再生に合わせて1行ずつハイライトされる文字起こしは、完成した文字起こしを見直すための別の実在する機能であり、リアルタイム文字起こしではありません。

Speech to Text transcript preview

3ステップで音声をテキストに

録音をアップロードするだけ——インストール不要。

STEP 01
音声を追加

音声・動画ファイル(MP3、WAV、M4A、MP4——30以上の形式)をドラッグ&ドロップするか、対応リンクを貼り付けてください。

STEP 02
Whisper AIが文字起こし

音声認識エンジンが数分でテキスト化。タイムスタンプ、句読点、話者検出付きです。

STEP 03
編集・出力・活用

内蔵エディタで仕上げて、PDF、TXT、DOCX、SRT、VTTでダウンロード——どこへでもコピーできます。

TranscribeThisの他のツール

よくある質問

音声文字起こしはどう動作しますか?

録音をアップロードすると、Whisper AI音声認識が句読点とタイムスタンプ付きのテキストに変換し、編集・書き出しできます。ファイルは当社サーバーで処理され、インストールは不要です。

このツールは無料ですか?

はい。登録不要で、50MBまでのファイルを無料で文字起こしできます。有料プランではより長いファイルや大量処理、高度な機能が利用できます。

Whisperの精度はどのくらいですか?

クリアな発話では、Whisperベースの認識は最大99%の精度に達します。背景ノイズや強い訛りのある録音はそれを下回ります。精度は音質・言語・発言の重なりによって変わります。

音声の録音をアップロードできますか?

はい。30以上の形式のいずれかで音声・動画の録音をアップロードすると、句読点とタイムスタンプ付きの文字起こしが得られ、編集・書き出しできます。TranscribeThisはアップロードされた録音を文字起こしします。話している最中にリアルタイムで文字起こしはしません。

対応言語は?

90ヶ国語以上を自動判定。完成した文字起こしのワンクリック翻訳にも対応しています。

どの形式のファイルをアップロードできますか?

MP3、WAV、M4A、MP4、MOVなど30形式以上の音声・動画に対応。音声が入っていればテキスト化できます。

変換したテキストはダウンロードできますか?

はい。PDF、TXT、DOCX、SRT、VTTで出力でき、NotionやGoogle Docsに直接コピーすることもできます。

録音のプライバシーは守られますか?

ファイルは通信中も保存中も暗号化され、無料プランでは24時間以内に自動削除。AIモデルの学習に使われることはありません。