オーディオからテキストへ
どんなオーディオフォーマットでも一つのページで
MP3, M4A, WAV, FLAC, OGG, AAC, WebMなどをドロップ。タイムスタンプ付きのクリーンなトランスクリプト、AI要約、エクスポートを取得。
ファイルをここにドロップ
またはクリックして参照
MP3 · MP4 · WAV · M4A · OGG · WEBM · FLAC · 最大25MB · 最大30分
仕組み
- 1
どんなオーディオファイルでもドロップ
デバイスからアップロードするか、ドラッグ&ドロップ。MP3, M4A, WAV, FLAC, OGG, AAC, WebMなど。
- 2
Whisperがオーディオを文字起こし
Whisper large-v3がバックエンドで動作し、自動句読点、段落区切り、セグメントごとのタイムスタンプを生成します。
- 3
編集、エクスポート、共有
トランスクリプトを確認し、AIで要約し、50以上の言語に翻訳し、TXT, DOCX, PDF, SRTとしてエクスポート。
タイムスタンプ付きの行ごとのクリーンなレイアウト。読みやすさに最適。
なぜ一つのオーディオからテキストへのツールが優れているのか
変換不要のステップ
どんなオーディオフォーマットでも直接アップロード。時間を節約し、オリジナルの品質を保持、ロスのあるコンバーターを通す必要なし。
自動フォーマット検出
Mictooはファイルヘッダーからフォーマットを検出し、そのコーデックに最適な文字起こし設定を適用します。
フォーマット間で同じ精度
Whisper large-v3によって駆動され、MP3, WAV, FLAC, WebMのいずれのファイルでも一貫した精度を実現。
要約とエクスポートが含まれています
AI要約を取得し、50以上の言語に翻訳し、TXT, SRT, VTT, DOCXとしてエクスポート。追加プランは不要。
このページが適しているとき
混合フォーマットアーカイブ
どんなデバイスで録音されたファイルでも、一つのアップロードで対応。
不明なファイルフォーマット
レコーダーが生成したものがわからない場合でも、検出して文字起こしします。
迅速な文字起こし
セットアップ、コンバーター、手動フォーマット選択なしで迅速な結果。
クロスツールワークフロー
Zoom, Descript, Audacity, GarageBand, または任意のDAWからエクスポートされたファイルをドロップ。
初めてのユーザー
サインアップ不要、シンプルなUI、無料。どんなツールにもコミットする前の安全な最初の試み。
オーディオ品質テスト
明瞭さを確認し、粗い録音からどれだけの使えるテキストが得られるかを確認。
ファイルフォーマットよりもオーディオ品質が重要
Mictooがフォーマットを検出する方法
1010
ファイルヘッダー(マジックバイト)を読み取って瞬時にフォーマットを特定します。これにより、正確な文字起こしのための最適な設定が保証され、フォーマットを手動で選択する必要がなくなります。
サポートされているオーディオフォーマット
| フォーマット | 一般的な出所 | 最適な用途 | 直接アップロード |
|---|---|---|---|
| MP3 | レコーダー、ポッドキャスト、ダウンロード | 一般的な用途、小さなファイル | |
| M4A | iPhoneボイスメモ、Appleアプリ | 高品質、効率的なサイズ | |
| WAV | 録音、DAWエクスポート | 非圧縮、プロオーディオ | |
| FLAC | 音楽アーカイブ、高音質 | ロスレス品質 | |
| OGG | オープンソース録音、アプリ | ウェブとストリーミング | |
| AAC | モバイル録音、ストリーミング | バランスの取れた品質とサイズ | |
| WebM | ウェブ録音、ブラウザ | オンラインビデオとオーディオ |
各フォーマットについて知っておくべきこと
これらのどれもアップロード前に変換する必要はありません。以下の注意事項は、フォーマットごとに人々が実際に引っかかる点です。
MP3
レコーダー、ポッドキャストのダウンロード、チャットで共有されるもののデフォルト。ロスがあり、小さく、普遍的に読み取れる。
- 受け入れるもの
- 32 kbps以上の任意のビットレート、モノラルまたはステレオ、CBRまたはVBR。文字起こし前の再エンコードは不要
- ビットレートと精度
- スピーチの場合、約64 kbps以上であれば、ビットレートを上げても効果はありません。Whisperは内部で16 kHzモノラルにリサンプリングします
- 可変ビットレート
- VBRファイルは古いプレーヤーで誤った再生時間を報告することがあります。それはトランスクリプトやタイムスタンプには影響しません
- ID3タグ
- 文字起こし中は無視されます。トランスクリプトはプレーンテキストとして返されるため、エピソードのメタデータマッピングは独自のシステムで保持してください
M4A
コーデックではなくコンテナ:AACオーディオ、時にはALACがMP4ラッパー内に。この形式はiPhoneが生成します。
- 読み取り方法
- ftypボックスを解析し、AACトラックを抽出し、再エンコードせずにWhisperに渡します
- 出所
- iPhoneのボイスメモ、GarageBand、FaceTime、Apple Podcastsのダウンロード
- iPhoneから
- メモを共有し、ファイルまたはiCloudに保存してからアップロードします。変換ステップは不要です
- ALAC内
- 一部の.m4aファイルはAACの代わりにApple Losslessを保持しています。どちらもここで動作し、どちらも事前に変換する必要はありません
WAV
非圧縮PCM。アップロードする最大のファイルであり、最もクリーンなソースですが、部屋のノイズがフォーマットよりも重要です。
- 受け入れるもの
- 16, 24, 32ビットPCM、任意のサンプルレート、モノラルまたはステレオ、さらにBroadcast Wave (BWF)
- BWFメタデータ
- bextおよびiXMLチャンクはタイムコード、シーン、テイクを保持しており、トランスクリプトには表示されません
- サイズ警告
- CD品質で約10 MB/分なので、25分のステレオ録音は匿名制限を超えます
- 先に縮小
- 64 kbpsのモノラルでエクスポートすると、スピーチのために何も失わず、ファイルを10〜15倍に削減します
FLAC
ロスレス圧縮、同じWAVの約半分のサイズ。口述歴史アーカイブやフィールド録音ワークフローで一般的。
- 受け入れるもの
- ネイティブFLAC(マジックバイトfLaC)およびOGGコンテナ内のFLAC、モノラルまたはステレオ、最大192 kHz、16または24ビット
- 変換不要
- ファイルはそのまま通過します。最初にMP3に変換すると情報が失われるだけです
- Vorbisコメント
- 文字起こし中は無視されます。アーカイブがこれらのタグに依存している場合、マッピングをトランスクリプトの外に保持してください
- サイズの価値は?
- 精度のためには、いいえ。FLACと適切なMP3は同じように文字起こしされます。Whisperが必要だからではなく、保存用コピーとしてFLACを保持してください
WEBM
通常Opusオーディオを保持するMatroskaコンテナ、時にはVorbis。これはブラウザや画面録画ソフトが生成します。
- 出所
- Loom, OBS, ブラウザMediaRecorder API, Google Meetエクスポート, YouTubeダウンロード
- ビデオ内?
- デマックスし、ビデオトラックを削除し、オーディオを文字起こしします。抽出する必要はありません
- コーデック
- 最近のものではOpus、古いファイルではVorbis。どちらも変換なしで処理されます
- なぜファイルが大きいのか
- 画面録画はほとんどがビデオです。20 MBのWEBMは通常3〜4 MBのオーディオを含んでいます
よくある質問
どのオーディオフォーマットをアップロードできますか?
MP3, M4A, WAV, FLAC, OGG, AAC, WebM, MP4, MOV, さらにAIFF, AU, OPUS, MPEGも。通常のメディアプレーヤーで再生できるファイルなら、Mictooで文字起こしできます。ビデオファイルも受け付けており、サーバー側でオーディオトラックを抽出します。
文字起こしにはどれくらい時間がかかりますか?
通常は数秒です。10分のオーディオファイルは約15〜30秒で完了し、60分のポッドキャストは約1分で完了します。自動分割される長いファイルは、チャンクが並行して文字起こしされ、結合されるため、少し時間がかかります。
オーディオ文字起こしは本当に無料ですか?
はい。サインアップなしでファイルごとに最大25 MBまで無料で文字起こしできます。無料アカウントを作成すると、ファイルごとの制限が60 MBに引き上げられ、最大180 MBのファイルは自動的にチャンクに分割され、単一のトランスクリプトに結合されます。クレジットカードも隠れた料金もありません。
私のオーディオファイルは保存されますか?
いいえ。ファイルは音声認識プロバイダー(速度のためにGroq、Replicate, Deepgram, OpenAIをフォールバックとして使用)に直接ストリーミングされ、処理後に削除されます。Mictooはオーディオを保持せず、プロバイダーはAPIデータでトレーニングしません。
ファイルフォーマットは精度に影響しますか?
フォーマットよりもオーディオの品質がはるかに重要です。圧縮されたMP3のクリーンな音声は、非圧縮WAVのノイズの多いオーディオよりも良く文字起こしされます。Mictooはすべてのフォーマットで同じWhisper large-v3モデルを使用するため、すべてのサポートされているタイプで精度は一貫しています。
オーディオを特定のフォーマットに変換する必要がありますか?
いいえ。それがこのページのポイントです。レコーダー、DAW、電話、またはダウンロードツールが生成したものをそのままアップロードしてください。ファイルヘッダーからフォーマットを検出し、Whisperに直接ルーティングします。コンバーターステップや品質の損失はありません。
ダウンロード前にトランスクリプトを編集できますか?
はい。文字起こし後にエディタービューに切り替えて、間違った名前や専門用語を修正できます。リーダー(行ごとのタイムスタンプ)とエディター(プレーンテキスト)モードの両方が利用可能です。エクスポートは最後に編集したバージョンを使用します。
文字起こしは何カ国語に対応していますか?
英語、スペイン語、フランス語、ドイツ語、ポルトガル語、ロシア語、ウクライナ語、日本語、中国語、アラビア語など、50以上の言語に対応しています。自動検出はほとんどのファイルで機能しますが、短いクリップの場合はアップロードフォームで言語を手動で選択できます。
トランスクリプトを翻訳できますか?
はい。文字起こし後に「翻訳」をクリックし、28のターゲット言語から選択します。翻訳はリーダービューとすべてのエクスポートフォーマットで利用可能です。タイムスタンプは保持されるため、翻訳されたSRTはオーディオに一致したままです。
どのエクスポートフォーマットが利用可能ですか?
TXT(プレーンテキスト)、SRT(字幕)、タイムスタンプ付きTXT、DOCX(Wordドキュメント)。登録ユーザーはPDF、VTT(ウェブキャプション)、JSONも利用できます。文字起こしが完了した後、ダウンロードメニューからすべてのエクスポートが利用可能です。