mictoo
どんなオーディオフォーマットでも · 無料 · サインアップ不要

オーディオからテキストへ
どんなオーディオフォーマットでも一つのページで

MP3, M4A, WAV, FLAC, OGG, AAC, WebMなどをドロップ。タイムスタンプ付きのクリーンなトランスクリプト、AI要約、エクスポートを取得。

Free
Auto-deleted
50+ languages
AI summary (OpenAI)
Chat with transcript

ファイルをここにドロップ

またはクリックして参照

MP3 · MP4 · WAV · M4A · OGG · WEBM · FLAC  ·  最大25MB  ·  最大30分

180分・サインイン

大きいファイル? 圧縮方法を見る。

長い録音? 分割方法を見る。

すべての一般的なオーディオフォーマット、一つのアップロード

仕組み

  1. 1

    どんなオーディオファイルでもドロップ

    デバイスからアップロードするか、ドラッグ&ドロップ。MP3, M4A, WAV, FLAC, OGG, AAC, WebMなど。

  2. 2

    Whisperがオーディオを文字起こし

    Whisper large-v3がバックエンドで動作し、自動句読点、段落区切り、セグメントごとのタイムスタンプを生成します。

  3. 3

    編集、エクスポート、共有

    トランスクリプトを確認し、AIで要約し、50以上の言語に翻訳し、TXT, DOCX, PDF, SRTとしてエクスポート。

interview-notes.mp3
Completed·180 words
0:00 / 1:39
Search transcript…
0:00Hi, thanks for making time today. Let us start simple.
0:07I started making short films back in college as a hobby.
0:15What draws you to a story before you commit to it?
0:24Real people, real moments. I observe first, script later.
0:34How do you keep the crew energy up on long shoots?
0:42Small rituals. Coffee at call time, a walk before magic hour.
0:54What advice would you give someone starting out?
1:02Watch a lot. Then shoot even more. Nothing beats reps.

タイムスタンプ付きの行ごとのクリーンなレイアウト。読みやすさに最適。

なぜ一つのオーディオからテキストへのツールが優れているのか

変換不要のステップ

どんなオーディオフォーマットでも直接アップロード。時間を節約し、オリジナルの品質を保持、ロスのあるコンバーターを通す必要なし。

自動フォーマット検出

Mictooはファイルヘッダーからフォーマットを検出し、そのコーデックに最適な文字起こし設定を適用します。

フォーマット間で同じ精度

Whisper large-v3によって駆動され、MP3, WAV, FLAC, WebMのいずれのファイルでも一貫した精度を実現。

要約とエクスポートが含まれています

AI要約を取得し、50以上の言語に翻訳し、TXT, SRT, VTT, DOCXとしてエクスポート。追加プランは不要。

このページが適しているとき

混合フォーマットアーカイブ

どんなデバイスで録音されたファイルでも、一つのアップロードで対応。

不明なファイルフォーマット

レコーダーが生成したものがわからない場合でも、検出して文字起こしします。

迅速な文字起こし

セットアップ、コンバーター、手動フォーマット選択なしで迅速な結果。

クロスツールワークフロー

Zoom, Descript, Audacity, GarageBand, または任意のDAWからエクスポートされたファイルをドロップ。

初めてのユーザー

サインアップ不要、シンプルなUI、無料。どんなツールにもコミットする前の安全な最初の試み。

オーディオ品質テスト

明瞭さを確認し、粗い録音からどれだけの使えるテキストが得られるかを確認。

ファイルフォーマットよりもオーディオ品質が重要

クリアな音声
背景ノイズが最小限のクリーンなオーディオが最も正確なトランスクリプトを提供します。
ノイズの多いオーディオ
背景ノイズや重複は、フォーマットに関係なく精度を低下させる可能性があります。
圧縮されたオーディオ
非常に低いビットレートや重い圧縮は重要な詳細を削除する可能性があります。

Mictooがフォーマットを検出する方法

1010
1010

ファイルヘッダー(マジックバイト)を読み取って瞬時にフォーマットを特定します。これにより、正確な文字起こしのための最適な設定が保証され、フォーマットを手動で選択する必要がなくなります。

ID3·MP3
ftyp·M4A
RIFF·WAV
fLaC·FLAC
OggS·OGG
ADTS·AAC
EBML·WebM

サポートされているオーディオフォーマット

フォーマット一般的な出所最適な用途直接アップロード
MP3レコーダー、ポッドキャスト、ダウンロード一般的な用途、小さなファイル
M4AiPhoneボイスメモ、Appleアプリ高品質、効率的なサイズ
WAV録音、DAWエクスポート非圧縮、プロオーディオ
FLAC音楽アーカイブ、高音質ロスレス品質
OGGオープンソース録音、アプリウェブとストリーミング
AACモバイル録音、ストリーミングバランスの取れた品質とサイズ
WebMウェブ録音、ブラウザオンラインビデオとオーディオ

各フォーマットについて知っておくべきこと

これらのどれもアップロード前に変換する必要はありません。以下の注意事項は、フォーマットごとに人々が実際に引っかかる点です。

MP3

レコーダー、ポッドキャストのダウンロード、チャットで共有されるもののデフォルト。ロスがあり、小さく、普遍的に読み取れる。

受け入れるもの
32 kbps以上の任意のビットレート、モノラルまたはステレオ、CBRまたはVBR。文字起こし前の再エンコードは不要
ビットレートと精度
スピーチの場合、約64 kbps以上であれば、ビットレートを上げても効果はありません。Whisperは内部で16 kHzモノラルにリサンプリングします
可変ビットレート
VBRファイルは古いプレーヤーで誤った再生時間を報告することがあります。それはトランスクリプトやタイムスタンプには影響しません
ID3タグ
文字起こし中は無視されます。トランスクリプトはプレーンテキストとして返されるため、エピソードのメタデータマッピングは独自のシステムで保持してください

M4A

コーデックではなくコンテナ:AACオーディオ、時にはALACがMP4ラッパー内に。この形式はiPhoneが生成します。

読み取り方法
ftypボックスを解析し、AACトラックを抽出し、再エンコードせずにWhisperに渡します
出所
iPhoneのボイスメモ、GarageBand、FaceTime、Apple Podcastsのダウンロード
iPhoneから
メモを共有し、ファイルまたはiCloudに保存してからアップロードします。変換ステップは不要です
ALAC内
一部の.m4aファイルはAACの代わりにApple Losslessを保持しています。どちらもここで動作し、どちらも事前に変換する必要はありません

WAV

非圧縮PCM。アップロードする最大のファイルであり、最もクリーンなソースですが、部屋のノイズがフォーマットよりも重要です。

受け入れるもの
16, 24, 32ビットPCM、任意のサンプルレート、モノラルまたはステレオ、さらにBroadcast Wave (BWF)
BWFメタデータ
bextおよびiXMLチャンクはタイムコード、シーン、テイクを保持しており、トランスクリプトには表示されません
サイズ警告
CD品質で約10 MB/分なので、25分のステレオ録音は匿名制限を超えます
先に縮小
64 kbpsのモノラルでエクスポートすると、スピーチのために何も失わず、ファイルを10〜15倍に削減します

FLAC

ロスレス圧縮、同じWAVの約半分のサイズ。口述歴史アーカイブやフィールド録音ワークフローで一般的。

受け入れるもの
ネイティブFLAC(マジックバイトfLaC)およびOGGコンテナ内のFLAC、モノラルまたはステレオ、最大192 kHz、16または24ビット
変換不要
ファイルはそのまま通過します。最初にMP3に変換すると情報が失われるだけです
Vorbisコメント
文字起こし中は無視されます。アーカイブがこれらのタグに依存している場合、マッピングをトランスクリプトの外に保持してください
サイズの価値は?
精度のためには、いいえ。FLACと適切なMP3は同じように文字起こしされます。Whisperが必要だからではなく、保存用コピーとしてFLACを保持してください

WEBM

通常Opusオーディオを保持するMatroskaコンテナ、時にはVorbis。これはブラウザや画面録画ソフトが生成します。

出所
Loom, OBS, ブラウザMediaRecorder API, Google Meetエクスポート, YouTubeダウンロード
ビデオ内?
デマックスし、ビデオトラックを削除し、オーディオを文字起こしします。抽出する必要はありません
コーデック
最近のものではOpus、古いファイルではVorbis。どちらも変換なしで処理されます
なぜファイルが大きいのか
画面録画はほとんどがビデオです。20 MBのWEBMは通常3〜4 MBのオーディオを含んでいます

よくある質問

どのオーディオフォーマットをアップロードできますか?

MP3, M4A, WAV, FLAC, OGG, AAC, WebM, MP4, MOV, さらにAIFF, AU, OPUS, MPEGも。通常のメディアプレーヤーで再生できるファイルなら、Mictooで文字起こしできます。ビデオファイルも受け付けており、サーバー側でオーディオトラックを抽出します。

文字起こしにはどれくらい時間がかかりますか?

通常は数秒です。10分のオーディオファイルは約15〜30秒で完了し、60分のポッドキャストは約1分で完了します。自動分割される長いファイルは、チャンクが並行して文字起こしされ、結合されるため、少し時間がかかります。

オーディオ文字起こしは本当に無料ですか?

はい。サインアップなしでファイルごとに最大25 MBまで無料で文字起こしできます。無料アカウントを作成すると、ファイルごとの制限が60 MBに引き上げられ、最大180 MBのファイルは自動的にチャンクに分割され、単一のトランスクリプトに結合されます。クレジットカードも隠れた料金もありません。

私のオーディオファイルは保存されますか?

いいえ。ファイルは音声認識プロバイダー(速度のためにGroq、Replicate, Deepgram, OpenAIをフォールバックとして使用)に直接ストリーミングされ、処理後に削除されます。Mictooはオーディオを保持せず、プロバイダーはAPIデータでトレーニングしません。

ファイルフォーマットは精度に影響しますか?

フォーマットよりもオーディオの品質がはるかに重要です。圧縮されたMP3のクリーンな音声は、非圧縮WAVのノイズの多いオーディオよりも良く文字起こしされます。Mictooはすべてのフォーマットで同じWhisper large-v3モデルを使用するため、すべてのサポートされているタイプで精度は一貫しています。

オーディオを特定のフォーマットに変換する必要がありますか?

いいえ。それがこのページのポイントです。レコーダー、DAW、電話、またはダウンロードツールが生成したものをそのままアップロードしてください。ファイルヘッダーからフォーマットを検出し、Whisperに直接ルーティングします。コンバーターステップや品質の損失はありません。

ダウンロード前にトランスクリプトを編集できますか?

はい。文字起こし後にエディタービューに切り替えて、間違った名前や専門用語を修正できます。リーダー(行ごとのタイムスタンプ)とエディター(プレーンテキスト)モードの両方が利用可能です。エクスポートは最後に編集したバージョンを使用します。

文字起こしは何カ国語に対応していますか?

英語、スペイン語、フランス語、ドイツ語、ポルトガル語、ロシア語、ウクライナ語、日本語、中国語、アラビア語など、50以上の言語に対応しています。自動検出はほとんどのファイルで機能しますが、短いクリップの場合はアップロードフォームで言語を手動で選択できます。

トランスクリプトを翻訳できますか?

はい。文字起こし後に「翻訳」をクリックし、28のターゲット言語から選択します。翻訳はリーダービューとすべてのエクスポートフォーマットで利用可能です。タイムスタンプは保持されるため、翻訳されたSRTはオーディオに一致したままです。

どのエクスポートフォーマットが利用可能ですか?

TXT(プレーンテキスト)、SRT(字幕)、タイムスタンプ付きTXT、DOCX(Wordドキュメント)。登録ユーザーはPDF、VTT(ウェブキャプション)、JSONも利用できます。文字起こしが完了した後、ダウンロードメニューからすべてのエクスポートが利用可能です。

どんなオーディオファイルでもドロップしてテキストを取得
無料。サインアップ不要。フォーマットに制限なし。
どんなフォーマットでも サインアップ不要 50以上の言語
オーディオをアップロードして文字起こし

その他の文字起こしツール