音声・動画の文字起こし
初回はモデルの読み込みに約100〜200MBの通信が必要です。長い音声は処理に時間がかかります。
精度・対応形式・YouTubeについて
既存のWhisperモデルを使用します。雑音や固有名詞で誤認識することがあるため、結果を確認してください。話者の識別には対応していません。スマートフォンなどで動作が重い場合は、軽量モデルか短いファイルをお試しください。
MP3・WAV・M4A・MP4・MOV・WebMなどに対応しますが、コーデックによって読み込めない場合があります。音声・動画のデータはサーバーに送信しません。
YouTubeのURL直接入力には対応していません。権利・利用条件を確認し、手元にある音声・動画ファイルを選んでください。