文字起こしの精度
主要な文字起こしサービスと同じ公開データセット(FLEURS 日本語)で測定した誤り率です。数値が小さいほど高精度です。
文字起こしの誤り率(低いほど高精度)
公開データセット FLEURS 日本語で測定
数値を表で見る
| サービス / モデル | 誤り率 | 音声の送信 | 出典 |
|---|---|---|---|
| ElevenLabs Scribe v1 | 3.3% | クラウドへ送信 | ElevenLabs 公表値 |
| Google Gemini Flash 2 | 5.7% | クラウドへ送信 | ElevenLabs 公表値 |
| OpenAI Whisper large-v3 | 7.6% | クラウドへ送信 (自前サーバーでも可) |
ElevenLabs 公表値 |
| 本サービス SenseVoiceSmall(端末内実行) |
8.1% | 送信しません | 当社実測 |
| Deepgram Nova 2 | 10.3% | クラウドへ送信 | ElevenLabs 公表値 |
本サービスの誤り率は 8.1%。OpenAI Whisper large-v3(7.6%)とほぼ同等の水準です。 ただし表の他のサービスは、いずれも音声ファイルをクラウドに送信する必要があります。 本サービスは端末内で処理するため、精度でわずかに劣る代わりに、 音声が外部に出ない・時間制限がない・無料という条件を満たしています。
FLEURS は朗読音声です。雑音のある会議室や複数人が同時に話す場面、
固有名詞・社名・人名・専門用語では、どのサービスでも誤りは増えます。
測定条件:FLEURS 日本語テストセット先頭 150 文(計 1,952 秒)、2026 年 9 月測定。
本サービスは文字誤り率(CER)、他社数値は ElevenLabs 公表の単語誤り率(WER)で指標の定義が異なります。
当社測定の Whisper 系モデル(7.0%)と ElevenLabs 公表の Whisper large-v3(7.6%)がほぼ一致することから、
同程度の尺度として参照できると判断しています。
測定に使用した FLEURS 日本語データセットの出典は ライセンス・クレジット に記載しています。