ひらがなASR

へっぽこだけど正直なASR

日本語音声をひらがなに書き起こします。漢字変換や言語モデル補正は一切なし — 聞こえたものをそのまま出力します。

Silence Padding: 音声の前後に0.3秒の無音を自動挿入し、CTC境界での出力欠落を軽減しています。


Model: sakasegawa/japanese-wav2vec2-large-hiragana-ctc (wav2vec2-large + Dual CTC, 315M params, ReazonSpeech ~1,000h) / GitHub / ブログ記事