AI音声認識
Qwen3-ASRやWhisperといったモデルが会議やインタビュー、動画の音声を文字に変える様子を扱い、書き起こし・字幕・リアルタイム聴写の課題に応える。
AI音声認識(ASR)はモデルが話し声を直接文字に変え、会議の書き起こし、インタビューの転記、動画字幕、リアルタイム聴写をカバーする。Qwen3-ASRやFun-ASR、Whisperを代表とする方式は雑音や方言、30以上の言語でも低い誤字率を保つが、固有名詞や同音異義語、強い訛りは独自語彙と人手の校正が依然として頼りになる。