マイクロソフトが文字起こしAI「MAI-Transcribe-2」をリリース:競合モデルより高速・高精度・低コストをアピール
マイクロソフトは、高性能な音声認識モデル「MAI-Transcribe-2」をリリースし、市場に大きなインパクトを与えています。本モデルは、最大60言語を自動で検知し、高精度な文字起こしを実現するAIツールです。この発表は2026年9月3日に行われ、OpenAIやGoogleといった競合他社の最新モデルと比較して、圧倒的な速度とコスト効率を武器に市場での優位性を確立しようとしています。
MAI-Transcribe-2は、まず「FLEURS」ベンチマークにおいて平均単語誤り率5.2%を記録し、業界トップの座を獲得しました。さらに、具体的な性能比較検証「Artificial Analysis」によると、OpenAIの「GPT-Transcribe」と比較してなんと10倍、Googleの「Gemini 3.5 Transcribe」より5倍高速でありながら、高い精度を維持することが実証されています。この速度向上は、前バージョンからの推論速度の大幅な改善とレイテンシーの低減によるものです。
機能面では、単なる文字起こしに留まらず、話者を識別して各単語を正しい人物に割り当てる「話者分離(ダイアライゼーション)」機能や、専門用語・略語の認識能力に優れています。また、発言中の「えーと」といった言いよどみ(フィラー)を削除するか残すかを選択できるカスタマイズ性も備えています。コスト面でも、2026年末までの期間限定で1時間あたり0.1ドル(約15.6円)という低価格設定を提示し、競合製品(例:Scribe V2の3.67ドル)と比較して圧倒的な経済的メリットを強調しています。マイクロソフトは、本モデルが「史上最も高性能かつ効率的な文字起こしモデル」であると強くアピールしています。
背景
近年、AIによる音声認識・文字起こし技術は急速に進化しており、Google、OpenAI、Microsoftなどの大手テック企業が次々と高性能なモデルを投入し、市場競争が激化しています。特に、リアルタイム処理能力とコスト効率がビジネス利用の鍵となっており、各社はベンチマークや速度の具体的な数値を用いて優位性を主張しています。
重要用語解説
- MAI-Transcribe-2: マイクロソフトが開発した最新の音声認識AIモデル。60言語に対応し、GPT-TranscribeやGemini 3.5 Transcribeなど競合製品に対し、速度、精度、コストの面で優位性を持つことをアピールする製品名。
- FLEURSベンチマーク: 音声認識モデルの性能を測定するための特定のベンチマークテスト。本記事では、MAI-Transcribe-2がこのテストで1位を獲得し、業界最高水準の精度を達成したことを示す指標。
- 話者分離(ダイアライゼーション): 録音された音声データから、発言している複数の人物を識別し、誰がどの単語を発したかを正確に区別する高度な音声認識技術。会議録作成などで必須の機能。
今後の影響
本モデルのリリースは、文字起こしAI市場における価格競争と性能競争を一層激化させるでしょう。特に、圧倒的な速度と低コストを両立した点は、企業や研究機関による大規模なデータ処理やリアルタイム会議録作成のワークフローに大きな変革をもたらすと予想されます。今後の展開としては、より多様な専門分野のデータへの対応や、マルチモーダルな入力(音声と映像の同期)への進化が期待されます。