文字起こしAI実力比較:会議・インタビューで本当に使えるのはどれか
- 1.文字起こしAIは「精度」「話者分離」「日本語対応」の3軸で選ぶと失敗が少ない
- 2.録音品質が文字起こし精度を左右する最大の要因。マイクとの距離・雑音が命取りになる
- 3.文字起こし後の「整形プロンプト」をChatGPTに投げるだけで、即使える議事録に変換できる
この記事を読み終えると、「どの文字起こしAIを選べばいいかわからない」という状態から抜け出せます。具体的には、①自分のユースケース(会議録・インタビュー・1on1など)に合ったツールを1つ選び、②今日中に試し録音を行い、③文字起こし結果をChatGPTに投げて読みやすい議事録に整形するところまで、一通り手を動かせるようになります。ツールの名前を並べるだけの記事ではなく、「どう使うと何が起きるか」を実物の操作手順と例文で解説します。
文字起こしAIはここ2〜3年で急速に実用レベルに達しました。以前は「誤変換だらけで手直しが大変」という印象が強かったのですが、OpenAIが2022年にWhisperを公開したあたりから精度が大きく上がり、今では日本語の会話を「読める」レベルで書き出せるものが複数存在します。ただし「どれでも同じ」ではなく、話者が何人いるか・専門用語が多いか・リアルタイムで使いたいかによって向き不向きがあります。この記事ではその違いを整理します。
文字起こしAIを選ぶ3つの評価軸
文字起こしAIを比較するとき、「精度が高い」という言葉だけでは判断できません。実際に使い始めてから後悔しないために、3つの軸で評価することを勧めます。①認識精度(日本語の誤変換がどれくらい少ないか)、②話者分離(Aさんが言った・Bさんが言ったを自動で区別できるか)、③使い勝手(ブラウザだけで完結するか、アプリのインストールが必要か、月額いくらか)です。この3軸を最初に自分の優先順位として決めておくと、スペック比較の表を見ても「どこを見ればいいか」が迷わなくなります。
- 認識精度:日本語特有の同音異義語(「機械」と「規制」など)をどれだけ正確に変換できるか
- 話者分離(ダイアライゼーション):複数人の発言を話者ごとに区別してラベルを付ける機能。3人以上の会議で特に重要
- リアルタイム対応:会議中にその場で字幕のように表示できるか、それとも録音後にアップロードして処理するか
- 日本語特化度:英語中心のモデルか、日本語データで追加学習しているかで精度に差が出やすい
- コスト構造:無料枠の時間数・有料プランの月額・1時間あたりの処理コストを比較する
主要ツール4種の特徴と向き不向き
現時点(2024〜2025年)で個人・中小企業が試しやすい文字起こしAIとして、Whisper(OpenAI)・Notta・Otter.ai・Google Meet / Zoomの組み込み字幕機能の4種類が挙げられます。Whisperはオープンソースで無料ですが、自分でPCにセットアップするか、Whisperを搭載した別サービス経由で使う必要があります。Nottaはブラウザから使える国産寄りのサービスで、日本語の話者分離に対応しており、1人でも始めやすい点が特徴です。Otter.aiは英語に強く、英語インタビューやグローバルチームの会議なら選択肢に入ります。ZoomやGoogle Meetの組み込み字幕は追加費用なく使えますが、あくまで字幕表示が主目的で、議事録として後から読む用途には書き出し形式が粗いことがあります。
- Whisper(OpenAI):精度は高水準。無料で使えるが自前セットアップが必要。話者分離は標準では非搭載(外部ライブラリと組み合わせると可能)
- Notta:ブラウザ完結・日本語対応・話者分離あり。無料プランは月120分が目安(プランは変わることがあるので公式で確認推奨)
- Otter.ai:英語に特化した精度の高さが強み。日本語は苦手。グローバルチームの英語会議向き
- Zoom・Google Meetの組み込み字幕:追加費用なし・リアルタイム。ただし書き出しテキストの精度や整形度はツールにより大きく異なる
「日本語の会議・インタビュー」で最初に試すなら、ブラウザで今日から使えてリアルタイム・話者分離・日本語対応が揃うNottaが入口として手堅い。慣れてきたらWhisperベースのサービスと組み合わせて精度を比較するステップアップが現実的。
録音品質が精度を決める:ツールより先に確認すること
文字起こしの品質は、AIの性能だけで決まりません。むしろ「録音品質」が最大の変数です。理由はシンプルで、AIは音声データの中にある音を認識するため、入力が悪ければどれだけ優秀なモデルでも誤変換が増えます。具体的な目安として、マイクと話者の距離は50cm以内が理想で、会議室で全員分をノートPCの内蔵マイクで録ると、遠い席の人の声がかき消されて認識率が大幅に下がります。エアコンのノイズ・キーボード音・紙をめくる音も精度を下げる要因です。1台でも外付けの指向性マイク(3,000〜10,000円程度)を用意するだけで、文字起こし後の手直し時間が体感で半分以下になることがあります。
- マイクと話者の距離:50cm以内を目安にする。会議室なら卓上指向性マイクを中央に置く
- 背景雑音の排除:エアコン・換気扇の音は録音前に止めるか、ノイズキャンセル機能付きマイクを使う
- 録音形式:WAVまたはMP3 128kbps以上が推奨。スマートフォンのボイスメモアプリはMP4形式のことがあるので要確認
- オンライン会議の場合:画面収録ではなく「音声のみ録音」または会議ツールの録画機能を使うと音質が安定しやすい
ステップ別:今日から使い始める具体的な手順
ここではNottaを例に、会議の文字起こしを初めてやるための手順を7ステップで説明します。他のサービスでも基本的な流れは同じです。まずNottaのサイト(notta.ai)にアクセスしてGoogleアカウントでサインアップします(無料プランで始められます)。サインアップ後にダッシュボードが開いたら、画面上部の「新規録音」ボタンをクリックします。ブラウザがマイクへのアクセス許可を求めてきたら「許可」を選択してください。これを「ブロック」にしてしまうと音声が入力されないので注意です。
- ステップ1:notta.aiにアクセスしてGoogleアカウントでサインアップ(2分で完了)
- ステップ2:ダッシュボードの「新規録音」または「ファイルをインポート」を選択
- ステップ3:会議を録音する場合は「リアルタイム録音」を選び、ブラウザのマイク許可を与える
- ステップ4:会議終了後、自動で文字起こしが表示される(処理時間は録音時間の10〜30%が目安)
- ステップ5:画面右上の「エクスポート」からTXTまたはDOCX形式でテキストをダウンロード
- ステップ6:ダウンロードしたテキストをコピーしてChatGPTに貼り付け、後述のプロンプトで整形
- ステップ7:整形済み議事録をSlackやNotionに貼り付けて共有完了
コピペOK:文字起こし結果を議事録に変えるプロンプト
文字起こしAIが出力するテキストは、「話し言葉そのまま」です。「えーっと」「そうですね」「あの」といった言い淀みが残り、句読点もほぼありません。これを読める議事録にするには、そのままChatGPT(またはClaude・Geminiなど)に貼り付けて整形させるのが最速です。以下のプロンプトをそのままコピーして、文字起こしテキストの前に貼り付けてください。整形の指示を詳細に書くほど、出力がブレにくくなります。
以下は会議の文字起こしテキストです。次の条件で議事録に整形してください。 【整形条件】 1. 話し言葉(「えーっと」「あのー」「そうですね」など)を除去する 2. 発言の意味を変えずに書き言葉に直す 3. 議題ごとに見出し(## 見出し)をつける 4. 決定事項は「【決定】」、TODO事項は「【TODO】担当者名:内容」の形式で箇条書きにする 5. 全体を500字以内に要約した「サマリー」を冒頭に入れる 【文字起こしテキスト】 (ここに文字起こしテキストを貼り付ける)
上のプロンプトは「整形条件」を5項目で明示しています。AIに丸投げするだけでなく、出力形式を指定することで、毎回ほぼ同じ構成の議事録が生成されます。これをチームのテンプレートとして固定すると、誰が使っても同じフォーマットで議事録が揃うという副産物もあります。インタビュー記事を書く場合は条件を変えてください。
以下はインタビューの文字起こしテキストです。次の条件で整形してください。 【整形条件】 1. インタビュアーの発言を「Q:」、回答者の発言を「A:」で区別する 2. 話し言葉を自然な書き言葉に直す(意味は変えない) 3. 一つの質問と回答を1セットとして、セットごとに空行を入れる 4. 回答が長い場合は3〜5文以内に要約する(要約した場合は末尾に「※要約」と明記) 5. 全体のトーンはインタビュー記事として読みやすく、話し手の言葉の個性は残す 【文字起こしテキスト】 (ここに文字起こしテキストを貼り付ける)
実際のやり取り例:30分会議の文字起こし→議事録まで
場面設定:4人参加の社内定例会議(30分)。新商品の販売開始時期と担当分担を話し合った。Nottaでリアルタイム文字起こしし、終了後にエクスポートしたTXTをChatGPTに貼り付けた。以下は実際の入力と出力のイメージです(固有名詞は架空のものに置き換えています)。
以下は会議の文字起こしテキストです。次の条件で議事録に整形してください。 【整形条件】 1. 話し言葉を除去する 2. 発言の意味を変えずに書き言葉に直す 3. 議題ごとに見出しをつける 4. 決定事項は「【決定】」、TODO事項は「【TODO】担当者名:内容」の形式で箇条書き 5. 冒頭に500字以内のサマリーを入れる 【文字起こしテキスト】 田中:えーっとじゃあ始めましょうか、今日はあのー新商品の発売時期の話ですよね 佐藤:そうですはい、えーと当初は9月予定だったんですけどもう少し後ろ倒しにしたほうがいいんじゃないかなと思ってて 田中:あーそうですかなんで? 佐藤:製造側からあのー部品の入荷が10月になりそうって連絡が来てまして 山本:それってどの部品ですか 佐藤:メインボードです基板ですね 田中:わかりました、じゃあ発売は11月にしましょうか余裕を持って 佐藤:賛成です 山本:はい了解しました、告知の準備は私が担当してもいいですか10月中に 田中:ありがとうございます、じゃあ山本さんに告知担当をお願いします 鈴木:私は在庫の調整を担当します製造チームと確認します
【サマリー】 新商品の発売時期について協議した。部品(メインボード)の入荷が10月にずれ込む見込みであるため、当初予定の9月から11月へ変更することを決定した。告知準備は山本氏が10月中に対応し、在庫調整は鈴木氏が製造チームと連携して進める。 ## 議題:新商品の発売時期 部品(メインボード)の入荷時期が10月にずれ込む見通しであるとの報告を受け、発売時期を9月から11月に変更することとした。 【決定】新商品の発売時期を11月に変更する 【TODO】山本:告知準備を10月中に完了させる 【TODO】鈴木:製造チームと在庫調整を確認する— ChatGPTによる整形出力イメージ(実際の出力は語順等が異なる場合あり)
このように、約200字の話し言葉テキストから、決定事項とTODOが明確な議事録が生成されます。実際の30分会議では文字起こしテキストが3,000〜5,000字程度になることが多く、ChatGPTのコンテキスト上限(入力できる文字数の上限。ツールや設定により異なる)に引っかかる場合は、会議を前半・後半に分けて2回に分けて整形するか、要点を先に箇条書きで抜き出してから投げる方法が有効です。
よくある失敗と直し方
文字起こしAIを使い始めた人が最初の1〜2週間で直面しやすい失敗を3つ挙げます。それぞれ「なぜ起きるか」と「こう直す」をセットで解説します。失敗のほとんどは設定ミスか録音環境の問題で、AIの性能の問題ではないことがほとんどです。
- 失敗①:誤変換が多すぎて手直しに時間がかかる → 原因:マイクから話者が遠い・背景雑音が多い → 直し方:卓上指向性マイクを中央に置く。オンライン会議なら各自のヘッドセットで録音する設定にする
- 失敗②:話者が全員「話者1」になってしまい誰の発言か分からない → 原因:話者分離機能がOFFか、非搭載のプランを使っている → 直し方:ツールの設定で「話者分離」をONにする。Nottaは録音開始前の設定画面で話者数を指定できる
- 失敗③:ChatGPTへの貼り付けで「テキストが長すぎる」エラーになる → 原因:1時間超の会議は文字起こしが1万字を超えることがあり、入力上限に達する → 直し方:会議を前半・後半で分けて2回に分けてプロンプトに投げる。または先に文字起こし側のサービスでAIサマリー機能を使い、要約を先に生成してから投げる
- 失敗④:専門用語が毎回誤変換される(例:「API」が「えーぴーあい」と仮名で出る) → 原因:汎用モデルは業界固有語の学習が薄い → 直し方:文字起こし後のChatGPTプロンプトに「以下の用語は正式表記に直してください:API、SaaS、KPI」と追記する
専門用語の誤変換はプロンプトで後補正できる。文字起こしAIに完璧な精度を求めるより、「どうせ後でChatGPTに整形させる」と割り切り、録音品質だけに集中するほうが全体の品質が上がりやすい。
インタビューで使うときの追加テクニック
インタビューと会議では文字起こしの使い方が少し違います。会議は参加者全員が話し、発言の多さが均等ではない場合が多い。インタビューは「質問者1人・回答者1人」という2話者構成が基本で、回答者の発言量が質問者の3〜5倍になるのが普通です。この非対称な構成だと、話者分離がうまくいかず「Q:」「A:」の区別が乱れることがあります。対策として、インタビュー開始時に「私は田中です。今日はXXさんにインタビューします」と明示的に名前を声に出して録音を開始すると、話者ラベルが付きやすくなります。また、インタビュー後の整形では先に紹介したQ&A形式のプロンプトを使い、回答の要約には「意味を変えない・話し手の言葉の個性を残す」という制約を必ず入れてください。インタビューの「言葉の質感」は記事の価値に直結するため、AIが勝手に言い換えすぎるのを防ぐ一文が重要です。
(録音開始直後に声に出して読む) 「これより収録を開始します。インタビュアーは[自分の名前]です。本日のゲストは[相手の名前・肩書き]さんです。よろしくお願いします。」 ※この一文を冒頭に入れておくと、話者分離AIが2人の声のパターンを最初に識別しやすくなります。
Whisperを無料で使う最短ルート
WhisperはOpenAIが公開しているオープンソースの音声認識モデルです。精度は高く、日本語にも対応しています。ただし、公式には「自分でPythonの環境を作ってコマンドを打つ」という手順が必要で、プログラミング未経験者には最初のハードルが高い。そこで、Whisperを内部で使っているブラウザサービスを使う方法が現実的です。「Whisper API」を利用したWebサービスが複数存在し、音声ファイルをドラッグ&ドロップするだけで文字起こしが返ってくるものもあります(サービス名や提供状況は変わるため、「Whisper 文字起こし 無料」などで検索して比較することを推奨します)。もしPythonを少し触れる場合は、OpenAIのAPIキーを取得してWhisper APIを直接呼び出す方法が最も柔軟で、1分の音声ファイルを処理するコストは非常に小さく済みます(APIの料金は変更されることがあるため公式で確認してください)。
Whisperの精度を試したいだけなら、まずNottaやopenai.com上のChatGPT Advancedモード(音声入力機能)で体感してみるのが最速。本格的に使うなら後でAPIを直接叩く方法にステップアップするといい。
Zoom・Google Meetの組み込み字幕との使い分け方
ZoomやGoogle Meetには、会議中にリアルタイムで字幕を表示する機能が組み込まれています。追加コストなしで使えるのが最大のメリットです。ただし、この字幕機能はあくまで「会議中の補助」として設計されており、会議終了後に完全な書き起こしテキストをダウンロードする用途には制限があることが多い(設定やプランにより異なります)。また、リアルタイム表示の精度は一般に「録音後に処理するモデル」より下がる傾向があります。理由は、リアルタイム処理では音声の後続文脈を見る前に変換する必要があるためです。使い分けの目安は、「その場で参加者に内容を確認させたいだけならZoom字幕で十分。後から議事録として読む・共有する・要約するなら専用の文字起こしサービスを使う」です。
料金と無料枠の現実的な見方
「無料で使えると書いてあったのに、すぐに上限に達した」という声をよく聞きます。多くの文字起こしサービスは無料プランで月あたり数十〜120分程度の録音時間を提供していますが、週1回の1時間会議が4回あれば240分になり、無料枠を超えます。有料プランは月額1,000〜3,000円程度が多い(プランは変更されるため必ず公式で最新情報を確認してください)。コスト削減の現実的な方法は、①まず1人が有料プランに加入して録音・文字起こしを担当し、テキストをチームで共有する、②Whisper APIを直接使ってコスト管理する、の2択です。チームで月に何時間会議をしているかを先に計算してから、プランを選ぶと無駄がありません。
月の会議時間を合計してから無料枠と比較する。週2回×1時間の会議なら月8時間=480分。多くの無料プランではカバーできないので、最初から有料プランを前提に試算したほうが現実的。
よくある質問
- Q:文字起こしした音声データはサービス側に保存・学習に使われますか? → A:サービスによって異なります。機密性の高い会議内容を扱う場合は、各サービスのプライバシーポリシーで「データをモデルの学習に使用するか」「保存期間はいつまでか」を必ず確認してください。ローカルで動くWhisperを自前環境で使う方法は、データが外部に出ないという点で安心感があります。
- Q:方言や早口の発言が多い会議でも使えますか? → A:方言と早口はどのサービスでも精度が下がりやすい要因です。特に強い地域方言(博多弁・沖縄方言など)は標準語ベースのモデルでは誤変換が増えます。現実的な対応として、文字起こし後のChatGPT整形プロンプトに「誤変換と思われる単語は文脈から推測して補正してください」と一行追加すると、文脈から明らかな誤りを修正してくれます。
- Q:話者が5人以上いる会議でも話者分離はうまくいきますか? → A:話者数が増えると分離精度は下がりやすい傾向があります(ツールにより異なります)。4〜5人を超える場合は、事前にサービスの仕様ページで「最大何話者まで対応か」を確認するのが確実です。実用的な回避策として、会議を前半・後半に録音ファイルを分けて処理し、話者ラベルを手動で修正してからChatGPTに投げる方法があります。
あわせて読みたい
AIで文字起こしする方法|会議・動画音声を無料で文章にする手順
AIで文字起こしする方法|会議・動画音声を無料で文章にする手順
WhisperやGoogle、ChatGPTなど無料ツールを使って、会議や動画の音声をAIで文字起こしする具体的な手順を初心者向けに解説。今日から使えるプロンプト例つき。
AI検索4つの使い分け早見表|Perplexity・Copilot・Gemini・ChatGPT
AI検索4つの使い分け早見表|Perplexity・Copilot・Gemini・ChatGPT
Perplexity・Copilot・Gemini・ChatGPTをどう使い分ければいいか迷っている人へ。場面ごとの選び方と、そのままコピペできるプロンプト例を一挙公開。
無料AI動画編集ツールの現実的な守備範囲|できること・できないこと完全整理
無料AI動画編集ツールの現実的な守備範囲|できること・できないこと完全整理
CapCut・Runway・ClipchampなどのAI動画編集ツールは何が得意で何が苦手か。今日から手を動かせる具体的な使い方と、よくある失敗の直し方を徹底解説。

この記事は「株式会社オールベッド」が運営しています。
AIを武器に、一人で千人分。株式会社オールベッドは、LINE集客の自動化・コンテンツの大量生成・ファネル設計まで、自分たちで毎日まわしている運用をそのままお渡しするマーケティング会社です。「AIを何から始めればいいか分からない」段階から、あなたの隣で一緒に走ります。
会社について詳しく →AIを「読む」から「使う」へ。
記事だけでは動けないときは、AI導入の伴走コンサルでお手伝いします。まずは2分のAI診断か、LINEでの無料相談からどうぞ。あなたの事業のどこからAIを使えるか、その場でお伝えします。