AI ツール

Deepgram 音声認識API エンジニア向け文字起こし実装とコスト試算

Deepgram のレビュー — AI ツールカテゴリ
評価⭐ 4.4 / 5
提供元Deepgram, Inc.
カテゴリ音声認識・文字起こしAPI(開発者向け基盤)

「問い合わせ電話や会議の録音を自動で文字起こしする仕組みを作りたい。でも API の料金がいくらになるか読めず、開発に踏み切れない」 — そんなエンジニア・小規模事業者の不安に応えるのが本記事です。

Deepgram は従量課金の音声認識APIで、録音音声の英語なら 1 時間あたり $0.258(約 ¥40)から使えます。本記事では、編集部が料金体系・Python 実装・月間処理量別のコスト試算を開発者向けに整理しました。サインアップ時の $200 無料クレジットで検証を始め、本番でも固定費を抑える設計を提案します(Deepgram 料金ページ 参照)。

📖 読了時間 約 9 分
👤 想定読者 個人開発者・小規模クラウドサービス (SaaS) 運営者
💰 想定月額 ¥0 〜 数千円(検証〜小規模本番)
🔬 評価方法 公式情報 + 編集部のシミュレーション

この記事のポイント

編集長の見解

Deepgram は「使った分だけ」の従量課金モデルです。定額のクラウド文字起こしサービス (Otter や Notta など) は会議に同席する人が画面込みで使う向けDeepgram は自社アプリ・自動化スクリプトに文字起こし機能を組み込みたい開発者向けと、用途がはっきり分かれます。中小事業者にとっての価値は「自社の業務音声を、自前のシステムでまとめて処理できる」 点。最初の検証段階で 守るべきは『青天井にしない』ガード設計です。本記事ではその試算と実装を具体的に示します。

こんな方におすすめ

Deepgram は誰にでも合うツールではありません。導入を検討する前に、自分の用途が次のどれに当てはまるかを確認してください。

逆に、「会議に同席して自動で議事録を作ってほしい」 だけなら、API ではなく完成品のサービスのほうが手間がかかりません。詳しくは Otter レビューFireflies レビュー も参考にしてください。

ここからは、実際にいくらかかるのかを料金表で見ていきます。

💰 料金プランと円換算の試算

Deepgram の料金は「音声 1 分(または 1 時間)あたり何ドル」 という従量課金です。録音済みの音声を後からまとめて処理する「非同期(録音音声)」 と、通話中などにその場で文字起こしする「ストリーミング(リアルタイム)」 で単価が変わります。

Deepgram 主要モデル料金(音声 1 時間あたり、$1=¥155 換算)
Nova-3 英語 非同期
¥40
録音音声向け・コスト重視($0.258/h)
Nova-3 多言語 非同期
¥48
録音音声向け・多言語($0.312/h)
Nova-3 英語 ストリーミング
¥72
リアルタイム英語($0.46/h 前後)

編集部試算: 公式ドル価格を $1=¥155 で換算。為替変動あり、最新の正確な料金は公式料金ページを参照

公式の正確なドル建て料金は Deepgram 料金ページ を確認してください。本記事の円換算は編集部のシミュレーション目的の概算です。

付加機能と無料クレジット

文字起こしの基本料金に、必要に応じて話者分離(誰が話したか)・要約・キーワード抽出などの機能を上乗せできます。使わなければ課金されません。さらに、サインアップ時には大きめの無料クレジットが付きます。

項目内容編集部の評価
無料クレジット$200(約 ¥31,000)検証には十分すぎる量
クレジットカードサインアップ時は登録不要試すハードルが低い
話者分離録音音声に追加可能会議録に有効
対応言語日本語を含む多言語国内業務でも使える

公式の付加機能の詳細は Deepgram 公式ドキュメント で確認できます。次のセクションでは、この単価が月間処理量に応じて実際いくらになるかを試算します。

月間処理量別のコスト試算

「結局、月にいくら払うのか」 が一番気になるところです。編集部が録音音声(非同期)の英語モデルを前提に、処理時間別の概算をまとめました。

月間の音声時間Nova-3 英語($0.258/h)Nova-3 多言語($0.312/h)想定ユースケース
10 時間約 ¥400約 ¥484個人の検証・小規模メモ
50 時間約 ¥2,000約 ¥2,418小規模事業者の問い合わせ録音
100 時間約 ¥4,000約 ¥4,836中規模の会議・セミナー一括処理
300 時間約 ¥12,000約 ¥14,508複数拠点の通話・録画運用

💡 無料クレジットの使い方

サインアップ時の $200(約 ¥31,000)の無料クレジットは、Nova-3 英語の録音音声なら 約 770 時間分に相当します。本番導入を判断する前に、自社の音声サンプルで精度とコストを十分に検証できる量です。クレジットカード登録なしで始められる点も、検証フェーズでは安心材料です。

上記はいずれも文字起こし基本料金のみの概算です。話者分離などを足すとその分上乗せされます。次のセクションでは、実際の Python 実装を見ていきます。

Python での実装と動かし方

Deepgram は公式 SDK が整っており、Python なら数行で文字起こしを呼び出せます。以下は録音音声ファイルを文字起こしする最小限のコード例です(パッケージ名は deepgram-sdk)。

from deepgram import DeepgramClient

# API キーは環境変数 DEEPGRAM_API_KEY から自動で読み込まれます
client = DeepgramClient()

# ローカルの録音ファイルを文字起こし
with open("meeting.wav", "rb") as audio:
    response = client.listen.v1.media.transcribe_file(
        request=audio.read(),
        model="nova-3",
    )

# 結果のテキストを出力
print(response.results.channels[0].alternatives[0].transcript)

日本語の音声を扱う場合や話者分離を有効にしたい場合は、オプションを足すだけです。利用できる細かいパラメータは公式ドキュメントに一覧があります。

# 言語指定・話者分離を有効化する例(パラメータ名は公式ドキュメントを参照)
response = client.listen.v1.media.transcribe_file(
    request=audio.read(),
    model="nova-3",
    language="ja",      # 日本語を指定
    diarize=True,       # 話者分離を有効化
)

公式の実装手順は Deepgram 公式ドキュメントPython SDK (GitHub) で確認できます。コードに不安があれば、これらのコードを ChatGPT や Claude に貼り付けて解説させると理解が早まります(Claude API 活用ガイド も参照)。

次のセクションでは、初めて導入する場合の具体的な手順を時系列で示します。

🚀 はじめての導入フロー

検証から最初の文字起こしまで、おおむね 30 分で到達できます。編集部が想定する標準的な流れは以下のとおりです。

Deepgram 導入 30 分フロー
Step 1
アカウント作成(5 分)
Deepgram 公式サイトからサインアップ。クレジットカード登録なしで $200 の無料クレジットが付与されます。
Step 2
API キーの取得(2 分)
管理画面(コンソール)で API キーを発行してコピー。第三者に漏れないよう環境変数で管理します。
Step 3
SDK のインストール(3 分)
Python なら「pip install deepgram-sdk」、JavaScript なら「npm install @deepgram/sdk」 で公式 SDK を導入します。
Step 4
サンプル音声で文字起こし(10 分)
自社の短い音声ファイルで前述のサンプルコードを実行し、精度と日本語の認識具合を確認します。
Step 5
使用量の上限設定(5 分)
コンソールで残高アラートを設定し、想定外の大量処理で請求が膨らまないようガードをかけます。
Step 6
自社処理への組み込み(5 分〜)
検証結果に納得できたら、問い合わせ録音や会議録画のバッチ処理など、実際の業務フローに組み込みます。

導入そのものは難しくありませんが、本番運用では注意点もあります。次のセクションで失敗パターンを確認しましょう。

編集部が見た失敗パターン

従量課金 API は便利な反面、設計を誤ると「想定外の請求」 や「使えないデータ」 を生みます。よくある落とし穴を 2 つ挙げます。

⚠️ 上限ガードを入れずに大量処理

従量課金のため、バグや設定ミスで大量の音声を一気に流すと請求が膨らみます。コンソールの残高アラートと、コード側の処理本数カウンタの二重ガードを必ず入れてください。検証段階こそ上限設定を先に済ませておくのが安全です。

⚠️ 音質を確認せずに本番投入

文字起こしの精度は元音声の品質に大きく左右されます。雑音の多い録音や複数人の同時発話では認識率が落ちます。本番投入前に自社の典型的な音声サンプルで精度を確かめ、必要なら話者分離オプションを足すか録音環境を見直しましょう。

これらは事前のひと手間で防げるものです。最後に、導入判断のまとめと公式情報源を示します。

まとめ — 導入を判断するために

Deepgram は、文字起こし機能を自社のシステムやアプリに組み込みたい開発者・事業者にとって、低コストで始められる選択肢です。英語の録音音声なら 1 時間あたり ¥40 前後、月 100 時間でも ¥4,000 前後に収まる試算で、$200 の無料クレジットでリスクなく検証を始められます。

一方で、「会議に出て自動で議事録を作ってほしい」 だけなら、API より完成品のサービスのほうが手軽です。自社の用途が「組み込み」 なのか「既製品で十分」 なのかを見極めることが、最初の判断ポイントになります。他の選択肢は AssemblyAI レビューOtter レビューOpenAI API 活用ガイド も併せてご覧ください。

Deepgram 公式サイトを見る → ※ PR・アフィリエイトリンクを含みます

出典・参考情報


本記事の料金は公式発表ドル価格を $1=¥155 で換算した編集部のシミュレーションです。為替および公式料金改定により変動します。導入前に必ず公式料金ページで最新の金額をご確認ください。

Mira / AI経営ラボ 編集長

料金プラン

プラン 料金 (JPY) 請求
Nova-3 英語 非同期(録音音声 1 時間あたり) ¥40 買い切り
Nova-3 多言語 非同期(録音音声 1 時間あたり) ¥48 買い切り
Nova-3 英語 ストリーミング(1 時間あたり) ¥72 買い切り

👍 メリット

👎 デメリット