Deepgram 音声認識API エンジニア向け文字起こし実装とコスト試算
「問い合わせ電話や会議の録音を自動で文字起こしする仕組みを作りたい。でも API の料金がいくらになるか読めず、開発に踏み切れない」 — そんなエンジニア・小規模事業者の不安に応えるのが本記事です。
Deepgram は従量課金の音声認識APIで、録音音声の英語なら 1 時間あたり $0.258(約 ¥40)から使えます。本記事では、編集部が料金体系・Python 実装・月間処理量別のコスト試算を開発者向けに整理しました。サインアップ時の $200 無料クレジットで検証を始め、本番でも固定費を抑える設計を提案します(Deepgram 料金ページ 参照)。
この記事のポイント
- 録音音声の文字起こしは、英語の Nova-3 で 1 時間あたり約 ¥40、多言語でも 約 ¥48
- サインアップ時に $200(約 ¥31,000)の無料クレジットが付き、クレジットカード登録なしで試せる
- Python 公式 SDKを使えば、わずか数行で音声ファイルを文字起こしできる
- 話者分離・要約などの付加機能は使った分だけの追加課金で、必要なものだけ足せる
- 「月 100 時間の音声」を処理しても、英語の録音音声なら月 ¥4,000 前後に収まる試算
編集長の見解
Deepgram は「使った分だけ」の従量課金モデルです。定額のクラウド文字起こしサービス (Otter や Notta など) は会議に同席する人が画面込みで使う向け、Deepgram は自社アプリ・自動化スクリプトに文字起こし機能を組み込みたい開発者向けと、用途がはっきり分かれます。中小事業者にとっての価値は「自社の業務音声を、自前のシステムでまとめて処理できる」 点。最初の検証段階で 守るべきは『青天井にしない』ガード設計です。本記事ではその試算と実装を具体的に示します。
こんな方におすすめ
Deepgram は誰にでも合うツールではありません。導入を検討する前に、自分の用途が次のどれに当てはまるかを確認してください。
- 問い合わせ電話の録音を自動で文字起こしし、対応履歴として残したい事業者
- セミナーや社内会議の録画を一括でテキスト化したい運営者
- 音声メモアプリや議事録ツールを自社開発したいエンジニア
- 既存システムに文字起こし機能を後付けしたいシステム担当者
逆に、「会議に同席して自動で議事録を作ってほしい」 だけなら、API ではなく完成品のサービスのほうが手間がかかりません。詳しくは Otter レビュー や Fireflies レビュー も参考にしてください。
ここからは、実際にいくらかかるのかを料金表で見ていきます。
💰 料金プランと円換算の試算
Deepgram の料金は「音声 1 分(または 1 時間)あたり何ドル」 という従量課金です。録音済みの音声を後からまとめて処理する「非同期(録音音声)」 と、通話中などにその場で文字起こしする「ストリーミング(リアルタイム)」 で単価が変わります。
公式の正確なドル建て料金は Deepgram 料金ページ を確認してください。本記事の円換算は編集部のシミュレーション目的の概算です。
付加機能と無料クレジット
文字起こしの基本料金に、必要に応じて話者分離(誰が話したか)・要約・キーワード抽出などの機能を上乗せできます。使わなければ課金されません。さらに、サインアップ時には大きめの無料クレジットが付きます。
| 項目 | 内容 | 編集部の評価 |
|---|---|---|
| 無料クレジット | $200(約 ¥31,000) | 検証には十分すぎる量 |
| クレジットカード | サインアップ時は登録不要 | 試すハードルが低い |
| 話者分離 | 録音音声に追加可能 | 会議録に有効 |
| 対応言語 | 日本語を含む多言語 | 国内業務でも使える |
公式の付加機能の詳細は Deepgram 公式ドキュメント で確認できます。次のセクションでは、この単価が月間処理量に応じて実際いくらになるかを試算します。
月間処理量別のコスト試算
「結局、月にいくら払うのか」 が一番気になるところです。編集部が録音音声(非同期)の英語モデルを前提に、処理時間別の概算をまとめました。
| 月間の音声時間 | Nova-3 英語($0.258/h) | Nova-3 多言語($0.312/h) | 想定ユースケース |
|---|---|---|---|
| 10 時間 | 約 ¥400 | 約 ¥484 | 個人の検証・小規模メモ |
| 50 時間 | 約 ¥2,000 | 約 ¥2,418 | 小規模事業者の問い合わせ録音 |
| 100 時間 | 約 ¥4,000 | 約 ¥4,836 | 中規模の会議・セミナー一括処理 |
| 300 時間 | 約 ¥12,000 | 約 ¥14,508 | 複数拠点の通話・録画運用 |
💡 無料クレジットの使い方
サインアップ時の $200(約 ¥31,000)の無料クレジットは、Nova-3 英語の録音音声なら 約 770 時間分に相当します。本番導入を判断する前に、自社の音声サンプルで精度とコストを十分に検証できる量です。クレジットカード登録なしで始められる点も、検証フェーズでは安心材料です。
上記はいずれも文字起こし基本料金のみの概算です。話者分離などを足すとその分上乗せされます。次のセクションでは、実際の Python 実装を見ていきます。
Python での実装と動かし方
Deepgram は公式 SDK が整っており、Python なら数行で文字起こしを呼び出せます。以下は録音音声ファイルを文字起こしする最小限のコード例です(パッケージ名は deepgram-sdk)。
from deepgram import DeepgramClient
# API キーは環境変数 DEEPGRAM_API_KEY から自動で読み込まれます
client = DeepgramClient()
# ローカルの録音ファイルを文字起こし
with open("meeting.wav", "rb") as audio:
response = client.listen.v1.media.transcribe_file(
request=audio.read(),
model="nova-3",
)
# 結果のテキストを出力
print(response.results.channels[0].alternatives[0].transcript)
日本語の音声を扱う場合や話者分離を有効にしたい場合は、オプションを足すだけです。利用できる細かいパラメータは公式ドキュメントに一覧があります。
# 言語指定・話者分離を有効化する例(パラメータ名は公式ドキュメントを参照)
response = client.listen.v1.media.transcribe_file(
request=audio.read(),
model="nova-3",
language="ja", # 日本語を指定
diarize=True, # 話者分離を有効化
)
公式の実装手順は Deepgram 公式ドキュメント と Python SDK (GitHub) で確認できます。コードに不安があれば、これらのコードを ChatGPT や Claude に貼り付けて解説させると理解が早まります(Claude API 活用ガイド も参照)。
次のセクションでは、初めて導入する場合の具体的な手順を時系列で示します。
🚀 はじめての導入フロー
検証から最初の文字起こしまで、おおむね 30 分で到達できます。編集部が想定する標準的な流れは以下のとおりです。
導入そのものは難しくありませんが、本番運用では注意点もあります。次のセクションで失敗パターンを確認しましょう。
編集部が見た失敗パターン
従量課金 API は便利な反面、設計を誤ると「想定外の請求」 や「使えないデータ」 を生みます。よくある落とし穴を 2 つ挙げます。
⚠️ 上限ガードを入れずに大量処理
従量課金のため、バグや設定ミスで大量の音声を一気に流すと請求が膨らみます。コンソールの残高アラートと、コード側の処理本数カウンタの二重ガードを必ず入れてください。検証段階こそ上限設定を先に済ませておくのが安全です。
⚠️ 音質を確認せずに本番投入
文字起こしの精度は元音声の品質に大きく左右されます。雑音の多い録音や複数人の同時発話では認識率が落ちます。本番投入前に自社の典型的な音声サンプルで精度を確かめ、必要なら話者分離オプションを足すか録音環境を見直しましょう。
これらは事前のひと手間で防げるものです。最後に、導入判断のまとめと公式情報源を示します。
まとめ — 導入を判断するために
Deepgram は、文字起こし機能を自社のシステムやアプリに組み込みたい開発者・事業者にとって、低コストで始められる選択肢です。英語の録音音声なら 1 時間あたり ¥40 前後、月 100 時間でも ¥4,000 前後に収まる試算で、$200 の無料クレジットでリスクなく検証を始められます。
一方で、「会議に出て自動で議事録を作ってほしい」 だけなら、API より完成品のサービスのほうが手軽です。自社の用途が「組み込み」 なのか「既製品で十分」 なのかを見極めることが、最初の判断ポイントになります。他の選択肢は AssemblyAI レビュー、Otter レビュー、OpenAI API 活用ガイド も併せてご覧ください。
Deepgram 公式サイトを見る → ※ PR・アフィリエイトリンクを含みます
出典・参考情報
本記事の料金は公式発表ドル価格を $1=¥155 で換算した編集部のシミュレーションです。為替および公式料金改定により変動します。導入前に必ず公式料金ページで最新の金額をご確認ください。
Mira / AI経営ラボ 編集長
料金プラン
| プラン | 料金 (JPY) | 請求 |
|---|---|---|
| Nova-3 英語 非同期(録音音声 1 時間あたり) | ¥40 | 買い切り |
| Nova-3 多言語 非同期(録音音声 1 時間あたり) | ¥48 | 買い切り |
| Nova-3 英語 ストリーミング(1 時間あたり) | ¥72 | 買い切り |
👍 メリット
- 従量課金で、録音音声の英語なら 1 時間あたり ¥40 前後と小規模開発でも導入しやすい
- サインアップ時に $200(約 ¥31,000)の無料クレジットが付き、クレジットカード登録なしで試せる
- Python / JavaScript / Go / .NET の公式 SDK が整備され、数行で文字起こしを呼び出せる
- 話者分離・要約・キーワード抽出などの付加機能を必要な分だけ追加課金で組み込める
👎 デメリット
- 管理画面付きの定額プランではなく API のため、利用する画面やアプリは自前で用意する必要がある
- 従量課金ゆえ、ガード未実装のまま大量音声を流すと請求が膨らむリスクがある
- 料金はドル建てのため、円安方向に振れると円換算コストが上振れする