Langfuseとは?無料で試せるLLM観測基盤|料金・使い方【2026年9月】

Langfuse observability image

公式ドキュメント・公式発表などの一次情報を確認したうえで、株式会社Nexaが執筆・更新しています。AIツールの仕様や料金は変わることがあるため、導入判断の前に各公式サイトの最新情報もご確認ください。運営会社について

結論リード
Langfuse(ラングフューズ)とは、LLMアプリやAIエージェントの実行内容を記録し、原因調査・品質評価・プロンプト管理・コスト計測を一か所で行うための、オープンソースの基盤です。クラウド版は無料のHobbyプラン(月5万ユニット・クレジットカード不要)から始められ、自社環境に置くセルフホスト版(MITライセンス)はソフトウェアの利用料がかかりません。

要点1〜3
1. できること:トレース(処理の記録)、評価、プロンプトの版管理、トークン・費用の計測の4つが中心です。
2. 料金:クラウドはHobby 無料/Core 月29米ドル/Pro 月199米ドル/Enterprise 月2,499米ドル。有料プランは月10万ユニットを含み、超過分は10万ユニットあたり8米ドルからです(2026年9月27日に公式料金ページで確認)。
3. 導入の最小手順:アカウント作成 → APIキー発行 → pip install langfuse → 環境変数を3つ設定 → OpenAIのimportを1行差し替え、の5段階で最初のトレースを記録できます。

対象
LLMアプリ、RAG、AIエージェントをPoCから本番へ移すDX推進、情報システム、開発、事業責任者。

今日やること
Hobbyプランでプロジェクトを1つ作り、機密情報を含まないテスト入力で最初のトレースを1件記録しましょう。データの保存先は日本(東京)リージョンも選べます。

この記事の著者
株式会社Nexa 代表取締役川島 陸

一橋大学経済学部卒業後、フォーティエンスコンサルティング株式会社(旧 株式会社クニエ)にて法人向けAI導入支援等を経験。独立後、AI系メディア運営やDify/n8nの導入支援を経て、株式会社Nexaを創業。法人向けAI研修・AI導入支援・AI関連メディア運営を手掛ける。

Langfuseとは、大規模言語モデル(LLM)を使ったアプリやAIエージェントの動作を記録し、評価し、改善するためのオープンソースの基盤です。Langfuse自体はモデルではなく、OpenAIなどのモデルAPIや自社アプリに接続して使います。

LLMの出力は、同じ入力でも変化する場合があります。モデルだけでなく、プロンプト、検索結果、会話履歴、外部ツールも結果に影響します。そのため、一般的なエラーログだけでは、回答品質が落ちた理由を特定できないことがあります。Langfuseは一連の処理をトレースとして結び付け、どこで何が起きたかを追えるようにします。

本記事では、2026年9月27日時点の公式情報を基に、Langfuseでできること、料金、導入の最小手順、企業導入の注意点を解説します。なお、導入しただけでAIの品質が上がるわけではありません。何を記録するか、何を合格とするか、誰が改善するかを決めて初めて価値が出ます。

Langfuseとは

Langfuseとは、LLMアプリケーションやAIエージェントの開発、監視、評価、デバッグを支援する、オープンソースのAIエンジニアリング基盤です。公式ドキュメントでは、チームが共同でAIエージェントアプリケーションをデバッグ、分析、反復改善するためのプラットフォームと説明されています。カタカナでは「ラングフューズ」と表記されることが多い名称です。

要点を先にまとめると、次の通りです。

項目 内容(2026年9月27日確認)
何のためのツールか LLMアプリ・AIエージェントの観測、評価、改善
できること トレース(処理の記録)/評価/プロンプト管理/トークン・コスト計測
提供形態 Langfuse Cloud(米国・EU・日本・HIPAA対応の各リージョン)と、自社環境に置くセルフホスト
Cloudの料金 Hobby 無料/Core 月29米ドル/Pro 月199米ドル/Enterprise 月2,499米ドル
セルフホストの料金 オープンソース版は無料(インフラ費と運用費は自社負担)。Enterprise版は個別見積もり
ライセンス 大部分はMIT。ee/などの指定ディレクトリは別ライセンス
接続方法 Python・JavaScriptのSDK、OpenTelemetry、100以上のライブラリ・フレームワーク統合
運営元 2026年1月16日にClickHouseが買収。オープンソースとセルフホストの継続を表明

運営元については、Langfuse公式ブログが2026年1月16日にClickHouseによる買収を発表しています。同じ発表の中で、オープンソースとセルフホストを継続すること、ライセンス変更の予定がないこと、Langfuse Cloudを従来通り提供することが説明されています。

中心にあるのは、LLM Observability(LLMオブザーバビリティ)です。これは、アプリの内部で起きた処理を記録し、出力だけでは見えない原因を調べられる状態にする考え方です。単に稼働しているかを見る監視よりも、なぜその結果になったかを追うことに重点があります。

Langfuseはモデルそのものではありません。OpenAIなどのモデルAPIや、LangChain、LlamaIndex、独自アプリと接続して使う運用層です。LLMの前提から整理したい場合は、LLMの仕組みと企業活用の基本も参照してください。

なぜLLMアプリには専用の観測が必要なのか

通常のWebアプリでは、HTTPエラー、CPU使用率、データベースの遅延などが主要な監視対象です。LLMアプリでは、それらに加えて次の変数が結果を左右します。

  • どのモデルと設定を使ったか
  • システムプロンプトとユーザー入力は何だったか
  • RAGがどの文書を検索したか
  • AIエージェントがどのツールを、どの順序で呼んだか
  • 入出力トークンと推定費用はいくらか
  • 利用者や評価者が回答をどう評価したか
  • 一連の会話で、どの時点から回答が崩れたか

たとえば、社内検索AIが誤回答したとしても、原因はモデルとは限りません。古い文書を検索した、関連文書を取得できなかった、プロンプトが根拠の引用を求めていなかった、という可能性があります。

Langfuseでは、一連の処理をトレースとして記録します。その中にモデル呼び出し、検索、埋め込み、API、エージェントの行動などを含められます。結果と途中経過を同じ文脈で見られる点が、通常のログとの大きな違いです。

Langfuseの仕組み。LLMアプリの実行記録を受け取り、トレース・評価・プロンプト管理・コスト計測を行う流れ
図1: Langfuseはアプリの処理をトレースとして受け取り、評価や費用の確認まで一か所で行う

Langfuseの主要機能

Langfuseの機能は、トレース(Observability)、評価(Evaluation)、プロンプト管理(Prompt Management)、トークン・コスト計測の4つが中心です。公式ドキュメントと公式GitHubでは、これらに加えてDatasets、Experiments、LLM Playground、ダッシュボード、アラート、APIなどが示されています。ここでは、企業運用での役割に分けて説明します。

Observabilityで実行全体を追跡する

Observabilityでは、アプリ内の処理をトレースとして収集し、階層や時系列で確認します。公式ドキュメントによると、LLM呼び出しだけでなく、検索、埋め込み、API呼び出しなども記録対象にできます。

複数回のやり取りはセッションとしてまとめられます。利用者単位の追跡や、エージェント処理のグラフ表示にも対応します。単発の回答だけでなく、会話の流れや分岐を含めて調べられます。

実務では、次のような調査に使えます。

  • エラーが発生した処理と入力を特定する
  • 応答が遅い工程を見つける
  • モデル別、機能別の利用量や費用傾向を把握する
  • 低評価の回答に共通する検索結果やプロンプトを調べる
  • エージェントが不要なツールを繰り返した経路を確認する

重要なのは、すべてを無制限に保存することではありません。目的に必要な属性を選び、個人情報や秘密情報を記録しない設計が必要です。

トークンとコストを計測する

Langfuseは、LLM呼び出しごとの使用量(トークン数など)と費用を記録します。公式ドキュメントによると、OpenAI、Anthropic、Googleの主要モデルの単価定義があらかじめ用意されており、多くの統合では使用量と費用が自動的に取得されます。一覧にないモデルは、自社で単価定義を追加できます。

費用は米ドルで、入力、出力などの使用種別ごとに記録されます。アプリ側から実際の使用量と費用を送った場合はその値が優先され、送らなかった場合はモデル名と単価定義から推定されます。

記録した費用は、ダッシュボードでモデル別、ユーザー別、タグ別に確認できます。しきい値を超えたときにSlack、GitHub Actions、Webhookへ通知するアラートや、集計値を取り出すMetrics APIも用意されています。推定値は単価定義に依存するため、請求額との照合はモデル提供元の利用明細で行ってください。

Prompt Managementで変更を管理する

Prompt Managementは、プロンプトを一元管理し、版を分けて改善する機能です。アプリのソースコードから文言を切り離せば、変更履歴や利用中の版を追いやすくなります。

プロンプトはAIアプリの挙動を左右する設定です。しかし、担当者が本番の指示文を直接上書きすると、いつ、誰が、なぜ変更したか分からなくなります。Langfuseでは版管理を前提にし、テストした版を段階的に採用する流れを作れます。

良いプロンプトは、長いプロンプトとは限りません。目的、入力、出力形式、禁止事項、根拠の扱いを明確にし、実際の入力群で評価する必要があります。設計の基礎はプロンプトエンジニアリング完全ガイドで詳しく解説しています。

Evaluationで品質を数値化する

Evaluationは、LLMアプリの出力を一定の基準で評価する機能です。公式GitHubでは、LLM-as-a-Judge、コードによる評価、ユーザーフィードバック、手動ラベル、独自評価パイプラインが挙げられています。

LLM-as-a-Judgeは、別のLLMに採点基準を渡し、回答を評価させる方法です。大量の結果を同じ観点で一次評価しやすい一方、評価モデルにも偏りや揺れがあります。重要な用途では、人による確認や決定的なルールと組み合わせます。

評価指標は、用途ごとに変える必要があります。

用途 評価指標の例
社内検索 根拠一致率、引用の正確さ、回答不能時の抑制
問い合わせ回答案 解決率、事実性、トーン、担当者の修正量
情報抽出 必須項目の再現率、形式エラー率、誤抽出率
AIエージェント タスク完了率、不要な操作数、失敗時の停止率
文章生成 要件充足率、禁止表現、編集時間、再生成率

平均点だけを見ると、重大な失敗が埋もれます。個人情報の出力、権限外データの参照、誤った外部操作などは、発生率が低くても別の失格条件として扱うべきです。

DatasetsとExperimentsで変更前後を比較する

Datasetsは、評価に使う入力、期待値、メタデータなどをまとめる機能です。本番で失敗した入力や、業務上重要な代表例を蓄積すれば、変更時の回帰テストに使えます。

Experimentsでは、同じデータセットに対してプロンプト、モデル、検索設定などを変えて実行し、結果を比較します。「新しいモデルだから良い」と決めず、自社の入力で品質、速度、費用を見るための仕組みです。

評価データは、成功例だけでは不十分です。曖昧な質問、対象外の依頼、古い情報、長文、入力欠損、悪意ある指示なども含めます。本番の失敗を継続的にデータセットへ戻すと、改善が属人的な記憶ではなく資産になります。

Playground、API、各種統合

LLM Playgroundでは、プロンプトやモデル設定を試し、結果を比較できます。トレースで悪い回答を見つけ、Playgroundで修正案を試すという短い改善ループを作れます。

また、Python、JavaScript/TypeScript向けSDKやAPIが用意されています。公式ドキュメントは100以上のライブラリ・フレームワーク統合があると説明しており、OpenAI SDK、LangChain、LlamaIndex、LiteLLM、Vercel AI SDK、Mastra、OpenTelemetryなどとの連携が案内されています。

OpenTelemetryは、分散システムのトレースやメトリクスを扱う標準的な枠組みです。既存アプリがOpenTelemetryのspanを出している場合、観測基盤全体との整合を取りやすくなります。Langfuseの公式ドキュメントも、OpenTelemetryを互換性向上とロックイン低減の要素として示しています。

Langfuseでできること

機能一覧だけでは、導入効果を判断しにくいものです。ここでは、業務上の課題に置き換えて整理します。

誤回答の原因をモデル以外まで追える

最終出力だけを保存していると、問題の原因を推測するしかありません。トレースがあれば、検索結果、ツール実行、プロンプト、モデル応答を順に確認できます。

RAGでは、検索品質と生成品質を分けて考えることが重要です。正しい文書を取得できなければ、優れたモデルでも正確に答えられません。企業向けRAGの仕組みと構築手順も合わせて確認してください。

遅延と費用を処理単位で改善できる

AIアプリの応答時間は、モデルだけで決まりません。検索、再ランキング、複数回のモデル呼び出し、外部API、ツールの再試行が積み重なります。

トレースを工程別に見れば、遅い箇所や呼び出し回数の増加を発見しやすくなります。高速なモデルへの変更、不要な再試行の削減、キャッシュ、プロンプト短縮など、具体的な改善へつなげられます。

費用も月額合計だけでなく、機能、顧客、処理種別、成功・失敗で分解することが重要です。失敗した処理に費用を使い続けていないかを見ると、単純なモデル単価比較より有効な場合があります。

品質改善をチームの定常業務にできる

本番運用では、開発者だけで回答品質を判断できません。業務担当者が低評価の回答へラベルを付け、開発者がトレースを調べ、修正版をデータセットで検証する流れが必要です。

Langfuseは、この共同作業の土台になります。一方、会議で「最近精度が悪い」と話すだけでは、改善対象も成果も曖昧なままです。評価指標、担当者、改善期限を運用ルールとして定める必要があります。

Langfuse Cloudとセルフホストの違い

Langfuseには、運営元が管理するLangfuse Cloudと、自社環境へ配置するセルフホストがあります。どちらが安全かを名称だけで決めるのではなく、データ、運用能力、可用性、契約要件から選びます。

項目 Langfuse Cloud セルフホスト
開始まで アカウントとプロジェクトを作りやすい 基盤構築と設定が必要
基盤運用 サービス側が担当 自社が更新、監視、復旧を担当
配置先 米国、EU、日本(東京)、HIPAA対応の各リージョンから選択 自社方針に沿って選択可能
拡張性 プランとサービス仕様に依存 構成に応じて設計可能
初期負担 比較的小さい インフラと運用設計が必要
向く状況 PoC、早期導入、少人数運用 配置・統制要件、自社運用能力がある

Langfuse Cloudのデータリージョン

公式のデータリージョン文書によると、Langfuse Cloudには次のリージョンがあります。いずれもAWS上で稼働しています。

リージョン 接続先URL 所在地
米国 https://us.cloud.langfuse.com オレゴン(AWS us-west-2)
EU https://cloud.langfuse.com アイルランド(AWS eu-west-1)
日本 https://jp.cloud.langfuse.com 東京(AWS ap-northeast-1)
HIPAA対応 https://hipaa.cloud.langfuse.com オレゴン(AWS us-west-2)

データ、ユーザーアカウント、基盤はリージョンごとに完全に分離されています。後からリージョンを変える場合は、新しいアカウントの作成とデータ移行が必要です。国内にデータを置く要件がある場合は、最初から日本リージョンでアカウントを作成してください。

セルフホストの構成と責任範囲

公式セルフホスト文書では、ローカル利用や検証向けにDocker Composeが案内されています。ただし、この構成は単一の仮想マシンで動かすもので、高可用性、スケーリング、バックアップ機能を欠くと明記されています。本番のセルフホストでは、Kubernetes(Helm)や、AWS、Azure、GCP向けのTerraform構成が案内されています。

セルフホスト版は、WebとWorkerの2つのアプリケーションコンテナに加え、Postgres、ClickHouse、Redis(またはValkey)、S3互換のオブジェクトストレージで構成されます。自社で運用する対象は、Langfuse本体だけではない点に注意してください。

「Dockerで起動できた」と「本番運用できる」は別です。データベース、オブジェクトストレージ、暗号化、秘密情報、監視、容量、バックアップ、復旧試験、更新手順まで設計します。

Langfuseのライセンス

ソースコードのライセンスにも注意が必要です。2026年9月27日時点の公式LICENSEでは、ee/、web/src/ee/、worker/src/ee/の各ディレクトリ以外はMIT Expatですが、指定部分は別ライセンス(ee/LICENSE)です。

公式文書は、中核機能とAPIはオープンソース版で制限なく使えると説明しています。一方、プロジェクト単位の権限管理(RBAC)、保護されたプロンプトラベル、データ保持ポリシー、監査ログ、サーバー側のデータマスキング、SCIMなどの追加機能には、Enterpriseのライセンスキーが必要です。商用利用や再配布では、利用する機能と最新のライセンスを法務担当者と確認してください。

Langfuseの料金

Langfuseの料金は、クラウド版(Langfuse Cloud)が無料のHobbyから月2,499米ドルのEnterpriseまでの4プラン、セルフホストのオープンソース版が無料です。2026年9月27日時点の公式料金ページに掲載されているクラウド版の内容は次の通りです。

プラン 月額 含まれる使用量 超過料金 データアクセス ユーザー サポート
Hobby 無料 月50,000 units — 30日 2人 コミュニティ(GitHub)
Core 29米ドル 月100,000 units 100,000 unitsあたり8米ドルから 90日 無制限 アプリ内サポート
Pro 199米ドル 月100,000 units 100,000 unitsあたり8米ドルから 3年 無制限 優先アプリ内サポート
Enterprise 2,499米ドル 月100,000 units 100,000 unitsあたり8米ドルから(年間契約で個別設定あり) 3年 無制限 専任の担当エンジニア、SLA

Hobbyはクレジットカードの登録なしで始められます。Proには、SSOの強制やプロジェクト単位の権限管理などを追加するTeamsアドオン(月300米ドル)があります。監査ログ、SCIM、稼働率とサポートのSLAはEnterpriseの機能です。

Langfuseの料金プラン比較表。無料のHobbyから月2,499米ドルのEnterpriseまで4プランの月額
図2: 有料の3プランは含まれる使用量が同じで、月額とデータアクセスの期間が異なる

ユニットの数え方と超過料金

課金の単位であるunitsは、Langfuseへ送られたデータの件数です。公式文書では、次の式で定義されています。

units = トレース数 + オブザベーション数 + スコア数

トレースは1回の処理全体、オブザベーションはその中の個々の工程(モデル呼び出し、検索、ツール実行など)、スコアは評価結果です。1回の問い合わせで複数の工程を記録すれば、その分だけunitsが増えます。LLM-as-a-Judgeなど、Langfuseの機能が作成したスコアも課金対象に含まれます。

含まれる使用量を超えた分は、量が増えるほど単価が下がる段階制です。

月間の使用量 超過分の単価
100,000 unitsまで プランに含まれる
100,000〜1,000,000 units 100,000 unitsあたり8.00米ドル
1,000,000〜10,000,000 units 100,000 unitsあたり7.00米ドル
10,000,000〜50,000,000 units 100,000 unitsあたり6.50米ドル
50,000,000 units超 100,000 unitsあたり6.00米ドル

公式料金ページの計算例では、Coreで月200,000 unitsを使う場合は29米ドル+8米ドルで月37米ドル、月1,000,000 unitsを使う場合は29米ドル+72米ドルで月101米ドルです。アーリーステージのスタートアップ、研究・学生、非営利団体、オープンソースプロジェクト向けの割引も掲載されています。

セルフホストの料金

公式のセルフホスト料金ページでは、オープンソース版は無料で、使用量の上限もありません。トレース、評価、プロンプト管理、データセットなどの中核機能とAPIが含まれます。Enterprise版は個別見積もりで、ClickHouseの商用プランと組み合わせて提供されると説明されています。

料金、unitsの算定、上限、機能、税、為替は変更される可能性があります。契約前に必ずLangfuse公式料金ページで最新条件を確認してください。

料金表に出ないコスト

Langfuseの月額だけで、AIアプリの運用費は決まりません。次の費用も含めて総保有コストを試算します。

  • OpenAIなど接続するモデルのAPI料金
  • クラウド、データベース、ストレージ、通信の費用
  • セルフホストの監視、更新、バックアップ、障害対応
  • トレース項目の設計と実装
  • 評価データの作成、採点、見直し
  • 個人情報のマスキングとアクセス制御
  • ダッシュボード確認、改善、問い合わせ対応の人件費

無料プランは、概念実証に適しています。ただし、本番で必要な保持期間、利用者数、監査、サポート、使用量を先に見積もらないと、移行時に設計をやり直すことがあります。


AI導入に関するお困りごとは、株式会社NexaのAI顧問がサポートします。「何から始めればいいか分からない」という段階からご相談いただけます。

AI顧問の無料相談はこちら →


Langfuseの使い方

Langfuseは、コードへSDKを追加するところから始められます。まず、最初のトレースを記録するまでの最小手順を示し、その後に企業導入で踏むべき7つの手順を説明します。

最小手順:最初のトレースを記録するまで

公式の開始ガイドに沿った、OpenAI Python SDKを使っている場合の手順です。検証用の環境と、機密情報を含まない入力で試してください。

  1. Langfuse Cloudでアカウントを作成する(またはセルフホスト環境を用意する)
  2. プロジェクト設定で、APIキー(公開鍵と秘密鍵)を発行する
  3. SDKをインストールする
  4. 環境変数に、2つの鍵と接続先URLを設定する
  5. OpenAIのimportをLangfuseのラッパーへ差し替えて実行し、画面でトレースを確認する
Langfuseの使い方。アカウント作成、APIキー発行、SDKのインストール、環境変数の設定、実行までの5手順
図3: OpenAI Python SDKなら、importの差し替えで最初のトレースを記録できる

手順3のインストールは次の1行です。

pip install langfuse

手順4の環境変数は次の3つです。接続先URLは、アカウントを作成したリージョンに合わせます。以下は日本リージョンの例です。

LANGFUSE_SECRET_KEY="sk-lf-..."
LANGFUSE_PUBLIC_KEY="pk-lf-..."
LANGFUSE_BASE_URL="https://jp.cloud.langfuse.com"

手順5では、importを差し替えたうえで、これまで通りOpenAI SDKを呼び出します。

from langfuse.openai import openai

completion = openai.chat.completions.create(
  name="test-chat",
  model="gpt-4o",
  messages=[
      {"role": "system", "content": "You are a very accurate calculator."},
      {"role": "user", "content": "1 + 1 = "}],
)

このコードは公式ガイドのサンプルを基にしたものです。モデル名は、自社で利用しているものへ置き換えてください。OpenAI APIの認証情報は、別途これまで通り必要です。LangChain、Vercel AI SDK、JavaScript/TypeScript、OpenTelemetryを使う場合の手順も、同じ公式ガイドに掲載されています。

手元のPCでセルフホスト版を試す場合は、公式リポジトリを取得し、docker-compose.yml内の秘密情報を書き換えてから起動します。起動後、http://localhost:3000で画面を開き、最初のユーザーを登録します。

git clone https://github.com/langfuse/langfuse.git
cd langfuse
docker compose up

ここまでは動作確認の手順です。企業で導入する場合は、目的とデータの設計を先に行うほうが安全です。以下の順序で、小さく検証してください。

1. 対象業務とKPIを決める

最初の対象を一つに絞ります。「AIの品質を上げる」ではなく、次のように測定可能な目標へ変えます。

  • 社内検索の根拠一致率を測る
  • 問い合わせ回答案の担当者修正率を下げる
  • 95パーセンタイルの応答時間を把握する
  • 1件の完了タスクあたりのモデル費用を算出する
  • エージェントの不要なツール実行を検出する

品質、速度、費用の最低3軸を置くと、一つの指標だけを改善して別の指標を悪化させる事態を避けやすくなります。

2. Cloudかセルフホストかを選ぶ

PoCを早く始めるならCloudが候補です。配置先、閉域、独自の保持方針などが必須ならセルフホストを検討します。

判断前に、情報区分、送信可能なデータ、保持期間、利用者、認証、監査ログ、復旧目標を整理します。セルフホストを選ぶ場合は、構築担当者だけでなく、継続運用の担当者と予算も決めます。

3. プロジェクトとAPI認証情報を用意する

Cloudではリージョンを選んでアカウントとプロジェクトを作成します。セルフホストでは、公式手順に沿って環境を構築します。その後、プロジェクト設定でAPI認証情報(公開鍵と秘密鍵)を作成します。

認証情報をソースコードやGitへ直接書かないでください。環境変数や秘密情報管理サービスを使い、開発、検証、本番で分離します。漏えい時に無効化、再発行できる手順も用意します。

4. SDK、統合、OpenTelemetryで計装する

公式の開始ガイドでは、Python、JavaScript/TypeScript SDK、OpenAI SDK統合、LangChain、Vercel AI SDK、OpenTelemetryなどを選べます。既存技術に合う方法を使います。

OpenAI Python SDKを利用している場合、公式ガイドはLangfuseのラッパーをドロップイン置換として案内しています。前述の最小手順の通り、パッケージを導入し、Langfuseの認証情報と接続先を環境変数で設定し、ラップされたクライアントから呼び出します。

具体的なコードはSDKの更新で変わるため、実装時は公式のTracing開始ガイドを参照してください。OpenAI API自体の認証、料金、安全な設計はOpenAI APIの企業向けガイドで確認できます。

5. 最初のトレースを確認する

検証用の入力を送り、Langfuse画面でトレースを確認します。次の項目が意図通りかを見ます。

  • トレース名と処理種別
  • モデル、プロンプト、入力、出力
  • 開始、終了、応答時間
  • トークンや費用に関する情報
  • 検索、外部API、ツール実行の親子関係
  • セッションIDとユーザーIDの付け方
  • エラーと再試行

この段階では、実在顧客のデータではなく、匿名化したテストデータを使います。画面に見える情報だけでなく、保存先へ送信される項目全体をレビューしてください。

6. 評価データセットを作る

代表的な正常入力だけでなく、失敗しやすい入力も集めます。各入力について、期待する要素、許容できない結果、採点方法を決めます。

たとえば、社内規程の回答なら、正しい結論だけでは不十分です。最新版の根拠を引用したか、権限外情報を表示していないか、根拠がなければ回答を控えたかも評価します。

最初は20〜50件程度の重要例から始め、実運用で見つかった失敗を追加します。件数を増やすことより、事業上のリスクを代表していることが重要です。

7. 小規模運用から本番へ移す

本番化の前に、次の運用を決めます。

  • 低評価や障害を誰が毎週確認するか
  • プロンプト変更を誰が承認するか
  • 新しい版をどのデータセットで評価するか
  • 品質悪化時にどう切り戻すか
  • トレースの保持と削除をどう行うか
  • 利用量と費用のしきい値をどう通知するか

本番では、すべてのトレースを永久保存する必要はありません。保持期間、サンプリング、重要処理の全件記録を使い分け、調査可能性と費用、プライバシーを両立させます。

\ AI活用の「次の一手」を一緒に考えませんか /

AI顧問の無料相談はこちら

企業がLangfuseを導入する際の注意点

入力と出力に機密情報を残さない

トレースには、プロンプト、利用者の入力、モデル出力、検索結果、ツール引数が含まれ得ます。つまり、デバッグに便利な情報ほど、漏えい時の影響も大きくなります。

保存前のマスキング、収集項目の最小化、暗号化、保持期間、削除手順を決めます。氏名、メールアドレス、契約情報、認証情報、社外秘文書を無条件で送らない設計にしてください。

「セルフホストだから安全」ではありません。アクセス権の誤設定、バックアップ、管理者端末、脆弱性対応など、自社が守る範囲が増えます。Cloudもセルフホストも、実際のデータフローを図にして審査する必要があります。

権限を環境と役割で分ける

開発者全員が本番トレースを閲覧できる設計は避けます。開発、検証、本番のプロジェクトを分け、業務上必要な利用者だけに権限を付けます。

API認証情報も環境ごとに分離します。読み取り、書き込み、管理の権限が分けられる場合は、最小権限を適用します。退職、異動、委託終了時の削除手順も、導入時に作っておきます。

評価指標を事業成果につなげる

技術指標だけでは、投資効果を説明できません。トークン数や遅延に加え、担当者の修正時間、一次解決率、処理完了率、顧客満足、事故件数などを追います。

一方、評価点が高くても、業務時間が減らなければ導入効果は限定的です。モデルの点数と事業KPIを結び付け、改善の優先順位を決めます。

本番障害を前提にする

Langfuseへの送信失敗が、本来のAI機能まで停止させない設計を検討します。観測処理を非同期化する、タイムアウトを置く、キューを使う、再送上限を決めるなどの方法があります。

同時に、トレース欠損を放置してはいけません。収集率、遅延、エラー、保存容量を監視し、観測基盤そのものの健全性も確認します。

バージョン更新と互換性を管理する

Langfuse本体、SDK、統合先、データベースは更新されます。本番へ直接適用せず、検証環境で移行、互換性、性能、保持データを確認します。

セルフホストでは、更新しないリスクも自社が負います。脆弱性情報とリリースノートを定期確認し、バックアップと切り戻しを含む更新手順を用意してください。

Langfuseに関するよくある質問

Q. Langfuseは無料で使えますか

Langfuse CloudにはHobbyの無料プランがあり、クレジットカードの登録なしで始められます。2026年9月27日時点では、月50,000 units、30日間のデータアクセス、2ユーザーが掲載されています。セルフホストのオープンソース版も無料ですが、サーバー、データベース、監視、更新、人件費は別途必要です。最新条件は公式料金ページで確認してください。

Q. Langfuseの有料プランはいくらですか

2026年9月27日時点の公式料金ページでは、Coreが月29米ドル、Proが月199米ドル、Enterpriseが月2,499米ドルです。いずれも月100,000 unitsを含み、超過分は100,000 unitsあたり8米ドルから、使用量に応じて単価が下がります。Proには月300米ドルのTeamsアドオンがあります。

Q. Langfuseのunitsとは何ですか

unitsは課金の単位で、トレース数、オブザベーション数、スコア数の合計です。1回の処理の中で複数の工程を記録すると、その分だけunitsが増えます。LLM-as-a-Judgeなど、Langfuseの機能が作成したスコアも含まれます。

Q. 日本のリージョンは使えますか

使えます。公式文書には、米国、EU、日本(東京、AWS ap-northeast-1)、HIPAA対応の各リージョンが掲載されています。日本リージョンの接続先はhttps://jp.cloud.langfuse.comです。リージョン間でデータとアカウントは分離されているため、後から変える場合は新しいアカウントの作成とデータ移行が必要です。

Q. LangfuseはOpenAI専用ですか

OpenAI専用ではありません。公式ドキュメントとGitHubは、Python、JavaScript/TypeScript SDK、LangChain、LlamaIndex、LiteLLM、Vercel AI SDK、OpenTelemetryなどの統合を案内しています。実装方法は使用する言語、モデル、フレームワークに応じて選びます。

Q. セルフホストすれば無料ですか

オープンソース版のソフトウェアは無料で、使用量の上限もありません。ただし、運用費がゼロになるわけではありません。インフラ、保存容量、バックアップ、監視、更新、障害対応、セキュリティ対策の費用がかかります。プロジェクト単位の権限管理や監査ログなど、一部の追加機能にはEnterpriseのライセンスキーが必要です。

Q. Langfuseのライセンスは何ですか

2026年9月27日時点の公式LICENSEでは、ee/などの指定ディレクトリ以外はMIT Expatです。指定ディレクトリ内のコードは別ライセンスで、対応する追加機能の利用にはライセンスキーが必要です。商用利用や再配布の前に、最新のLICENSEを確認してください。

Q. Langfuseを入れると回答精度は上がりますか

自動的には上がりません。Langfuseは、失敗を見つけ、原因を調べ、変更を評価するための基盤です。評価データセット、合格基準、改善担当者、変更手順がそろって初めて、継続的な品質向上につながります。

まとめ

Langfuseは、LLMアプリのトレース、評価、プロンプト管理、コスト計測、データセット、実験を一体化するオープンソースのAIエンジニアリング基盤です。モデル呼び出しだけでなく、検索や外部API、エージェント処理まで結び付けて確認できるため、複雑なAIアプリの改善に向いています。

Cloudは無料のHobbyプランから早く始めやすく、日本リージョンも選べます。セルフホストは配置先を自社で決められます。ただし、どちらもデータ分類、アクセス権、保持期間、評価基準、改善責任者が必要です。料金表だけで選ばず、モデルAPI、基盤、評価、運用人件費を含む総保有コストで比較してください。

最初の一歩は、大規模な全社導入ではありません。一つのアプリで品質、速度、費用の基準値を測り、匿名化した検証データをトレースします。その結果から、Langfuseが自社の改善サイクルに合うかを判断しましょう。


AI導入に関するお困りごとをサポートします

株式会社NexaのAI顧問は、ツール選定から業務への適用、社内定着までを月額制でサポートします。特定のツールに限らず、「AIをどう使えばいいか分からない」という段階からご相談いただけます。

AI顧問の詳細・無料相談はこちら →


参考資料




この記事で参照した外部情報

  1. Langfuse公式料金ページlangfuse.com
  2. 公式のTracing開始ガイドlangfuse.com
  3. Langfuse公式ドキュメント:Overviewlangfuse.com
  4. Langfuse公式ドキュメント:Token & Cost Trackinglangfuse.com
  5. Langfuse公式:Self-Hosted Pricinglangfuse.com
  6. Langfuse公式ドキュメント:Billable Unitslangfuse.com
  7. Langfuse公式:Data Regions & Availabilitylangfuse.com
  8. Langfuse公式:Self-host Langfuselangfuse.com
  9. Langfuse公式:Docker Compose Deploymentlangfuse.com
  10. Langfuse公式:Enterprise License Keylangfuse.com
  11. Langfuse公式ブログ:Langfuse joins ClickHouselangfuse.com
  12. Langfuse公式GitHubgithub.com
  13. Langfuse LICENSEgithub.com

本文中でリンクしている外部ページの一覧です(自動生成)。最終確認日は本記事の最終更新日 2026-09-28 で、リンク先の内容はその後変わることがあります。

AI導入を検討中の方へ

AIの力で、ビジネスを次のステージへ

まずはお気軽にご相談ください。貴社に最適なAI活用プランをご提案します。