AI 可观测性 / AIGC BOT 项目判断

Langfuse

为 LLM 应用补上观测、评估和提示词版本管理。

OPPORTUNITY BRIEF

生产治理

这是一份编辑判断,不是收入承诺。它帮助你决定是否值得把时间投入第一次验证。

为什么现在
AI 应用开始进入真实使用后,质量波动和 token 成本会迅速变成商业问题。
先怎么验证
给一条关键用户路径补齐 trace、成本和人工质量标记。
能交付给谁
AI 上线体检、质量看板、提示词治理和成本复盘服务。
先避开什么
提示词、用户输入和业务数据必须先做脱敏与留存设计。

GitHub 公开页快照
2026-07-23

Stars
31.7k
最近信息
v3.224.0 · 2026-07-22
许可
MIT(ee 目录除外)
部署难度
中等

01

为什么现在值得看

可观察性是 AI 产品从演示走向稳定交付的关键缺口。

02

先怎么验证

官方提供自托管方案;先定义需要记录的调用、成本和评估事件。

03

适合谁与交付方向

已经有 AI 应用、需要控制质量和成本的开发团队。 可以作为 AI 项目交付服务中的质量与成本治理能力。

04

下钻笔记

  • 不要等线上事故后再接入,MVP 阶段就定义 trace 字段。
  • 把回复质量、召回命中和 token 成本放在同一张复盘表里。
  • 处理提示词和用户输入前要先设计脱敏策略。

45 分钟提示词发布门禁

移动 production 标签前,先做一张可回滚的提示词版本验收包。

读者结果
让已有 Langfuse 项目的团队在不移动 production 标签、不使用真实敏感输入的前提下,用同一组可复查样本比较当前与候选提示词版本,得到可审核的发布或停止结论。
时间 / 成本 / 风险边界
限时 45 分钟,只验证一个提示词、当前与候选两个明确版本、六条脱敏样本和一个临时 staging 标签;预先写明模型调用预算上限。演练期间不移动 production 标签,不接入生产流量,不把 API 密钥、原始用户输入或完整模型输出复制进验收包。
  1. 01冻结比较基线

    记录 production 当前指向的版本 ID、候选版本 ID、两者标签和 diff;同时记录实验开始时 dataset 的条目数、更新时间或导出哈希,因为 UI 实验使用运行时最新的 dataset 版本。

  2. 02补齐六条验收样本

    覆盖正常请求、边界输入、拒答、安全注入、结构化输出和中英双语各自需要的风险;每条都写 input、expected output、不可违反项和评分方式,变量键必须与两个提示词版本同时匹配。

  3. 03运行成对实验

    在同一 dataset、同一模型和同一运行参数下分别执行当前版本与候选版本;保存两个 experiment run ID,并用代码 evaluator、LLM-as-a-Judge 或人工复核记录逐条结果,不能只看聚合分数。

  4. 04核对版本可追溯性

    把提示词对象关联到对应 generation trace,确认六条结果都能追到准确版本;记录 generation 数、分数、延迟、输入/输出 token 与成本中实际可用的字段,并确认没有因 fallback prompt 而失去版本关联。

  5. 05写发布与回滚结论

    把逐条差异、失败原因、预算消耗、脱敏检查和复核意见写进验收包;演练在 production 标签变更前结束,只把旧版本 ID列为回滚目标,由获授权人员在独立变更窗口决定是否移动标签。

可见产物
一张 Langfuse 提示词版本验收包:提示词名称|当前/候选版本 ID 与 diff|标签|dataset 条目数/时间或哈希|六条 input/expected output/规则|模型与参数|预算上限/实耗|两个 experiment run ID|逐条与聚合分数|trace/版本关联|延迟/token/成本可用值|脱敏检查|旧版本回滚目标|复核者|发布或停止。
通过条件
两个实验确实使用同一冻结证据、六条样本都能复现并关联到准确提示词版本,所有确定性与安全规则通过,候选版本没有已知回归,实际调用未超预算,验收包不含密钥或原始敏感数据,production 标签在演练中未改变,并由独立复核者签署发布结论。
停止条件
dataset 在比较中变化且无法还原、变量键不匹配、expected output 或评分规则缺失、任一安全/结构化输出样本失败、fallback 导致 trace 无法关联版本、模型参数或预算不可比、敏感数据无法脱敏、production 标签已经被意外移动、受保护标签权限不清,或候选版本出现任何未解释回归时,停止发布并先补证据。

一手资料 / 编辑边界

官方文档定义版本、标签、实验和 trace 关联;45 分钟六样本验收包是本站发布前模板。

Langfuse 文档说明提示词自动获得版本 ID,标签可代表 staging、production 或实验,默认读取 production,回滚可把 production 标签重新指向旧版本;版本 diff 用于查看变化。Prompt Experiments 用 dataset 比较提示词版本,要求 JSON input 键匹配提示词变量,并支持 expected output、代码 evaluator 或 LLM-as-a-Judge;当前 UI 实验按运行时最新 dataset 版本执行。提示词关联 generation trace 后可按版本查看分数、延迟、token 与成本等指标,但 fallback prompt 不会建立关联。六条样本、45 分钟、零未解释回归和独立复核是编辑建议,不是 Langfuse 认证、质量保证或成本承诺。