01
为什么现在值得看
可观察性是 AI 产品从演示走向稳定交付的关键缺口。
02
先怎么验证
官方提供自托管方案;先定义需要记录的调用、成本和评估事件。
03
适合谁与交付方向
已经有 AI 应用、需要控制质量和成本的开发团队。 可以作为 AI 项目交付服务中的质量与成本治理能力。
04
下钻笔记
- 不要等线上事故后再接入,MVP 阶段就定义 trace 字段。
- 把回复质量、召回命中和 token 成本放在同一张复盘表里。
- 处理提示词和用户输入前要先设计脱敏策略。
AI 可观测性 / AIGC BOT 项目判断
为 LLM 应用补上观测、评估和提示词版本管理。
OPPORTUNITY BRIEF
这是一份编辑判断,不是收入承诺。它帮助你决定是否值得把时间投入第一次验证。
GitHub 公开页快照
2026-07-23
01
可观察性是 AI 产品从演示走向稳定交付的关键缺口。
02
官方提供自托管方案;先定义需要记录的调用、成本和评估事件。
03
已经有 AI 应用、需要控制质量和成本的开发团队。 可以作为 AI 项目交付服务中的质量与成本治理能力。
04
45 分钟提示词发布门禁
记录 production 当前指向的版本 ID、候选版本 ID、两者标签和 diff;同时记录实验开始时 dataset 的条目数、更新时间或导出哈希,因为 UI 实验使用运行时最新的 dataset 版本。
覆盖正常请求、边界输入、拒答、安全注入、结构化输出和中英双语各自需要的风险;每条都写 input、expected output、不可违反项和评分方式,变量键必须与两个提示词版本同时匹配。
在同一 dataset、同一模型和同一运行参数下分别执行当前版本与候选版本;保存两个 experiment run ID,并用代码 evaluator、LLM-as-a-Judge 或人工复核记录逐条结果,不能只看聚合分数。
把提示词对象关联到对应 generation trace,确认六条结果都能追到准确版本;记录 generation 数、分数、延迟、输入/输出 token 与成本中实际可用的字段,并确认没有因 fallback prompt 而失去版本关联。
把逐条差异、失败原因、预算消耗、脱敏检查和复核意见写进验收包;演练在 production 标签变更前结束,只把旧版本 ID列为回滚目标,由获授权人员在独立变更窗口决定是否移动标签。
一手资料 / 编辑边界
Langfuse 文档说明提示词自动获得版本 ID,标签可代表 staging、production 或实验,默认读取 production,回滚可把 production 标签重新指向旧版本;版本 diff 用于查看变化。Prompt Experiments 用 dataset 比较提示词版本,要求 JSON input 键匹配提示词变量,并支持 expected output、代码 evaluator 或 LLM-as-a-Judge;当前 UI 实验按运行时最新 dataset 版本执行。提示词关联 generation trace 后可按版本查看分数、延迟、token 与成本等指标,但 fallback prompt 不会建立关联。六条样本、45 分钟、零未解释回归和独立复核是编辑建议,不是 Langfuse 认证、质量保证或成本承诺。