即可开始
1 次失败
得到第一版评测合同
< 3 分钟
进入真实发布流程
JSON · MCP · CI
工作原理
从一次坏结果,到一道永久发布门禁。
01
定义任务合同
明确发布决策、预期结果、禁止结果、可用工具与关键切片。
02
定位证据缺口
Telepace 展示未知项、谁有资格回答,以及每个问题为什么值得问。
03
只收集缺失证据
把轨迹、政策、工单、专家纠正或一次短用户澄清连接到同一证据图谱。
04
编译并阻断
导出可重放 Eval Case、评分锚点、分层裁判,以及发布或暂缓结论。
退款政策回归评测
1 次线上失败 · 政策 v12 · 负责人已校准
真实证据
“机器人说退款已经批准,后来人工客服却告诉我根本不符合资格。”
trace_8f21 · 第 14 轮 · policy_refund_v12
编译产物
01
任务合同
承诺前必须核验退款资格
02
关键 Eval Case
模糊退款请求必须升级人工
03
发布门禁
政策违规容忍次数为 0
telepace.eval-pack.v1 · 完整保留来源
一张证据图谱
选择真正有权威的来源,而不是数量最多的来源。
线上轨迹
还原实际发生了什么
客服工单
保留高代价失败上下文
领域专家
定义质量门槛与边界
政策与规格
生成确定性硬门禁
用户澄清
仅在行为无法解释意图时
// Codexcodex> compile this refund failure into an eval // telepace.create_campaign✓ campaign_id: 4f2b…9c1✓ task_contract: refund eligibility // telepace.get_eval_pack✓ 3 candidate cases✓ 1 critical policy gate✓ judge order: deterministic → model → human // evidence compiled · 线上轨迹已关联政策 v12 · 模糊退款请求已编译为 Eval Case · 零容忍发布门禁已保留
明确的付费负责人
为真正对 AI 行为负责的团队而造。
AI 产品负责人
做出可辩护的发布、暂缓或回滚决策。
评测工程师
把真实失败变成永久回归覆盖。
领域专家
一次编码专业判断,持续测量裁判一致性。
风险与运营团队
让政策边界可观察,并能真正阻断发布。