telepace

从证据到 Eval

教会你的 AI
什么才叫正确。

Telepace 把线上失败、专家判断、政策与用户证据,编译成 Eval Case、校准后的裁判和发布门禁。

一次代价高昂的失败就能开始,不需要问卷级的大样本。

候选版本 B · 发布检查
暂缓

发布评分

42/100

比线上版本 +9

关键阻断

CASE-042

Agent 在核验退款政策资格前就向用户承诺退款。

1 次关键失败 · 模糊退款切片 · 零容忍

来源
资格不明确时禁止承诺,必须携带订单上下文升级人工。退款政策 v12 · 负责人已确认
任何关键政策违规都会阻断发布暂缓发布

即可开始

1 次失败

得到第一版评测合同

< 3 分钟

进入真实发布流程

JSON · MCP · CI

工作原理

从一次坏结果,到一道永久发布门禁。

01

定义任务合同

明确发布决策、预期结果、禁止结果、可用工具与关键切片。

02

定位证据缺口

Telepace 展示未知项、谁有资格回答,以及每个问题为什么值得问。

03

只收集缺失证据

把轨迹、政策、工单、专家纠正或一次短用户澄清连接到同一证据图谱。

04

编译并阻断

导出可重放 Eval Case、评分锚点、分层裁判,以及发布或暂缓结论。

持续复利的产物

真正能保护下一次发布的证据。

一句引述不是终点。Telepace 把确认过的证据编译成有版本的任务合同、回归用例、评分标准、裁判方案和发布门禁。

退款政策回归评测

1 次线上失败 · 政策 v12 · 负责人已校准

Eval Pack v1

真实证据

机器人说退款已经批准,后来人工客服却告诉我根本不符合资格。
客服工单 #1842 · 已关联线上轨迹 · 已核验

trace_8f21 · 第 14 轮 · policy_refund_v12

编译产物

01

任务合同

承诺前必须核验退款资格

02

关键 Eval Case

模糊退款请求必须升级人工

03

发布门禁

政策违规容忍次数为 0

telepace.eval-pack.v1 · 完整保留来源

一张证据图谱

选择真正有权威的来源,而不是数量最多的来源。

线上轨迹

还原实际发生了什么

客服工单

保留高代价失败上下文

领域专家

定义质量门槛与边界

政策与规格

生成确定性硬门禁

用户澄清

仅在行为无法解释意图时

Agent 原生

你的 Coding Agent 负责构建,Telepace 告诉它什么绝不能再次出错。

通过 MCP、Skill、REST 或版本化 JSON,把线上证据编译为评测,并将完全一致的发布门禁带入现有 runner 与 CI。

// Codexcodex> compile this refund failure into an eval // telepace.create_campaign✓ campaign_id: 4f2b…9c1✓ task_contract: refund eligibility // telepace.get_eval_pack✓ 3 candidate cases✓ 1 critical policy gate✓ judge order: deterministic → model → human // evidence compiled  · 线上轨迹已关联政策 v12  · 模糊退款请求已编译为 Eval Case  · 零容忍发布门禁已保留

明确的付费负责人

为真正对 AI 行为负责的团队而造。

AI 产品负责人

做出可辩护的发布、暂缓或回滚决策。

评测工程师

把真实失败变成永久回归覆盖。

领域专家

一次编码专业判断,持续测量裁判一致性。

风险与运营团队

让政策边界可观察,并能真正阻断发布。

不要发布
尚未定义正确性的 AI。

从团队最不能承受再次发生的那次失败开始。

telepace — 从用户证据到生产级 AI 评测 · telepace