近日,一个名为Tessary的开源项目在Hacker News上发布。该项目定位为代理可靠性平台,旨在监控AI代理的全部生产轨迹,并发现采样评测可能遗漏的问题。

发生了什么

据项目联合创始人Akhil介绍,Tessary源于团队此前构建合成用户进行B2B软件可用性测试的经历。他们尝试让代理模拟真实用户使用软件,但长时间会话下代理始终不够可靠。为此团队构建了大规模评测集来调优代理,然而评测本身成本过高——由于需要针对代理众多狭窄意图进行评分,评测成本甚至是运行代理的5倍。

Tessary由此诞生,目标是在扩大代理可靠性覆盖范围的同时降低运行成本。该系统分为两层:L1分类器查看每一条代理轨迹,以极低成本标记可能存在错误的轨迹;L2代理则针对被标记的轨迹进行分诊并定位根因。据称,L1分类器的成本比运行实际代理低2到3个数量级。

L2代理运行在先进模型上,但由于只处理已被标记的轨迹,其寻找原因的时间和花费远低于对哪怕1%轨迹进行评分。在复杂代理的测试中,处理100万条轨迹时,该方法比采样评测便宜5倍。随着代理变得更可靠,可靠性成本也会随之下降。

为什么重要

当前AI代理在生产环境中的可靠性问题日益突出,而传统采样评测可能遗漏长尾故障。Tessary尝试用分层过滤的方式兼顾覆盖范围与成本,其开源和可自托管特性意味着用户无需将轨迹数据发送给第三方。项目支持现有的gen_ai规范,并可通过OTLP接入,用户能将其作为新的导出器添加到现有配置中。

此外,该项目提供云版本,用户可用10美元额度快速试用功能。团队表示希望构建更多分类器,并让用户能够根据自身需求定制分类器,同时欢迎社区反馈常见的故障模式。

背景补充

Tessary在GitHub上开源,同时提供官方网站和免费试用入口。该项目获得了Hacker News上的关注,发布时显示1个点数,尚无评论。

来源:Show HN: Tessary – Find the AI agent failures your sampled e…(发布于 2026-10-10)