在 Hacker News 上,来自 Archestra 的 Matvey 介绍了新项目 OpenAPPA。该项目试图解决企业级 AI 智能体在连接大量工具后容易失控并泄露敏感数据的问题,同时避免传统护栏方案对智能体功能的破坏。

发生了什么

据作者描述,当前护栏方案分为两类,但都存在明显缺陷。一类是非确定性护栏,例如使用 LLM 作为评判者或自动模式,它们容易受到提示注入攻击,或因为缺乏对数据的了解而效率低下。作者称在其基准测试中,这类方案的数据泄露率约为 10%。

另一类是现有的确定性护栏,如 Cedar、OPA、FIDES、Dogwood。这些方案需要大量针对具体用例的 IF-ELSE 式策略,且会破坏智能体的正常运行。作者表示,在其基准测试中,这类方案导致约 59% 的效用损失。

OpenAPPA 的做法是构建一种数据特异性而非用例特异性的策略语言。这种语言允许智能体在无需更新策略的情况下扩展。此外,项目还加入了补救计划、DualLLM 模式等机制,帮助智能体在限制内运行。作者称,这些改进将效用从约 40% 提升至约 90%,并称其为首个不破坏智能体的确定性护栏。

为什么重要

随着企业越来越多地将 AI 智能体接入内部工具和数据源,安全与可用性之间的平衡成为关键挑战。OpenAPPA 声称提供了一种可插拔到任意智能体循环的方案,通过工具调用前后的钩子实现集成,这可能为智能体的大规模部署提供新的安全路径。

该项目已在 CodeBuddy Code 中开放体验,并提供了学术论文供查阅。作者邀请社区反馈,相关讨论已在 Hacker News 上展开。

来源:Show HN: OpenAPPA – deterministic AI guardrails that don't b…(发布于 2026-09-28)