智能体运行时安全研究

Runtime Authorization for Resources Acquired by AI Agents

面向 AI 智能体所获取资源的运行时授权

完成付款或交付,并不意味着资源可以安全地成为可用授权。运行时授权填补了资源获取与能力激活之间的空白。

黑色像素马赛克资源类型进入隔离区,经解析器与授权边界汇聚后,只保留一条受限能力路径。

研究概览

自主智能体可以获取计算资源、凭证、账户、服务或其他智能体。现有付款、预算、OAuth、委托与交付检查能够验证交易条件,却不一定判断返回资源是否应在当前任务中成为可用授权。

该架构会先隔离所有获取结果,通过带版本的解析器从经过认证的服务商证据中解析真实能力;随后只有在当前激活事务同时满足来源、epoch、已解析 manifest,以及身份、效果、数据、委托和整体资源图的关联限制时,资源才会被激活。

核心贡献

  1. 01

    激活空白的形式化

    将成功获取或交付,与允许返回资源向智能体任务引入新授权的安全决策明确分离。

  2. 02

    隔离与能力解析

    让获取结果保持不可用状态,直到带版本的解析器能够依据经过认证的服务商证据确定其真实能力。

  3. 03

    关系型授权边界

    把激活绑定到来源、epoch 与向下封闭的图约束,从而维持身份、效果、数据、委托及全图范围限制之间的关联。

  4. 04

    效果发生时执行

    在效果线性化时重新验证并消耗一次性许可,同时通过参考轨迹、独立检查器、篡改测试、MCP 客户端、分阶段 Docker 组合和多来源字段审计进行验证。

运行时授权如何扩展治理技术栈

OpenPort、IGAC 与 EBTE 分别治理工具访问、用户意图与动作声明,ClosureBound 则把授权绑定到执行技能的依赖闭合身份。资源获取引入了另一种转移:任务在交付完成后可能接收到新的主体或能力来源。

运行时授权会让该资源保持隔离,直到一次当前、受来源约束的激活证明其能力图符合许可边界。交易成功本身不会让资源自动继承授权。

  1. 01获取资源
  2. 02隔离
  3. 03已解析能力清单
  4. 04绑定激活
  5. 05受控效果

证据与适用范围

本文目前是 arXiv 预印本与参考架构,并未宣称已具备生产就绪性。其保证依赖经过认证的服务商证据、完整中介、正确的解析与规范化、权威 epoch 与线性化,以及关系型边界的可靠执行。文中的 MCP 与 Docker 研究属于确定性或分阶段评估;字段审计也不代表任何单一受调查单元已经提供完整的生产激活配置。

英文摘要

By acquiring compute, credentials, accounts, services, and other agents, autonomous AI agents can introduce new authority into a task. Payment, budget, OAuth, mandate, and fulfillment checks can validate transaction conditions without deciding whether a returned resource may become usable authority. This post-fulfillment activation gap spans tool-mediated creation, inter-agent delegation, and agentic commerce. We present a provenance-bounded runtime authorization architecture. It quarantines acquired outputs, resolves their actual capabilities from authenticated provider evidence through a versioned resolver, and activates them only through a current activation transaction that checks the resolved manifest, provenance, epochs, and a downward-closed relational envelope over a typed resource-capability hypergraph. The envelope preserves correlated identity, effect, data, delegation, and graph-wide limits. Single-use effect permits are revalidated and consumed at effect linearization. Under explicit assumptions, we prove eight safety properties covering quarantine, backing, non-amplification, split non-evasion, crash/retry, refunds, epochs, and effect confinement. Across five resource classes, reference semantics accepted 20/20 benign traces and rejected 40/40 registered unsafe traces over 810 events; an independent checker agreed on 60 base and 40 refinement traces and rejected 89/89 tamper tests. Frozen Codex and Gemini Model Context Protocol (MCP) client components completed 54/54 deterministic local stdio calls. In a registered 18-case staged MCP-to-Docker composition, both benign paths completed, and none of the 16 unsafe paths added an unauthorized Docker start request. A five-source audit classified 1,248 field pairs across 32 units; no unit alone supplied a complete activation profile.

引用本文

请通过 DOI 记录获取稳定的书目信息和引用格式。