北京首发智能体专项政策:Agentic AI 等术语首次写入政府公文
北京市今日发布《关于加快智能体引领发展的若干措施》,共十条。这份政策文件将 Agentic AI、Harness Engineering、AI OS、FDE、OPC、Token 经济、TaaS、AaaS、RaaS、Token 工厂、AIP 等此前仅见于论文和技术社区的概念,首次纳入正式公文。
基础模型:从刷榜到实战
政策第一条要求"持续提升大模型实际任务完成能力"。文件指出,Agent 执行时往往只获得模糊目标,需自主补齐信息、拆解计划、调用工具、读取反馈、修正路线。一个关键数据是:若 Agent 连续执行100步、每步正确率99%,全部做对的概率仅约36.6%;即便单步正确率提升至99.9%,完整跑通率也仅约90.5%。
Agent 的实用价值取决于模型能力、长程可靠性、环境可操作性、结果可验证性的乘积,任何一项趋近于零则总价值趋近于零。代码成为 Agent 最早爆发领域的原因在于其高度数字化、可回滚、可验证的特性。
"驾驭层工程"首入政策
第二条将 Harness Engineering 译为"驾驭层工程",要求围绕上下文工程优化、任务持久化、多智能体协作、系统可扩展夯实共性底座。模型只提供潜在能力,能力能否稳定兑现取决于模型外的整套系统——上下文选择、工具调用、任务拆解、权限控制、状态存储、失败重试、结果验证等。
今年4月论文《Agentic Harness Engineering》显示:保持基础模型不变,仅迭代模型外的工具、中间件、长期记忆和可观测系统,十轮后 Terminal-Bench2 的 Pass@1 从69.7%提升至77.0%,换到其他模型家族仍有5.1到10.1个百分点的提升。政策同时点明技能市场、软件商店和 AIP 等互联标准,未来软件的直接用户将变为 Agent,竞争焦点转向如何被 Agent 发现并默认调用。
需求智能与超级软件
第三条鼓励基于智能体重构底层架构,核心是"需求智能"。软件智能分为三层:功能智能仅在节点添加生成能力;流程智能串联固定工作流;需求智能则是用户只描述目标,系统自主判断步骤、调用模型与 Skill、连接软件、寻找审批,对完整结果负责。
与之对应的是"超级软件"——其强处不在于功能更多,而在于跨越原有软件边界、统一理解需求后重组分散能力。政策专设 FDE(前沿部署工程师)角色,进入客户现场与业务方拆解流程、对接系统、清理数据,并将新问题带回产品。文件列出判断标杆场景的五个条件:任务频率、人工成本、数字化程度、结果可验证性、错误可撤销性,科学、医疗、教育、政务、制造、文化被列为重点方向。
终端嵌入与芯模云端用一体
第四条要求将智能体深度嵌入手机、眼镜、耳机、可穿戴、机器人和汽车,推动"芯模云端用五位一体"。终端 Agent 需持续感知环境、理解用户状态、记住长期上下文,在合适时机决策并通过设备执行。端侧负责低延迟感知、身份验证、隐私数据和高频简单任务,云端负责复杂规划与推理,设备间共享任务状态,实现任务跨设备流转。文件将符合条件的新产品纳入家电以旧换新和数码智能产品购新范围。
一人公司:企业边界松动
第五条支持以 OPC(一人公司)为代表的创新创业新模式。政策指出,Agent 同时压低执行成本和协调成本,写代码、做设计、理客户、回咨询、处报表等知识工作可被一个人用多套 Agent 串联,企业最小可行规模随之下降。
政策配套提出弹性算力、专业孵化、创业辅导、科技金融、知识产权、政策咨询、OPC 社区、全周期服务站、供需对接和便利化登记,将过去公司内部的后台能力转为社会公共服务。个人所需三种资产为:行业判断、客户与信任、可复用的 Agent 系统。
Token 经济:从消耗计费到价值计费
第六条聚焦 Token 经济。Agent 执行动态任务,Token 消耗不确定,20亿 Token 一无所获是常态,故能作为成本计量单位却难当价值货币。政策提出 Token 服务质量评估和计费规范,鼓励建立由智能质量、调用量、转化效率组成的评价体系,并写入关键导向——"鼓励创新主体从 Token 消耗量计费转向价值计费"。
三类商业模式对应三个价值层级:TaaS 售卖基础 Token 与推理供给;AaaS 将模型、工具和 Harness 封装成 Agent 售卖能力;RaaS 直接售卖结果。越往上离 Token 越远、离客户价值越近,但 RaaS 难度陡增,供应商需承担任务失败、重复执行、成本波动、质量验收和赔偿责任。文件提出 Agent 公司核心指标应为 Cost per Successful Task(每个成功任务的成本)和 Value per Successful Task(每个成功任务创造的价值),并探索 Token 券和智能体服务券机制。
安全:从内容审核到运行时治理
第七条针对 Agent 安全风险。与聊天机器人仅产出内容不同,Agent 获得行动权,能改代码、调支付、控设备、代用户联络他人,风险从"一句话说错"扩大到"一件事做错"。Agent 安全需同时应对目标理解错误、权限越界、提示词注入操控、长期记忆污染、多 Agent 错误放大等问题,第三方工具和 Skill 的连接使任何插件故障都能沿任务链侵入核心。
文件安全措施从内容审核走向运行时治理,呼应今年5月国家网信办等三部门《智能体规范应用与创新发展实施意见》中仅限本人决策、需授权决策、自主决策的分级分类。政策认为分级分类监管将加速行业发展,低风险任务自测快上,高风险任务严检加人工确认。
算力基础设施与"银河算廊"
第八条实施"银河算廊"工程,建设面向智能体高频并发、低延迟需求的新型算力基础设施,推动算力网络与5G-A、6G、F5G 融合,挖掘存量算力、实现小散算力"零存整取"。训练大模型是集中式大工程,Agent 推理则是长期运行的生产网络,全天候响应海量任务、负载随真实业务剧烈波动,未来需调度 GPU、云边端不同芯片、不同模型、不同地区数据权限与网络条件。
文件支持银行保险机构开发服务智能体落地的金融产品,因 Agent 公司早期核心资产为代码、数据和合同,而新时代最关键的新资产是"任务轨迹"——目标、计划、动作、观察、纠错、结果的完整链条,可用于训练模型、优化 Harness、发现安全漏洞、分析业务流程。
开源开放与出海
第九条提出高水平建设中国与上合组织国家人工智能应用合作中心,研究"一国一策"的大模型和智能体出海路径,建设有全球影响力的开源社区。智能体时代需开源与协议支撑,因 Skill 接入后所有兼容 Agent 均可获得该能力,网络效应极强,协议采纳度决定开发入口与生态话语权。文件专提评价开源贡献度,因开源真正昂贵的是长期维护与社区运营。
保障措施与能力重估
第十条统筹国家和市区财政资金、政府投资基金、市场化基金,对技术攻关、共性平台和示范应用给予支持。政策覆盖科技研发、软件、制造、消费、创业、金融、监管、人才和国际合作等领域。
文件对个体和企业的核心提示在于:大多数职业不会一夜消失,但会被拆分为数十个任务,其中重复、流程化、易验证的部分率先被 Agent 承接;只会完成中间步骤、无法判断结果、无法对最终交付负责者压力将加大。机遇在于任务重新分配与能力重新定价——过去做成公司需资金、团队和复杂管理,现在带着成熟 Agent 系统,有机会从真实小任务开始放大,但 Agent 不会自动带来成功,只会将人的目标、判断、专业和执行系统一并放大。