最新消息:关注人工智能 AI赋能新媒体运营

百灵团队联合AReno打通本地智能体强化学习闭环

科技资讯 admin 浏览

蚂蚁ASystem团队开源AReno工具包:单机实现大模型Agentic RL闭环

大模型完成本地部署只是第一步,要让其真正落地业务场景,还需解决规则理解、安全边界和工具调用等核心难题。蚂蚁ASystem团队与开源社区联合维护的本地化大模型后训练工具包AReno,近日与百灵大模型合作推出轻量化后训练实践路径,首次在单机环境中跑通Agentic RL(强化学习)完整闭环。

为验证方案的可复现性,团队选择规则明确、反馈即时的井字棋作为最小验证任务。实验基于DGX Spark硬件,针对总参数7.9B、激活参数仅1.3B的Ling-3.0-tiny模型进行后训练。初期模型虽能理解基本规则,但频繁出现非法动作;团队将任务规则转化为精确Reward反馈,采用GSPO算法训练400步后,模型奖励均值显著提升,输出长度趋于稳定,工具调用与动作选择的合理性和稳定性实现质的飞跃。

AReno工具训练效果对比图

这一探索的核心价值在于验证了透明、可复现的任务适配方法论:精准发现错误、定义可验证反馈、本地训练、同一环境复测。该模式不仅适用于棋类实验,还可平滑迁移至工具调用修复、结构化字段抽取、领域指令遵循及业务流程智能体等真实生产场景。

目前,Ling-3.0-tiny已开源BF16、FP8、INT4等多个版本,开发者可通过Hugging Face或魔搭社区获取,也可访问AReno开源仓库参与共建。