最新消息:关注人工智能 AI赋能新媒体运营

字节跳动与清华AIR联合发布CUDA Agent,用大模型生成超越编译器优化的GPU内核

科技资讯 admin 浏览

字节跳动联合清华发布 CUDA Agent:让 AI 自动写出超越编译器的高性能 GPU 内核

字节跳动 Seed 团队与清华大学智能产业研究院(AIR)近日联合发布了 CUDA Agent,一个基于强化学习训练大语言模型编写高性能 CUDA 内核的智能体系统。该系统旨在解决当前大模型生成 GPU 代码"能跑但不够快"的痛点。

现有前沿模型虽能生成语法正确的 CUDA 代码,实际效率却难以匹敌传统编译器。以 KernelBench 测试为例,Seed1.6 的任务通过率为 74.0%,但运行速度超越 torch.compile 的比例仅 27.2%,平均几何速度甚至落后于编译器。

CUDA Agent 将大模型置于真实 CUDA 开发环境中,集成性能分析工具、正确性校验及安全沙盒,采用近端策略优化(PPO)算法进行 150 步深度训练。结果显示,模型在 250 项任务中的整体通过率提升至 98.8%,其中 96.8% 的生成内核运行速度超过 torch.compile。

目前研究团队已开源 CUDA-Agent-Ops-6K 数据集(含 6000 个样本)、SKILL.md 规范及训练配方,完整模型权重尚未公开。该技术有望应用于 AI 基础设施、大模型推理服务、自动驾驶及量化交易等低延迟敏感场景。