资讯中心

智能体蜂群实验:新框架性能提升,不同模型组合成本差异巨大!

📅 2026/7/22 23:21:54
智能体蜂群实验:新框架性能提升,不同模型组合成本差异巨大!
Cursor产品导航Cursor提供多种功能与服务包括产品智能体、云端、移动端、自动化、CLI、应用市场、代码审查、企业、定价、资源更新日志、Blog、文档、社区、帮助、工作坊、论坛、招聘等板块还有登录、联系销售和下载等入口。智能体蜂群实验背景与目标今年早些时候开展一系列实验测试扩展智能体协作实现目标的极限假设这能解锁任务规模和复杂度新层级。旗舰项目从零开始构建Web浏览器取得概念验证成功但距成熟软件还有差距。后续目标是理解智能体蜂群以便进行工程化设计为此重新挑战依据SQLite文档用Rust从零构建的任务。实验初步结果让新旧蜂群在相同任务、模型和时间预算下运行衡量通过预留SQL测试套件比例。新蜂群在每种模型配置下表现更优如使用Grok 4.5时四小时内达80%通过率旧蜂群两小时前失控暂停。还调整不同模型工作分配不同组合产出质量相近但成本差异大。树与叶子大型任务描述呈树状结构智能体群围绕此结构组织有规划器智能体和worker智能体两种角色。规划器由最强模型驱动负责拆分目标worker由速度快、成本低的模型驱动负责执行。这种设计优于僵化编排系统能泛化到多样任务还用于内部发现修复漏洞、提升测试覆盖率和生成训练数据等。树如何影响记忆单个智能体承担完整任务时易偏离目标要么失去全局把握要么局部工作变差。而智能体蜂群中规划器和worker分工明确上下文使用更高效其可扩展性或源于上下文效率而非并行性这种结构类似企业层级组织原理。智能体的版本控制系统Git和Cargo等工具的并发控制方式不适用于数百个并发智能体的工作量。今年早些时候浏览器智能体群提交峰值约每小时1000次新系统达每秒约1000次。为此从零构建新的版本控制系统它还能暴露冲突并实现协调机制。每秒1,000次提交下的失效模式人类工程团队的协作机制在智能体群提交速率下会出现失效模式脑裂设计通过提示让规划器自己做决策并避免子树重复决策解决规划器之间的冲突让智能体记录决策在共享文档通过引用传递解决结果合并冲突由中立第三方智能体介入解决超大文件让worker智能体标记外部智能体拆分僵化允许引入破坏性变更并传导更新相关工作。审查视角多智能体系统需审查机制自我纠正错误。试验多种审查视角单一视角无法发现所有问题低相关视角叠加可提高可靠性投入审查的算力回报高。让智能体塑造环境借鉴迹象引导机制让智能体沉淀知识。开展Field Guide实验由智能体自主管理文件夹并注入信息其收益在非完全智能体掌控的代码库中可能更大训练模型为后继者写作值得研究。SQLite实验让新版本智能体群用Rust实现SQLite手册内容不提供源代码等信息以sqllogictest为评分标准。人工审查确保系统均衡构建智能体会自行选择策略整体趋势比具体时刻分数更重要。不同模型组合下的结果测试四种模型配置新框架在每种组合中都优于旧版。Fable 5混合方案首小时通过约三分之二测试集四小时新版运行结果在73% - 85%之间旧版在11% - 77%之间旧版Grok 4.5运行两小时左右暂停所有新版配置最终通过整个测试集。未来希望运行完整N×N矩阵此次重点是不同框架版本对比。深入剖析这些运行对比Grok 4.5在旧框架和新框架下的提交速率、合并冲突数、热点文件大小和Rust crate数量等指标发现旧框架存在无效忙碌、冲突多、文件膨胀和脑裂等问题最终新蜂群代码行数更少且得分更高。模型经济性不同模型组合产出质量相当但成本差异大worker承担大部分token但规划器token成本更高。大型任务中前沿规划器收敛不确定性后低成本模型执行可节省成本。如GPT - 5.5仅worker成本就达9373而Opus 4.8规划、Composer 2.5执行的worker集群成本仅411。Fable 5规划器虽单token价格高但使用token少但其worker消耗token多总成本更高。把规格说明当作提示AI发展提升工程师工作抽象层级智能体蜂群使工作基本单位变为规格说明。要让其可行蜂群需遵循规格说明稀缺的是对意图的准确描述。智能体蜂群类似编译器但每一步是概率性的本文旨在缩小差距。此次solo Opus 4.8 run生成的代码库已公开邀请读者查看并反馈。相关文章包括2026年6月11日用Auto - review管控智能体自主性、2026年6月2日构建云端智能体的经验、2026年5月6日用autoinstall自举Composer等文章信息。产品与资源等信息产品包括智能体、团队版、企业、定价、代码审查等资源有下载、更新日志、文档等公司有招聘、Blog、社区等法律涉及服务条款、隐私政策等还有连接X、LinkedIn、YouTube等渠道。