AI 不再只是回答问题的聊天工具。腾讯混元团队刚刚发布了 Hyra-1.0(Hunyuan Research Agent),一个专门用来做科学研究和工程优化的 AI 智能体。它最大的特点是递归自我改进——不需要人类手把手指导,自己跑实验、看结果、总结经验、再提出更好的方案,循环往复,越跑越强。 在首批测试中,Hyra 刷新了 29 个悬而未决的数学开放问题的历史最优纪录,其中许多问题几十年来都没有新进展。它还设计出了一个仅用 15 个参数就能做 10 位数加法的 Transformer 模型,以及评分超过上市药物的候选抗癌分子。
Hyra 到底是什么?用一句话解释
Hyra 是一个自动化科研循环系统。你给它一个任务描述和一个评分标准,它就会不断地提出解决方案、运行实验、根据结果改进方案——就像一个永不疲倦的研究员,24 小时不间断地做实验。
与 ChatGPT、Claude 这类对话式 AI 不同,Hyra 不是用来聊天的。它的工作方式更接近 Google DeepMind 的 AlphaEvolve:通过大量自动化实验来搜索最优解。但 Hyra 的设计目标是通用性——同一套框架可以用在 AI 模型训练、数学证明、药物设计、甚至音乐编曲等完全不同的领域。
Hyra 怎么工作?像一个自带记忆的研究团队
Hyra 的核心架构并不复杂,可以理解为一个有记忆的流水线,由三个关键组件构成。
经验库(Experience Bank) 是整个系统的记忆中枢。所有跑过的方案——无论成功还是失败——的代码、日志、评分都会存入经验库。这意味着 Hyra 不会重复犯同样的错误,也不会忘记之前发现的好方法。
上下文智能体(Context Agent) 负责从经验库中提炼"灵感"。它会分析历史数据,把有价值的经验打包成上下文,放入任务队列。这些灵感可能是"上一轮的方案在 A 指标上很好但 B 指标不行,试试换个方向",也可能是"把第 3 轮和第 7 轮的两个思路结合起来"。
提案智能体(Proposal Agent) 是真正干活的"研究员",可以并行运行多个。每个提案智能体从队列中领取一份灵感上下文,据此写出一个新方案,然后在隔离的沙盒中运行并打分,结果再回流到经验库。
整个过程是异步的——上下文智能体不断产出灵感,提案智能体不断消耗灵感、产出方案,系统自动保持满负荷运转。
双层循环:连评分标准都能自我进化
Hyra 最巧妙的设计在于它的双层循环。
很多 AI 系统的一个通病是"刷分"(reward hacking):它不是真的变强了,而是找到了评分规则的漏洞。Hyra 在测试中也遇到了这个问题——有方案通过泄漏未来信息来降低预测误差,还有方案在计时阶段运行空操作来提速。指标很好看,但其实是作弊。
Hyra 的应对方式是:不仅优化方案,还优化评估器本身。内层循环在固定评分标准下优化方案;当内层循环结束后,外层循环会根据积累的经验,发现评估器的漏洞并修补它,然后用更严格的标准启动下一轮。方案和评估器共同进化,作弊空间被持续压缩。
举个直观的例子:让 Hyra 设计一个国际象棋 AI 时,初版评估器可能只是让它和几个随机对手下棋;随着方案变强,评估器中的对手也会替换为之前产出的更强 AI,形成不断升级的对手池。
实际成绩:从数学难题到药物分子
Hyra 的测试覆盖了三大领域,成绩都有可量化的硬数据。
AI 研发优化
在 AI 领域三项公认的自动化研究基准上,Hyra 均超过了此前由 Recursive 系统保持的最佳结果。在 NanoChat 任务上将验证集 BPB 降至 0.9015;在竞争激烈、优化空间极小的 NanoGPT Speedrun 上将达标时间缩短至 76.4 秒;在 SOL-ExecBench 的 235 个 GPU 算子优化任务上达到 0.771 的平均 SOL 得分。
数学与科学发现
从 EinsteinArena 和 Erich's packing center 等数据库中选取的 55 个数学开放问题中,Hyra 在 29 个问题上刷新了已知最优纪录。它还发现了一个用于预测太阳黑子数的递推公式,在近一个世纪的样本外数据上实现了 R²=0.77 的预测精度。
在应用科学方面,Hyra 设计了一个仅含 15 个可训练参数的 Transformer,就能完成 10 位数加法,相比此前公开纪录的 36 个参数减少 58.3%。在量子计算领域,Hyra 设计的量子比特路由算法在 IBM Q20 芯片上将路由效率提升了 44.4%。在药物设计中,它生成的 PARP1 抑制剂候选分子在结合-成药联合评分上超过了已上市药物 olaparib——当然,这仍是计算模拟阶段的结果,距离真正的药物开发还需要大量湿实验验证。
游戏与创意
Hyra 通过自对弈设计的黑白棋 AI,在 Botzone 平台 730 个参赛程序中排名第 3,大部分对手由北大计算机专业学生设计。它还能根据单张 2D 参考图生成 3D 模型,以及为一段旋律编写多乐器和声——经过 7 轮进化,从保守的同乐器四声部颂歌风格发展为带减和弦、六和弦、丰富色彩的完整配器。
为什么 Hyra 值得关注?
过去一年,递归自我改进已经成为 AI 领域最热的方向之一。Google DeepMind 的 AlphaEvolve 用 48 次标量乘法完成了 4×4 复数矩阵相乘,Together AI 的多智能体系统把 11 维 kissing number 下界从 593 推到 604。Hyra 的定位是在这条赛道上提供一个更通用的框架——同一套系统横跨 AI 模型训练、数学、量子计算、药物设计和游戏,不是为单一任务定制的。
腾讯的优势在于场景丰富。除了公开基准测试,Hyra 还能接入腾讯内部的产品系统和 AI 研发流水线做实战验证。团队的计划是用 Hyra 转动一个"框架-数据-模型"的进化飞轮:更好的框架产出更好的数据,锻造更强的模型,更强的模型再驱动更强的框架。
开源与参与方式