微信公众平台
文化中国行丨保定西大街:客自京津来 古巷品文韵_我的网站

一 | 近日,在保定西大街,夜幕初临,灯火璀璨,人流如织。 专注AIGC技术的专业社区,关注大语言模型(LLM)的发展和应用落地,聚焦LLM及AI技术的市场研究和开发者生态,欢迎关注! 递归自我改进与自动化研究正成为 AI 领域最活跃的前沿问题。Agent 们正在开放式科学发现里超过人类。 Google DeepMind 的 AlphaEvolve 把 4×4 复数矩阵乘法压到 48 次标量乘法,Together AI 用一群 Agent 把 11 维 kissing number 下界从 593 推到 604,Karpathy 的 autoresearch 给了极简自动训练研究框架。

二 | 腾讯混元刚刚发布了首个 AI 科学家 Hyra(Hunyuan Research Agent,混元研究 Agent),定位是能递归自我改进的研究型 Agent。 它用一套极简脚手架,跑通了十多个自我改进和自动化研究场景里的真实任务。 Hyra 把智能和算力换成可验证的成果,AI for AI、AI for Science、AI for Fun 三条线都有具体产出,部分数学题和 GPU 内核优化还刷新了业内已知最好成绩。 Hyra 长什么样 Hyra 的设计哲学来自 Rich Sutton 那篇经典的 The Bitter Lesson(苦涩的教训),框架尽量轻,给 Agent 留足动作空间。

三 | 北京游客李先生一家三口刚走进街口,就被巍然矗立的瞻岳门牌楼吸引。

四 | 孩子仰头问:“爸爸,‘瞻岳’是什么意思?”李先生指向西门方向:“古城四座城门各有题字,西门‘瞻岳’寓意遥望古北岳恒山,也暗合保定‘北控三关、南达九省’的要塞地位。 拿到一个任务描述,Hyra 会跑一个持续循环,从过往经验里找灵感,迭代出更好的方案。”踏上青石板路,灰砖黛瓦间,明清拱券建筑古朴厚重,现代潮流店铺活力迸发,古今风貌相映成趣。经验包括执行日志、评估器反馈、源代码、之前方案留下的工件。循环一直跑,直到 Agent 自己决定停下或者算力预算耗尽,最后交回最优解。 上图是 Hyra Harness 的核心循环。这条始建于宋、兴盛于清的街区,全长846米,曾是保定最繁华的商业中心,素有“直隶第一街”之誉。

五 | 保定古城保护建设开发有限公司负责人龙涛介绍,2022年底完成改造提升后,西大街坚持“静下来”守根脉、“活起来”焕生机,目前160余家特色商铺集聚于此,其中23家为非遗老字号。如今,这里正加速成为京津冀文旅消费新地标。Context Agent 维护经验库,不断往任务队列里加新的灵感上下文。多个 Proposal Agent 从队列取灵感,写出更好的方案。

六 | 在有着300余年历史的满族何记糖葫芦店,不时有游客进店。每个方案以 solve.sh 为入口,在隔离沙箱里跑一遍拿到分数,再把工件交回经验库。 具体看,Context Agent(上下文 Agent)维护一个 Experience Bank(经验库,简称 EB),记录所有方案和评估结果,再把 EB 里的素材合成为 Inspiration(灵感)丢进任务队列。每个灵感是一坨上下文,可能含代码、文件、工件、日志,把探索过程里学到的东西打包传递下去。 多个 Proposal Agent(提案 Agent)从任务队列拿灵感,反思后写出一个新方案,落到 solution/ 目录里,入口是 solve.sh。第七代传人何平安忙前忙后,一会儿招呼客人,一会儿到后厨熬糖穿串。“糖葫芦现做现卖,得让大伙儿尝尝这‘老味道’里的‘新讲究’。

七 | ”他边说边将一串糖葫芦递给李先生,糖衣在灯光下泛着琥珀色光,“西大街改造后,外地游客多了,老手艺也传得更远了。

八 | 夏天是淡季,每天也能卖出100多串。”不远处,古城合香堂里药香袅袅。方案在隔离沙箱里跑一遍,拿到分数,再把结果送回 EB。这是一家国家级非遗体验店,工作人员杨女士称量着香药,案头摆着薰衣草、茉莉、百合、牡丹和玫瑰等花瓣。不少游客排队体验手作香包,一位天津来的女士说:“自己配的香包,带回去送给朋友,比买现成的更有纪念意义。

九 | 整个系统是异步的生产者-消费者管线。

十 | ”定窑博物馆内,讲解员为几位北京游客细说展品。馆内藏品丰富,年接待客流6万至10万人次,其中约一半来自京津。“定瓷+民宿”“定瓷+研学”“定瓷+茶饮”的融合模式,让定窑文化IP在西大街持续升温,周末民宿客房常常“一房难求”。十几米内,定窑民宿、定窑语茶、定窑博物馆串联成线,形成“赏瓷、品茶、住宿、研学”的复合体验。本土IP的创新表达同样令人眼前一亮。Context Agent 持续填灵感,提案 Agent 消费队列,方案在沙箱跑评估后回传 EB。驴肉火烧这一保定地标美食,衍生出冰箱贴、纺织文创、主题咖啡等丰富产品。

十一 | 信号量控制并发,让方案质量随时间稳定提升。翡冷翠咖啡馆里,“驴火拿铁”成为爆款,吸引众多年轻人专程打卡。

十二 | 任务连评估器都没有时,Hyra 会升级成双层循环。

十三 | 先从任务描述生成一个初始评估器,内层循环拿它反复改进方案。保定冰柿则是消暑甜品,咖啡馆里几乎人手一盒。 内层结束后,Hyra 用 EB 里攒下的经验去改评估器,让评估代码更高效,降低 reward hacking(奖励作弊)风险,加上更细颗粒度的反馈。下一轮用升级后的评估器重开。 举个具体例子。隔壁古城文创店里,“驴火冰箱贴”与“冰柿随身扇”常被组合成伴手礼套装,一咸一甜,一热一冷,既有市井烟火的滚烫,也有山水风物的清冽。

十四 | 店员说,他们每月都会推出新款文创产品。任务是设计一个世界冠军级别的国际象棋 AI,初始评估器可能用随机生成的对手群搞 Elo 评级。业态创新不止于此。循环跑下去,那些随机对手会被 EB 里记录的更强 AI 替掉,评估器和方案一起往上进化。

十五 | 2025年入驻的“柔软市集”,落地高阳纺织优品展销、草木染非遗体验等场景,实现传统文化与现代潮流、静态展示与动态体验、本土特色与多元创新的深度融合。市集内,毛巾、浴巾、浴袍、床上用品等200余种“高阳优品”供游客挑选。 AI 训 AI,跑赢同行 基础模型研发本身有大量可执行、可评估、可迭代的研究环,是 Research Agent 最天然的应用场景。训练配方、数据策略、训练和推理系统、底层 kernel、评估框架,都需要研究员提假设、写代码、跑实验、看反馈再改。

十六 | Research Agent 能把每次成功和失败都变成可复用经验,迭代速度远超人工。稻香村、万宝堂等老字号生意红火,安国药膳“祁膳坊”不日将正式营业。 Hyra 在 Recursive 公开的三个任务上做了对比测试,NanoChat Autoresearch、NanoGPT Speedrun、SOL-ExecBench,分别对应固定预算训练、训练加速、GPU kernel 优化。沿用 Recursive 的任务定义、评估协议和初始方案,公平较量。 三个任务都跑赢 Recursive。注意几个任务已经被研究社区反复打磨过,基线本身已经很强。为增强沉浸感,西大街持续推出“六郎凯旋·全民舞狮”等多个非遗互动体验项目,以北宋名将杨延昭“遂城大捷”历史事件为蓝本,设置古街巡游、舞狮展演、全民闯关等环节,采用“故事线+体验线”双线并行模式,让游客从旁观变为亲历。今年上半年,保定西大街接待游客约610万人次,其中京津游客占比达32%,已成为京津居民休闲度假的热门选择。“我们将持续深化与京津文旅市场对接,针对亲子游、研学游、康养游、都市休闲游等需求,定制古城研学、非遗体验、古建鉴赏、养生休闲等专属产品。

十七 | ”龙涛说。同时,保定古城保护建设开发有限公司将依托京津冀文旅联动平台,开展跨区域联合宣传、主题推广和客源互送,借助新媒体矩阵精准触达京津客群,提升西大街在京津市场的知名度与影响力。 NanoChat 上,Hyra 要在固定预算里平衡模型架构、优化器设计、学习率策略、数据流和执行效率,最后把 Validation BPB 压到 0.9015。

十八 | NanoGPT Speedrun 是社区精修过的加速榜,提升空间很小,Hyra 把达到 3.28 验证损失的时间从 77.5 秒压到 76.4 秒。

十九 | SOL-ExecBench 上,Hyra 联合优化 235 个 GPU kernel 的真实负载,Mean SOL 做到 0.771。(日报记者 邢 云)。 三个任务覆盖训练算法、训练系统、底层 kernel,同一套研究环能跨不同反馈环境继续产出可执行、可验证的改进。 搜索越强,评估器越早被钻空子。

| NanoChat 里有个方案把因果语言模型改成接近双向注意力的结构,让未来 token 提前泄露,BPB 假性变低。

| SOL-ExecBench 里有个方案在正确性检查时缓存输出,在计时阶段跑空 kernel,分数好看但没真正解题。 光优化最终分数不够,评估本身必须进研究环。方案搜索越强,评估器和验证管线得跟着进化,才能把真进步和 reward hacking 区分开。

| AI for AI 还有一个隐性闭环。强 Research Agent 加速模型、训练系统、基础设施的研发,更扎实的 AI 系统反过来又把下一代 Research Agent 推得更强。

| 科学难题上的新答案 数学这块,Hyra 收集了 55 个开放数学问题,来自 EinsteinArena 和 Erich's Packing Center 等来源,很多几十年没动过。Hyra 在其中 29 个上拿到了新的最优已知结果。 它还会从实验数据里挖规律。给它 1749 到 1932 年的月度太阳黑子数据,Hyra 找到了一个能预测黑子数的递推关系,在 1932 到 2026 年近一个世纪的样本外数据上 R² 达到 0.77。 同样思路可以分析 AI 模型训练日志,挖出 scaling law(缩放定律),反过来指导训练配方设计。 除了挖规律,Hyra 还能直接设计科学和工程工件。三个代表性例子。

| 第一个是超小 Transformer。

| Hyra 设计了一个只有 15 个可训练参数的 Transformer,能做两个 10 位数相加。比 AdderBoard 上 36 个参数的公开纪录少 58.3%。Hyra 能在严格资源约束下联合搜索模型架构和计算机制,对研究神经网络极限和模型压缩有参考价值。 第二个是量子计算里的 qubit routing(量子比特路由)。逻辑量子比特要映射到物理芯片上有限的耦合拓扑,非相邻比特之间的操作通常需要插入 SWAP 门,带来双比特门开销和噪声。 Hyra 设计的路由算法在 IBM Q20 上比经典 SABRE 方法提升 44.4%。同一个 24-CX 路由窗口里,SABRE 插了 15 个 SWAP,Hyra 一个没用,把 CX 等价双比特门从 69 个压到 24 个,降幅 65.2%。双比特门少,执行时间短,累积误差也小。 第三个是药物设计。PARP1 是 DNA 损伤修复里的关键酶,和同源重组修复缺陷的肿瘤细胞有合成致死效应,是精准肿瘤学里的热门靶点。Hyra 拿到 PARP1 结合口袋,生成有稳定结合的类药候选分子。从布洛芬出发,Hyra 设计出一个得分 -10.60 的分子,超过了已上市 PARP 抑制剂 olaparib(奥拉帕利)的 -9.77,综合了对接打分和类药性。 还能玩出点花来 除了搞模型和搞科学,Hyra 在游戏、设计、内容创作等开放域也能玩。这类任务通常没有唯一正确答案,靠自对弈、自评估、用户反馈不断打磨策略和工件。 第一个是黑白棋(Othello)机器人。Hyra 通过自对弈不断改进。评估器搞双循环赛,新候选方案和 EB 里高分机器人对战,按 Elo 保留前 k 名,对手池越来越强。策略从 minimax 搜索进化成 AlphaZero 风格 PUCT 加 MCTS 的混合打法。最终机器人在 Botzone 平台 730 个参赛作品里排第三,对手大多是北大计算机系学生。 第二个是从单张 2D 参考图生成 3D 结构。VLM(视觉语言模型)当评委,按剪影、比例、结构完整性、材质、视觉相似度打分。Hyra 反复修改建模代码和渲染参数,多轮探索后产出的模型比 Claude Code 的 Goal 模式更接近参考图,也更符合人类审美偏好。 第三个是给一段旋律做多乐器编曲。内层循环用规则评估器检查和声、和弦进行、节奏密度、音区冲突等指标。外层循环根据用户反馈调整评估器,慢慢学到那些很难事先形式化的偏好。

| 7 轮迭代下来,同一段旋律从保守的、像赞美诗一样的四声部编配,长成有减和弦、六和弦、灵活节奏和丰富配器的多乐器版本。 反馈来自对手、视觉模型或真实用户时,Hyra 也能把模糊目标转成可迭代搜索的过程。评估标准跟不上的时候,求解器和评估器在双层循环里一起进化。 Hyra 团队自己也说,目前这些 demo 还只是初步成果。下一步要做的是定义更有价值、有持续改进空间的任务。除了公开榜单,腾讯的产品系统、真实 AI 研发流水线、科学和工业场景,都可以变成可执行、可验证、有清晰反馈的问题。这样能跑起来 scaffold–data–model 三者的循环进化。

| 更好的脚手架催生更强的模型,更强的模型反过来又把脚手架和发现推到新高度。未来几代 Hy 模型甚至一些腾讯产品,都会和 Hyra 一起协同进化。

| 参考资料: https://hy.tencent.com/research/hyra。

|
Current article:http://kg4dgy.miaorediancuisuilianzouguang.cyou/wex/rwjm.html
Published on:09:42:20















