
没人守着电脑,没人在群里发指令,连报错都不用人工点确认——一台服务器自己跑起来,改代码、调实验、查文献、写证明,卡住了就拉个新Agent来复盘,走偏了就回滚三步重规划。1548小时,相当于连续64天半不关机前三配资公司,中间只喊人帮忙看了27次。这不是科幻片,是微软联合上海交大刚开源的Argus系统干的活。

它解决的不是某道奥数题,而是数学界悬而未决20年的克鲁泽猜想相关核心障碍——注意,不是“辅助人类推导”,而是系统自主提出关键构造、验证反例、迭代修正,并最终输出可被多位国际数学家独立核验的完整论证链。背后没换模型参数,没微调权重,靠的是manager、planner、engineer、reviewer四个角色在持久化状态上反复打擂台:一个提方案,一个拆漏洞,一个写代码,一个举红牌。证据够硬才进记忆库,门控不通过就清零重来。
有意思的是,Argus不靠“目标感”驱动,而靠“证据感”活着。传统Agent像新手司机——设定好目的地就猛踩油门,路一堵就绕远路甚至开进沟里;Argus更像老地质队员,地图模糊、GPS失灵,但它会边走边采样、测岩层、比断面、记异常,发现不对立刻扎营开会。27个研究任务横跨AI训练、芯片设计、GPU内核优化和AI4Math,平均95%以上时间在自主运转。人类真成了副驾:系好安全带,偶尔递瓶水,听见‘需要判断’才伸手拨一下方向盘。
这事儿听着玄乎,但翻开源代码和论文附录就能验证——Argus的每一步推理都带时间戳、证据链和回溯路径。它调用Lean4证明器时不是“黑箱输出”,而是把中间引理怎么拆、哪条公理被反复引用、哪个类型检查失败又如何重构,全存进结构化日志。上海交大团队公开的12个完整任务复现记录里,有7次人类介入其实只花了不到90秒:一次是确认某个拓扑空间定义是否沿用2018年ICM大会修订版,另一次是帮它从arXiv上手动下载了作者已撤稿但尚未被数据库下架的预印本——系统自己识别出该文献被后续三篇论文集体质疑,但不确定是否该彻底排除。这种“拿不准就暂停”的克制,恰恰是它没翻车的关键。
更实在的变化发生在实验室日常里。交大AI Lab的博士生小陈说,以前跑一个GPU内核优化实验,光等编译+测试+分析就得两天;现在把需求喂给Argus,它自己拆解成37个子任务,一边跑压力测试一边读NVIDIA白皮书第4.2节,发现文档里写的寄存器上限和实际芯片有0.3%偏差,立刻反向推导出新约束条件。整个过程没碰CUDA代码一行,却让吞吐量提升了11.6%。这不是“调参侠”的胜利,而是系统真正理解了“硬件限制”和“算法表达”之间的语义鸿沟。
当然,它也有笨的时候。有次为验证一个代数几何猜想,Argus连续生成19版构造方案,全被Lean4驳回。最后发现症结在基础库版本——它默认用的mathlib4.8没包含2023年新增的平坦态射引理。人类研究员点开GitHub更新依赖后,它5分钟内就跑通了。这个“卡点”反而暴露了它的诚实:不硬凑、不幻觉、不假装懂。就像老技工修机器,宁可停机查手册,也不瞎拧螺丝。
目前Argus已接入中科院数学与系统科学研究院的在线验证平台,任何研究者上传命题描述,系统自动生成可交互的论证树前三配资公司,点击任一节点都能展开原始代码、调用日志和专家评审意见。没有PPT,没有汇报稿,只有能跑、能验、能拆解的活证据。它不取代数学家,但它让“灵光一现”之后的枯燥验证,终于有了个不知疲倦的搭档。
文章为作者独立观点,不代表正规配资炒股网站-正规配资平台开户-在线配资开户网站观点