中国日报8月11日电 当大模型具备对话、推理、编程与工具调用能力后,自主研究被视为AI的“Next Big Thing”。其核心意义在于AI发展不在受限于人类知识边界,形成“投入能源转化智力”的新Scaling Law。自主研究的真正难题并非搜索不足,而是智能体能否明确当前答案已成立什么、欠缺什么,以及下一步最该研究什么,从而在复杂约束中持续逼近正确答案。
智源研究院发布的AREX正是围绕此问题提出。它抓住“发现—验证不对称性”这一关键突破口:完整答案难以一次生成,但候选解一旦形成,即可通过逐项约束验证快速定位不足、指导后续探索。这一思想与Jeff Dean提出的Discovery Loop理念相呼应——未来AI需通过持续实验、反馈与修正形成自主发现能力。
为了验证AREX是否具备真实自主研究能力,智源研究院在六个基准上进行了评测,包括:BrowseComp、DeepSearchQA、WideSearch-en、GAIA、xbench-2510 和HLE with tools。它们分别覆盖信息深度、信息广度、深度与广度结合,以及端到端 Agent能力。AREX-Base以10B激活参数在多项指标上达到或超越部分闭源旗舰,展现均衡综合竞争力。
AREX LLMs解决的是智能体如何开展长期、可靠的自主研究,而AREX Research Platform在此基础上,将这一能力封装为面向科研与产业用户的日常研究工具。
AREX平台以模型驱动的内容获取与研究智能体为核心,提供资讯追踪、论文筛选、播客提取三类入口,三者均由AREX智能体驱动,既支持广域浏览,也支持针对细分方向的定制化配置。未来,AREX将延伸至研究执行阶段,涵盖方案设计、工程实现与性能调优,最终实现用户定义问题、AREX自主完成探索实验并交付可验证结果。