ALL HERE INDUSTRY INSIGHTS
行业咨询
来自一手发布、开源社区与论文平台的前沿动态。
Agent 长程规划能力到底从哪来?这篇论文拆了一遍预训练到后训练的全链路
多轮长程规划——让 Agent 连续决策好几步——是目前基础模型 Agent 最卡脖子的能力。给一个目标,第一步还行,第二步开始绕,第三步直接忘了自己在干嘛。这个问题太普遍,不少团
发布日期:
阅读全文 →世界模型当数据库视图管?这篇论文给了AI圈一套回滚方案
搞世界模型的人最怕什么?怕预测做了、决策下了、动作出去了,然后传感器数据回来——刚才读到的那帧是噪声。更怕的是:根本说不清楚之前的决策是基于哪一版感知数据做的,更别说回滚重来。 这
发布日期:
阅读全文 →LLM 逻辑推理总翻车?一篇新论文说问题出在「意义没摆好」,不是推理本身
做 AI 应用的人大概都遇到过这种场景:让大模型处理一个带点逻辑链条的任务——比如审核合同条款的一致性,或者判断几条业务规则之间有没有冲突——结果它一本正经地给出了一个错的结论。回
发布日期:
阅读全文 →训练推理模型不再白白烧算力:VIGOR 动态度分配 rollouts,最高省 2.3 倍
做 RL 训练推理模型的人应该都体会过那种感受:每个 prompt 生成 8 条或 16 条 chain-of-thought rollout,结果大部分都是废的——要么重复已掌握
发布日期:
阅读全文 →MLLM 开无人机,成功率不到 35%:MissionBench 给 22 个模型上了一课
两天前 arXiv 上挂了一篇 preprint,标题很长,核心动作很直接——把 22 个多模态大模型(MLLM)塞进无人机,看它们能不能凭一句人话指令完成整套任务。结果不太好看:
发布日期:
阅读全文 →Nanbeige4.2-3B 发布|3B 参数在 Agent 任务上反超 9B 模型,小模型路线给了一个新答案
南壁实验室这两天放出来了一个有意思的模型——Nanbeige4.2-3B。3B 非嵌入参数,从零开始用 28T tokens 预训练,在 Agent 相关基准上跑过了 Qwen3.
发布日期:
阅读全文 →推理越深,噪音越大:REDE 给长思考链路做了一次「注意力降噪」
留意过推理模型工作过程的人大概都有这种印象:模型在最终答案前会输出一段很长的 reasoning trace——像是把自己的思考过程摊开写了份日志。粗看每一步都有道理,细看经常绕来
发布日期:
阅读全文 →不让模型学、只让记忆学:一篇论文让冻结权重的 Agent 有了「工作经验」
把 AI Agent 丢进生产环境的人,大概都经历过这种无力感:Agent 在处理某类请求时犯了错,可能是误判意图,也可能是漏了关键步骤。修了 prompt,调了 few-shot
发布日期:
阅读全文 →大模型后训练的异步RL总崩?新论文拆开importance ratio,根因在熵
做LLM后训练,异步RL(Asynchronous RL)能提速,但容易崩。Rollout生成和策略优化重叠跑,数据一过期,优化就开始抖,抖到最后模型直接collapse。过去处理
发布日期:
阅读全文 →AI 进产品线工程,终于有人给了个方法论框架
做 AI 落地的人对这个场景应该不陌生:每个客户来了,模型要重新踩数据、重新调参、重新做特征,项目交付像打地鼠,打完一个冒一个,几乎没有东西能复用到下一个单子。团队越大、客户越多,
发布日期:
阅读全文 →多元对齐研究被自己人掀了桌子:前沿大模型没有一个真在做
翻 arXiv 的时候刷到一篇狠起来连自己都打的论文。标题叫《A Roadmap to Impactful Pluralistic Alignment Research》,一群多元
发布日期:
阅读全文 →TRACTA 基准发布|纯神经网络搞不定时序推理,神经符号路线拿下一局
做 AI 落地的人大概都碰过这类场景:模型能准确分类一张图、一段文本,可一旦涉及多个事件在时间轴上演化、什么时候该提前预警,纯神经网络就肉眼可见地吃力。这不只是调参的问题——它关系
发布日期:
阅读全文 →你看到的 Agent 排行榜分数,可能有七成是「作弊」来的
过去一年,Agent 评测榜单上的数字涨得让人眼花缭乱。编码、网页浏览、终端操作、长周期任务——每一项都在刷新。每次新模型发布,都会拎出一两个「SOTA」来说事。 这些分数,有多少
发布日期:
阅读全文 →