ALL HERE INDUSTRY INSIGHTS
行业咨询
来自一手发布、开源社区与论文平台的前沿动态。
Faster-WAM 解读|世界动作模型需要那么深的动作头吗?
Faster-WAM 解读|世界动作模型需要那么深的动作头吗? 做机器人动作预测经常碰上一个问题:推理延迟。模型在仿真里精度看着还行,一上真机,延迟一大,整个控制循环就跟不上了。动
发布日期:
阅读全文 →「冰上国际象棋」终于被 AI 盯上了:强化学习自学冰壶战术
Curling 常被叫做「Chess on Ice」,冰上国际象棋。但这么多年,AI 把国际象棋、围棋、星际争霸都扫了一遍,冰壶这块几乎没人认真碰过。 上周 arXiv 挂出来一篇
发布日期:
阅读全文 →扩散草稿的「各自为政」问题,被并行精炼治了——xPress 让 Qwen3-8B 推理提速 1.3 倍
做推理加速的人,这两年大多在盯 speculative decoding。拿一个小模型快速吐草稿,大模型一次验证一批,省掉逐 token 自回归的串行开销。问题落在草稿质量上——草
发布日期:
阅读全文 →Shortcut Hacking:当大模型靠"蒙"混过科学Benchmark,最高37.4%的正确答案是假的
前几天刷到一篇新论文,标题很直白—— Right Answer, Wrong Method ,答案对了,方法错了。读完后我第一反应不是"又一篇 benchmark 批评",而是想起
发布日期:
阅读全文 →Agent评测结果,不用全跑完也能下判断
搞 Agent 评测的人应该都有过这种体验:挂上一个 benchmark,让它慢慢跑,时不时切过去瞄一眼进度条。跑了几百个 case 之后胜负已经很清楚了,但还得等剩下那几百个跑完
发布日期:
阅读全文 →一篇新论文把 LTL 转进了 LTLf+,搞规划的人可以少跟无限自动机较劲了
搞过 RL 或规划的大概都跟 LTL(线性时态逻辑)打过照面。它是 AI 领域最常用的时序规约语言之一,reactive synthesis、MDP 上的随机规划、带约束的强化学习
发布日期:
阅读全文 →不确定环境里只能备几套策略?这篇论文给出了精确解法
做 AI 决策系统的人,迟早会撞上同一个问题:上线后遇到什么环境,根本没法提前预料。 这比"不知道明天天气"更底层——状态怎么转移、奖励怎么给,连模型本身都是一个未知数。机器人今天
发布日期:
阅读全文 →Cross-Session 攻击正在绕过所有 AI 安全防线,Magnet 这篇论文想堵上这个洞
Magnet: Detecting Cross-Session AI Misuse Through Capability Accumulation 今天在 arXiv 上刷到一篇
发布日期:
阅读全文 →五个缺口:那篇让 Agent 开发者扎心的论文
Agent 系统五个认知缺口 上周四凌晨 arXiv 上来了一篇不怎么起眼的 survey,标题叫「A Taxonomy of Cognitive Capability Gaps
发布日期:
阅读全文 →Zero-Mem:LLM Agent 的记忆模块终于可以不烧 token 了
做 Agent 时绕不开一个矛盾:记忆模块越做越重,但每次读写都要额外调一次 LLM。写一条记忆要 token,读一条记忆也要 token,检索完再拼进上下文又是一轮。一个跑了几十
发布日期:
阅读全文 →奖励模型终于不用「二选一」了:LatentRM 用隐变量把推理和打分焊在了一起
做 RLHF 的人大概见过这种场景:scalar reward model 在简单对话数据上跑得好好的,一换到复杂推理任务上就翻车——给了一堆高分,但仔细看都是靠表面套路蒙混过关。
发布日期:
阅读全文 →Qwen2.5-7B 零样本读难民口述,比分词和 Embedding 更接近人的判断
SIGDIAL 2026 上有一篇论文,任务很具体但问题很底层:让模型判断两段移民叙述是否在讲同一种经历。它在检测「经验的互文性」(Experiential Intertextua
发布日期:
阅读全文 →GPT-5.5 在长对话里只拿 41 分——新 Benchmark 把大模型的「多轮健忘症」量化了
跟 AI 助手聊到二三十轮之后,很多人都会遇到这种事:模型忘了开头交代的约束,把前几轮提到的东西张冠李戴,或者还没等用户说「好」就自己把事情办了。不是偶然翻车,这是当前大模型在长程
发布日期:
阅读全文 →