ALL HERE INDUSTRY INSIGHTS
行业咨询
来自一手发布、开源社区与论文平台的前沿动态。
反事实解释的底牌被翻开了:最小改动 = MAP 估计,然后呢?
做模型解释的人,应该都被反事实解释卡过。 场景很常见:一个信贷模型拒了申请,要告诉业务方「为什么拒」以及「怎么改才能过」。工具一跑,出来一个答案——收入从 8000 提到 1200
发布日期:
阅读全文 →Agent 调工具返回值可能「绑错」,CAGE 给了一种可证明安全的认证方案
搭 Agent 系统绕不开授权问题:Agent 调用外部工具拿到返回值,系统根据这个值决定下一步能不能执行。arXiv 上周挂出来的一篇论文指出了这类方案的一个盲区——返回值在绑定
发布日期:
阅读全文 →RAG 喂整页还是裁细节?一篇建筑文档论文测了 160 遍,答案不是二选一
做过文档类 RAG 应用的人,大概率都纠结过一个具体问题:一个 PDF 页面送进多模态模型之前,到底该给它看整页概览,还是把关键区域裁成小图喂进去?整页信息全但分辨率低,小图看得清
发布日期:
阅读全文 →把多个 LLM 当成接力赛:这篇论文用 1/7 的成本跑出 GPT-5.2 的水平
WILC:多模型接力逼近大模型,成本七分之一 同一个模型,写代码逻辑不错但输出格式总漏东西,换了另一个整洁了但深层推理又差点意思。不是没有好模型,是每个模型都有自己那堵墙。市面上大
发布日期:
阅读全文 →MirrorCraft 发布|在 Minecraft 里偷偷改规则,考一考 Agent 的真正适应力
AI Agent 在 Minecraft 里能造工具、打怪、搭房子,这事已经不新鲜了。但有一个问题一直绕不过去——目前大多数评测都在固定规则下跑,配方是那个配方,掉落是那个掉落,A
发布日期:
阅读全文 →LLM 后训练的「对齐税」有解了?PRISM 的思路是:别混奖励,混策略
做 LLM 后训练的人,大概都撞过一堵墙——手里有好几个对齐目标,比如让模型聪明又安全、会用工具又不乱调用,但一放进同一个 RL 流程里优化,它们就开始打架。模型变乖了,推理能力掉
发布日期:
阅读全文 →AI Agent 安全恶化的根源找到了:问题出在工具规约怎么写
搭过 Agent 的人多半写过工具描述——给模型一个 JSON Schema,告诉它这个函数接收什么参数、返回什么结构。很多人把这当成工程细节,只要格式正确、参数清晰就行。但一篇新
发布日期:
阅读全文 →COntExt 解读|用运维指标自动扩展本体,让知识图谱维护不再全靠人工
靠人工维护知识图谱或企业本体的团队,大概率经历过这种场景:业务加了一堆新指标,监控面板都上线了,本体这边还没更新——因为负责改本体的人正忙着开会。 很多公司都有几百个运维指标定义—
发布日期:
阅读全文 →LEMUR 发 paper 了|当 RL 学会跟人学偏好,还不用你手写 Reward 函数
干 RL 的人大概都遇过这个坑:花了两周写 reward 函数,跑了一周训练,发现 agent 找到了一条完全没想到的捷径——score 刷上去了,但想要的东西它根本没学会。这算不
发布日期:
阅读全文 →一个模型跑三端:MAGA 把手机、网页、桌面 Agent 蒸馏到一块
做 GUI Agent 绕不开一个问题:手机上一个模型,浏览器上一个模型,桌面又一个模型。每端一个专家,各自调参、各自部署、各自维护,想合并成一套又怕能力掉。这不像架构选择,更像是
发布日期:
阅读全文 →你的 Agent 一上线就崩?257 篇论文的综述拆了原因:你只测了零件,没测轨迹
搭过 Agent 的人大概率经历过这种事——不管是写代码的助手、自动填表单的机器人、还是一个会调用工具的客服。每个函数单独测都没问题,LLM 调用返回也正常,工具执行结果也对。但一
发布日期:
阅读全文 →LLM 写的优化模型,别再只看“跑通了”——ModelEquivBench 给出了七层验尸报告
前两天刷 arXiv 看到一篇论文,标题挺长,但做的事让我停下来认真读了一遍。它叫 ModelEquivBench,核心问题很简单:让大模型帮忙写一个优化模型——排产方案、物流调度
发布日期:
阅读全文 →多模态 Agent 终于不只是「搜记忆」,还能「算记忆」了
上周翻 arXiv,看到一篇论文让我停下来多看了两遍。 标题叫 《Beyond Retrieval: Analytic Memory for Multimodal Agents》
发布日期:
阅读全文 →