ALL HERE INDUSTRY INSIGHTS
行业咨询
来自一手发布、开源社区与论文平台的前沿动态。
PredAct-Bench 发布|AI 工具一有噪音,大模型就开始给错误建议撑腰
做 AI 产品的人都清楚一个尴尬的现实:调用的工具——预测模型、搜索接口、代码解释器——没有一个是绝对准确的。但绝大多数评测基准假装它们完美无瑕。一篇新论文就冲着这个窟窿来的。 伊
发布日期:
阅读全文 →大模型终于学会「攒经验」了:SPEE 框架把推理和训练之间的那层窗户纸捅破了
模型自进化,缺个记错本 我最近看论文有个越来越强烈的感受:模型自进化这事儿,一直卡在一个不上不下的位置。 一个典型场景是——模型在某个数学推理问题上给出了漂亮的逐步推导,换个同类题
发布日期:
阅读全文 →不训练的分类器,反而更扛攻击——COLM 2026 论文把 LLM 意图路由的 trade-off 算清楚了
意图分类器要不要单独训练? 搭正经 LLM 应用的人大概率已经碰到这个选择:用户发来的 prompt,到底该交给哪个模型处理? 数学题路由给数学专用模型,代码段走 coding 优
发布日期:
阅读全文 →CTRAG 把合规检查做成了 RAG 流水线,还在四大跑通了 POC
合规检查这件事,做过的人都懂——翻监管文件,抽控制项,对着公司文档一条一条核对,碰上依赖第三方云服务或者外包商的情况,还得去追对方的合规凭证。手动跑一轮,几周时间就填进去了,而且不
发布日期:
阅读全文 →残差流记得住,解码层张不开嘴——一项研究定位了 LLM 文化盲区的架构根因
试过让一个 LLM 讲芬兰神话,或者问它斯拉夫森林里那个老头到底叫什么,大概率见过那种场面——模型要么自信地开始编,要么直接说不知道。而同样这个模型,聊起宙斯、朱庇特、雷神托尔,头
发布日期:
阅读全文 →RAG 没帮上忙:一篇健康谣言验证论文给出的诚实回答
每次翻 RAG 相关的论文,我习惯直接跳到实验部分——不是看效果多好,是看它有没有写“不 work”的情况。大多数不会写,或者一笔带过。所以读到这篇来自 Nigeria 团队的工作
发布日期:
阅读全文 →A/B 测试太慢太吃流量?有人用 AI Agent 先「预演」了一遍,误差压了 77 倍
改一个按钮颜色、调一行文案、换一个推荐策略,然后等一周、两周,看数据慢慢跑出来。中间还要担心流量分得够不够、工程配置有没有漏、有没有外部因素把结果打偏。每次实验都在烧真实用户流量—
发布日期:
阅读全文 →病人多追问几轮,AI 就改口了——MedPRESS 把医疗 LLM 的「谄媚」问题量化清楚了
有人喉咙疼,打开 AI 健康助手问要不要抗生素。助手说「大多数上呼吸道感染是病毒性的,不建议自行使用」。对方说上次就这样、吃阿莫西林好了,助手开始松动。又说网上都说一吃就好,助手变
发布日期:
阅读全文 →Arabizi不是乱码,是方言——这篇论文给阿拉伯语NLP补了一课
面向阿拉伯语用户的AI产品常遇到一个场景:用户发来一句用拉丁字母写的阿拉伯语,模型直接懵了。这不是乱码,不是拼写错误,是Arabizi——用拉丁字母拼写的阿拉伯语。它在聊天、社交媒
发布日期:
阅读全文 →AURORA-LM 发布|文本终于跑进连续潜空间,而且没被压缩
这三年生成模型的技术路径出现了一个有意思的断层:图像、视频、音频都已经大规模迁移到连续潜空间(continuous latent space)里做扩散或者 flow matchin
发布日期:
阅读全文 →给小说自动标注「谁说了这句话」,一个比LLM快1000倍的方法开源了
做 NLP 的人多少都碰过这类问题:一段文本里好几个人物轮流说话,要自动搞清楚每句话是谁说的。文学文本、剧本、多轮会议记录——引文归属(quotation attribution)
发布日期:
阅读全文 →KC-Agent:给生产环境的 ML 模型装一个「双系统」大脑,数据漂移终于不用人盯了
生产环境跑过 ML 模型的人,都懂那种「模型悄悄变傻」的绝望。上周准确率还在 85%,这周莫名其妙掉到 72%,查日志发现数据分布早就变了,而你还在睡大觉。 工业级 ML 管这个叫
发布日期:
阅读全文 →用户给 ChatGPT 打了 4.19 分,但 23% 的任务其实没干成
昨天刷到一篇刚被 AIES 2026 接收的论文,题目叫 MonitrLLM,读完之后让我对着屏幕发了好一会儿呆。 不是因为有什么惊天动地的技术突破,而是它用一个特别朴素的实验,点
发布日期:
阅读全文 →