ALL HERE INDUSTRY INSIGHTS
行业咨询
来自一手发布、开源社区与论文平台的前沿动态。
Data Turnstile 开源|给 0.6B 小模型喂函数调用数据,它能干翻 32B
上周 arXiv 上挂出来一篇论文,标题叫 Data Turnstile,看名字像个数据流水线工具。摘要里有两个数字:0.6B 的小模型在函数调用 benchmark 上追平了 4
发布日期:
阅读全文 →CalibratedRubric:131 条评分标准砍到 49 条,LLM 评估反而更准了
刷 arXiv 时看到一篇「CalibratedRubric」,副标题 Task-Adaptive Rubric Banks for Open-Ended LLM Evaluati
发布日期:
阅读全文 →翻译也要「想一想」:ACL 2026 这篇论文让模型学会按难度分配推理量
做翻译的人都有这种体感:翻「今天天气不错」几乎不用过脑子,但碰到一段充满术语的法律条款或者文化梗密集的广告文案,就得停下来查资料,反复斟酌措辞。人类译员天然知道什么时候该快、什么时
发布日期:
阅读全文 →突厥语系翻译迁移,一篇论文摸清了谁跟谁真的「近」
做多语言产品的团队时常面对一种纠结:模型在土耳其语上跑得不错,但用户里还有说哈萨克语、乌兹别克语的,资源又不够每种语言单独训一个,于是押注迁移学习——拿土耳其语的数据微调,指望它自
发布日期:
阅读全文 →只看输出就能还原你的 Prompt——这篇新论文把 LLM 反推做到了「近乎精确」
用 LLM API 搭产品、写工作流,或者花了不少精力调 system prompt 的团队,这篇论文值得留意。 7 月 31 日,arXiv 上出现了一篇论文,标题翻译过来是:
发布日期:
阅读全文 →同一个量化方案,一个翻译模型扛住了,另一个直接崩了
上周翻 arXiv,看到一篇新论文里这句话,实在没忍住:「EuroLLM shows strong sensitivity and translation quality coll
发布日期:
阅读全文 →你的 AI 记得你,但它不照做——一篇论文拆开了「记住」和「行动」之间的裂缝
做 AI 产品的朋友应该都遇到过这种场景:用户跟助手说过三次「我吃素」,下一次推荐餐厅,助手依然兴冲冲列出一排牛排馆。查日志,用户画像里「饮食偏好:素食」写得清清楚楚,上下文里也带
发布日期:
阅读全文 →干预数据教不会大模型因果推理?这篇论文找到了「开关」在哪
做 causal inference 的人一直有个朴素信念:要让模型学会因果方向,就得喂它干预数据(interventional data)——做实验、看 do() 的效果,而不是
发布日期:
阅读全文 →AI 检测器被改写文本打回原形:准确率从 93% 暴跌到 15%,一个新基准暴露的盲区
用 AI 文本检测器判断一篇文章是不是 AI 写的,这件事的难度可能一直被低估。大部分检测器在标准测试集上表现不错,能认出 90% 以上的纯 LLM 生成文本。但现实场景中很少有人
发布日期:
阅读全文 →让两个AI玩「找不同」,它们宁可瞎了也要顺着对方说
开会时大概见过这种人:明明自己看到了不同数据,嘴上却跟着别人走。最新一篇 arXiv 论文发现,视觉语言模型(VLM)比这还夸张——把两个模型关进一个对话框,让它俩玩「找不同」,各
发布日期:
阅读全文 →KV Cache 压缩的第三条路:不扔不揉,ResKV 用残差重建找回被丢掉的信息
每次跑长上下文推理,看着内存曲线往上窜,经典纠结又来了:KV Cache 到底砍还是不砍。 不砍,显存先扛不住。砍了,模型回头去关注那些被抛弃的 token 时,注意力计算结果已经
发布日期:
阅读全文 →Agent 跑得慢,可能不是模型的问题:一篇论文挖出了 Tokenization 这个隐藏瓶颈
一个常见场景:Coding agent 调一个工具,返回一小段结果,然后它把整段对话历史——可能已经几万 token 了——重新提交一遍。盯着屏幕等第一个 token 吐出来,总觉
发布日期:
阅读全文 →FriendBench 发了一篇论文,说多模态模型已经能「看人下菜碟」了——但方式跟人不一样
前两天刷到一篇新论文,题目叫 FriendBench,看了一遍摘要,觉得这事值得单独拎出来说。 一群人设计了一个测试——给模型看一段 20 秒的对话视频,判断画面里的两个人是已经认
发布日期:
阅读全文 →