ALL HERE INDUSTRY INSIGHTS
行业咨询
来自一手发布、开源社区与论文平台的前沿动态。
从闭源到开源:一篇新论文用「协议蒸馏」解决 Agent 能力迁移的老毛病
想拿开源小模型复现 GPT-4 那种能自己查资料、多步推理的 agentic search 能力,已经折磨了不少人大半年。最常规的路径是蒸馏——让大模型当老师,小模型跟着学。但实操
发布日期:
阅读全文 →一篇论文拆穿自动驾驶车队的"公平"假象:少数乘客正在为全局最优买单
做自动驾驶车队调度的团队,几乎所有人都在优化同一个指标:全局平均出行时间。听起来很合理——让整个城市的车跑得更快,乘客等得更短,谁不同意? 一篇 arXiv 新论文把这个结论翻了个
发布日期:
阅读全文 →LLM Agent 一被骂就炸毛?这篇论文给了一种架构级解法
搭过 Agent 在生产环境里跑过一段时间的,大概率撞过这类场面——用户连续追问几句,Agent 突然语气变冲;被夸了几句「你真聪明」,回答就开始注水;卡在一个问题上反复绕圈,用词
发布日期:
阅读全文 →Prompt Optimizers Are Blind to Images. This Paper Finally Gives Them Eyes.
当提示优化器不看图:视觉语言模型的盲点 自动提示优化有个奇怪的地方:优化器会读问题、读模型的预测、读正确答案——但它从来不打开图片文件。它为一个多模态模型调优提示词,却不看那个最关
发布日期:
阅读全文 →指标越漂亮,盲区越隐蔽——这篇论文让 LLM 当「模型医生」,专翻失败病例
如果一个 12 导联 ECG 分类器在测试集上跑了 90% 准确率,你会放心用它筛病人吗?对着这个数字点头很容易,但在生产环境里,aggregate metrics 往往最骗人。模
发布日期:
阅读全文 →MCP 服务器新用法:给数学知识库装个 LLM 聊天入口
arXiv 上刚挂了一篇论文,讲的事情很具体也很实用:怎么让 LLM 对数学模型少「胡说八道」,同时让数学家不用背 SPARQL 语法就能查数据库。 说的是一个叫 MathModD
发布日期:
阅读全文 →你的 LLM 答对了电网故障,但证据是错的——这篇论文专门抓这种事
电力系统调度员面前摆着三样东西:电网拓扑图、实时测量数据、事故文本描述。现在多模态大模型可以把这三样一起吞进去,然后给出一句诊断结论——看起来省了大事。 但问题来了:结论对了,不代
发布日期:
阅读全文 →用 GPT-4.1 和 Mistral 搭法国法律知识图谱,这篇论文把流程摊开了
最近读到一篇法国 INRIA 的论文,讲怎么用 LLM 辅助本体工程和知识图谱构建,目标对象是法国法律里的维护保养法规。读下来就觉得,这活儿又具体又实用。 大多数人用 LLM 还是
发布日期:
阅读全文 →模型整体指标好看,你在某个群体上偷偷翻车?这篇论文盯的就是这个
上周跟一个做模型评估的朋友聊天,他说手头一个模型在整体 benchmark 上表现稳得很,但扒开数据一看——某个特定领域的准确率低了一截,而那个领域刚好是客户最在意的。整体指标好不
发布日期:
阅读全文 →AI 提取的威胁情报到底能不能信?这篇论文给出了审计方案
TRACE-CTI:可审计的 AI 映射 威胁情报报告越堆越多,光靠人读根本翻不完。于是大家开始用 LLM 自动映射到 MITRE ATT&CK 框架——哪个攻击手法对应哪
发布日期:
阅读全文 →DSCH-Loss:一篇让哈希检索「平滑」起来的论文,35/40 任务有提升
看一篇新论文的时候,我习惯先翻实验那一节。35 out of 40 个任务超过现有方法,四种哈希码长度全有提升,最高 1.75 个百分点——这个信号值得停下来仔细看。 这篇讲的是深
发布日期:
阅读全文 →大模型押注世界杯:104 场比赛预测完,开卷考只涨了 0.023
昨天刷 arXiv 看到一篇有点意思的论文,来自慕尼黑工业大学那帮人。他们搞了个叫 LLM-SoccerArena 的基准测试平台,专门测大模型在真实体育赛事上的预测能力——不是考
发布日期:
阅读全文 →SIREN:一篇把极端天气预警拆成600道题的论文,暴露了LLM Agent的短板也补了它
做极端天气预警这件事,比想象中更不"AI"。气象局里真正干活的人,不是坐在那等一个模型输出就发警报的。他们要同时盯雷达回波、卫星云图、地面观测站、数值预报、历史相似案例,然后在一个
发布日期:
阅读全文 →