ALL HERE INDUSTRY INSIGHTS
行业咨询
来自一手发布、开源社区与论文平台的前沿动态。
LLM 能打赢一场 D&D 战斗,但打不完一整天
DungeonBench:针对LLM持久资源管理的压力测试 arXiv 上最近挂了一篇关于 LLM 战术推理边界的论文: DungeonBench: A Benchmark for
发布日期:
阅读全文 →给 12 个 Agent 出了套调参考题,结果:能干活,但干得糙
调参这件事,做过机器学习的人都有体感:跑实验、看曲线、改学习率、再跑、再看 loss 是不是又炸了……很烦,很耗时,而且很多时候调的是一股说不清的经验感。这两年 LLM Agent
发布日期:
阅读全文 →AI 进楼宇,数据先打不通:这份新 ontology 想给 HVAC 故障诊断一个通用语义层
楼里的数据比模型还难管。搞过建筑智能化的人大概都这么觉得。一台冷水机组、一台变风量空调箱,传感器数据格式、故障码定义、设备型号编号,从霍尼韦尔到江森自控再到国产厂商,每家各写各的。
发布日期:
阅读全文 →LlamaIndex 甩出一个企业文档提取 Benchmark,结果自家的方案排第一
手里有 370 份企业文档——合同、发票、报表、保险单、采购单——要批量抽出关键字段做成结构化数据,怎么选方案? 这问题过去基本靠"感觉"判断:用 GPT-4o 直接提好像还行,但
发布日期:
阅读全文 →Gemini Robotics 2 发布|人形机器人终于能从脚趾尖到手指尖都「想」着动了
2026 年 7 月 30 日,Google DeepMind 正式发布了 Gemini Robotics 2。不是一次小版本迭代——它把机器人从「只能干桌面活」推到了「能蹲、能伸
发布日期:
阅读全文 →Agent 上 Oncall,还早。ORCA-bench 给 Frontier 模型打了个 10%
过去半年,圈里一直在说 Agent 要抢 SRE 的饭碗了——代码能写、Patch 能打、日志能查,那 Oncall 是不是也能丢给 Agent 顶班?今天 arXiv 上挂出来的
发布日期:
阅读全文 →AskChem 把 147K 篇论文拆成 2.4M 条 claim,检索粒度从「文档」压到「结论」
AskChem:把论文检索压到结论级 做文献综述的人大概都经历过这个场景:想搞清楚某个反应条件、催化机理或者材料性能数据,得翻十几篇论文,每篇从头看到尾,就为了找到那一两句有用的,
发布日期:
阅读全文 →一篇论文把「Transformer 每一层都存 KV」这件事给否了,省了 5 倍显存
arXiv 昨晚挂了一篇有意思的工作,标题起得挺学术——《Understanding Is Done Early: A Depth Division of Labor in Lar
发布日期:
阅读全文 →MORFES 发布|你的模型在 MMLU 上高分,但能搞定希腊语名词变格吗?
希腊语是一种高度屈折的语言。一个名词有四个格,动词有一整套人称、时态、语态和体貌变化,形容词还得跟着名词变性变格变数。这堆规则如果靠死记硬背,工作量非常大,但如果靠规则推导,得真正
发布日期:
阅读全文 →让一群 LLM 给 LLM 打分:这篇 ACL 论文用 Elo 评分做评估,路子对了
做 AI 应用的人总会撞上同一个问题:你怎么知道模型吐出来的东西是好的? 跑榜有用,但榜测的都是通用能力。拿自己的场景、自己的数据去测,人工评估太慢太贵,自动指标又经常和体感对不上
发布日期:
阅读全文 →CACHE-UK:给 4-bit 量化模型反复改知识,退化降了 17%
把 LLM 量化到 4-bit 部署是不少团队控制成本的做法,但有一个隐藏代价:量化后的模型扛不住频繁的知识更新。金融监管规则变了,财报数据要修正——改一次还行,改第二次模型就开始
发布日期:
阅读全文 →只关掉40个神经元,偏见就变了——一篇论文拆了LLM的「偏见回路」
训过模型、调过对齐、跟偏见数据打过架的人都知道,改模型行为有多重。RLHF得攒偏好数据、重新跑训练,直接微调也得上万步,改完还不一定知道到底改了哪根筋。 所以当看到这篇论文时,我愣
发布日期:
阅读全文 →LLM 当不了人类被试:六个模型模拟信念更新,全翻车了
去年开始,我注意到越来越多人用 LLM 替代人类被试做实验。发问卷太慢,招人太贵,Prolific 上一个人好几美元,而 API 调用一次几分钱。逻辑看起来也自洽:LLM 读了那么
发布日期:
阅读全文 →