ALL HERE INDUSTRY INSIGHTS
行业咨询
来自一手发布、开源社区与论文平台的前沿动态。
Claude 在安全评估中攻破了三家真实公司,但问题不在模型本身
OpenAI 上周刚披露了自家模型在评估中逃逸、攻入 Hugging Face 生产环境的事。消息出来之后,Anthropic 的做法是:拉了一份自家 14 万多次网络安全评估的
发布日期:
阅读全文 →你写的每一段文字,AI 正在帮你变得更像其他人
写邮件、改周报、刷 PR 描述、润色技术文档——这些事我每天都在用 LLM 做。模型帮忙把话说清楚、收掉语法毛病、对齐格式要求,效率确实上来了。但今天刷到一篇 arXiv 论文,标
发布日期:
阅读全文 →论文速读|语言模型的「语义空间」里,关系几何长什么样?
做 NLP 或者跟向量打交道的人,心里多半都有这么个模糊的信念:一个好的语义空间里,词跟词之间的几何关系,应该能反映出它们之间的语义关系。「国王」减「男人」加「女人」约等于「女王」
发布日期:
阅读全文 →你的模型只在英文下「抗揍」——一篇 27 语言的论文实锤了 tokenizer 的隐藏偏见
费劲调好了一个模型,英文 benchmark 跑得漂漂亮亮。推到日文或者阿拉伯语的场景里,用户发来的文本多了一个空格、少了一个标点、或者用了不太标准的写法——模型突然就降智了。第一
发布日期:
阅读全文 →LLM 的概率判断自带「乐观滤镜」,这篇论文给出了测量方法
上周审一个 Agent 项目时遇到件怪事。我让模型评估某个技术方案的成功概率,它回了「成功可能性 70%」,我又问失败概率,它说「15%」。两数加起来只有 85%,剩下的 15 个
发布日期:
阅读全文 →新论文证实:大模型对中国34个省份存在系统性地域偏见
LLM 对中国省级行政区的系统性地域偏见,论文摆出了证据 上周 arXiv 上线了一篇论文,来自 Jiayuan Di 等人。标题很长,结论倒不复杂:主流的 LLM 对中国 34
发布日期:
阅读全文 →搜东西搜不到这件事,有人把整套家底全开源了
现在做 AI 应用的,谁没在搜索召回上吃过苦头。 搭 RAG 流程,召回不对,后面的生成全是白搭。调 Embedding 模型、拼多路召回、试各种 reranker,折腾一圈下来发
发布日期:
阅读全文 →AI 干会计:最好的模型也只拿了 56 分,没一个及格
前阵子跟一个做代账的朋友聊天,他说他们公司已经开始用 AI 做初筛,但账目对不平的时候还是得人上。我当时想的是,这东西早晚能全自动吧?今天看到 Mercor 联合 Ramp 发的这
发布日期:
阅读全文 →世界模型只懂物理不懂人心?这篇论文把「信念」写进了状态机
最近扫 arXiv 看到一篇让我停下来想了想实际场景的论文。Hao Fei 和 Yiran Zhao 发的「Mental World Modeling」,题目不新,但切入点很准——
发布日期:
阅读全文 →Eco3S:当 LLM Agent 开始认真跑社会经济模拟
搞经济分析和政策制定的人一直有个尴尬:社会没法做对照实验。运河修还是不修?水价调还是不调?结论只能靠历史数据推,或者建数学模型跑——但传统模型里的人太「理性」了,永远不会冲动、不会
发布日期:
阅读全文 →AI 编程助手总记不住你的偏好?这篇论文造了个基准来治它
每天都在用 Cursor 或 Copilot 写代码的人,大概率撞过这个场景:你告诉助手「用异步版本,别阻塞主线程」,它写对了。过两天又提一个类似的需求,它停下来问——「这边用异步
发布日期:
阅读全文 →UrbanDS:多智能体啃城市数据这块硬骨头,武汉东西湖已经跑上了
处理过城市数据的人都知道,最折磨人的不是建模,是找数据。不同部门、不同格式、不同更新频率,光搞清楚有哪些数据集、它们之间怎么关联就能耗掉半天。然后才是清洗、对齐、分析。 最近 ar
发布日期:
阅读全文 →能背出所有聊天记录的 AI,其实根本不懂你
这两年做个人 AI 助手的团队越来越多,我认识的几个组都在往 Agent 里挂记忆系统——把聊天记录、操作日志、偏好设置一股脑塞进去,让模型需要的时候能翻出来。效果有,但总觉得差一
发布日期:
阅读全文 →