ALL HERE INDUSTRY INSIGHTS
行业咨询
来自一手发布、开源社区与论文平台的前沿动态。
LLM 当模拟受访者,别只看它选了什么,要看它怎么想的
现在有不少团队在用 LLM 做「社会模拟器」——拿模型当合成受访者填问卷、做概念测试。省钱、快、样本量大,看起来很美。但这两天 arXiv 上有一篇论文,点名说了一个很多人选择性忽
发布日期:
阅读全文 →ERUnderstand 基准实测:VLM 看 ER 图,常规元素稳了,多值属性和多元关系直接崩
做数据库设计的人都知道一个尴尬事:ER 图通常是图片,不是机器可读的 schema。拿到一张实体关系图,想用 AI 帮忙解析、审查或者转换成 DDL,得先把图里的符号再认一遍。这事
发布日期:
阅读全文 →Anthropic CEO 亲自辟谣:我们从未主张禁止开源模型
Dario Amodei 的中间路线 这几天美国科技圈在吵一件事——要不要禁止美国公司用中国的开源模型。一些官员在推禁令,一大批科技公司签了公开信力挺开源,然后有人把矛头指向 An
发布日期:
阅读全文 →印度语用户交的"分词税":等效内容多花 8 倍 Token,马来雅拉姆语上下文直接缩到 12%
用 GPT-4 处理非英语内容时,同样的意思,中文、日语或印地语好像比英语多吃了不少 token。不是错觉。最近 arXiv 上挂了一篇论文,专门把这件事量化了——对象是印度语言,
发布日期:
阅读全文 →Agent 自己改代码自己打分,分数越来越高,活越干越差
前两天看一篇新论文,摘要读完就笑了——这不就是我们踩过的坑吗。 论文来自 arXiv,标题挺长,但核心问题一句话就能讲清楚: 一个能自我改进的 Agent,如果让它自己改策略、自己
发布日期:
阅读全文 →扩散模型也能「从左到右」并行生成了,这篇论文找到了关键
做 LLM 推理的人应该熟悉这个纠结:想要生成质量,就老老实实自回归,一个 token 一个 token 地等;想要速度,就上扩散模型或者并行解码,但生成顺序是乱的,质量经常打折扣
发布日期:
阅读全文 →RAG 向量库去重提速 7 倍:为什么余弦相似度又慢又漏,以及 cross-attention 怎么修
做 RAG 的大概都碰过这个场景:文档切完 chunk 塞进向量库,检索越来越慢,看一眼库大小——比预想多了一倍。回头翻 chunk 列表,大量文本块是重复的。不是完全一样,是语义
发布日期:
阅读全文 →RAG + 消费级硬件 + 本地模型,一篇论文测了个很多人在干的活
有一类论文,一看摘要就知道作者自己也在现场干活。 这篇 7 月 27 日挂到 arXiv 上的 preprint,标题很长——《Retrieval-Augmented Large
发布日期:
阅读全文 →测试了 3 个开源模型 960 次,发现 LLM 离进医院只差一个闭环
试过让 LLM 输出一段符合 ICD-10 标准的诊断编码的,大概见过这种场面:问它「高血压用什么编码」,回的是「HTN」或者「I10—hypertension」。前者是临床随手写
发布日期:
阅读全文 →Transformer 开始「选工具」了:一篇论文证明它能内隐地切换算法
我盯这篇论文好几天了。不是因为它用了什么花哨的架构,而是它问了一个我一直在猜但没人认真验证过的问题:一个 transformer 在推理时,到底知不知道自己在解决哪种问题? 它有没
发布日期:
阅读全文 →泰米尔语翻译的硬骨头,这篇论文啃了一口
用 AI 做翻译时常遇到这种情况:一个模型宣称支持 200 种语言,塞进去一段低资源语料的文本,出来的结果要么词不达意,要么干脆崩成一团乱码。泰米尔语就是这种典型——作为全球 80
发布日期:
阅读全文 →PIVOT 把稀疏注意力最后一公里也优化了:Indexer 加速 4x,端到端省 1.6x
PIVOT:给 DSA 的 Indexer 补一刀 用过 DeepSeek 家的 Sparse Attention(DSA)做长上下文推理的人应该都有同感:下游 attention
发布日期:
阅读全文 →让 Agent 多跑几轮,代码就更可靠?这篇论文说不一定
你在 PR 里看到 coding agent 改了一版、又改一版、再改一版。直觉告诉你:多修了几轮,应该更稳了吧。 一篇刚挂在 arXiv 上的论文,专门盯着这个直觉打了一枪。 标
发布日期:
阅读全文 →