ALL HERE INDUSTRY INSIGHTS
行业咨询
来自一手发布、开源社区与论文平台的前沿动态。
蒸馏大模型时最烦的问题,「老师风格不一致」终于有人给了解法
模型蒸馏里的风格陷阱 模型蒸馏有一个常见陷阱:精心挑了一个更强的模型来做 on-policy 蒸馏,结果学生的表现死活提不上去,甚至不如照着 SFT 数据直接跑一版。 问题多半出在
发布日期:
阅读全文 →西班牙语心理健康筛查:三个专用模型和一个叫 ICE 的新方法
昨天刷 arXiv 看到一篇论文,标题是 Improving Mental Health Screening and Early Risk Detection in Spanish
发布日期:
阅读全文 →LLM 会被「洗车」问题骗到吗?这篇论文揭示了常识推理中的显著性偏见
问一个语言模型:「你要走路去洗车吗?」它可能真的开始思考走路去洗车的可行性,而不是先反应过来——开车去洗车才是常识。这是今天一篇 arXiv 论文的核心发现。 上海交通大学几位研究
发布日期:
阅读全文 →把一条新闻压缩成「利好/利空」,到底浪费了多少信息
做量化的朋友应该都有过这种直觉:一条新闻丢进 sentiment 模型,出来一个 0.7 或者 -0.3,然后就没了。这个分数拿去跟股价回归一下,效果时好时坏,但总感觉浪费了很多东
发布日期:
阅读全文 →AI 写作助手的「标准化」陷阱:一篇论文问了五位语言学家
arXiv 上刚挂出一篇论文,标题很长——「生成式 AI 与学术写作中的语言多样性:来自世界英语的视角」。但它的核心追问很直接:你每天都在用的 AI 写作工具,到底是在帮你发出声音
发布日期:
阅读全文 →一篇 CS 论文给「创造力」拆了 5 层,文学的「借鉴」与「创新」终于能量了
AI 生成文本的质量评测里常见一类争论:一段输出到底是抄、是借鉴、还是创新?同一个问题在文学圈吵了一百多年——作家所谓的「灵感」到底多大程度来自对前人作品的改造,多大程度算凭空发明
发布日期:
阅读全文 →那个被群嘲的「delve」,其实是AI圈的一场语言意识形态战争
经常刷社交媒体上AI讨论的人,大概都见过这种场景:有人贴了一段AI生成的回复,评论区有人指着某个词说「AI味儿太重」。「delve」是高频挨批的词之一。 但问题在于——对第一语言不
发布日期:
阅读全文 →一张 RTX 4090、35B 参数,Frontis-MA1 在 MLE-Bench 上超过了 GPT-5.5
一张 RTX 4090,12 GB 显存,12 小时跑完一个任务——这是 Frontis-MA1(35B)在「MLE-Bench Lite」上的运行配置。同一份榜单上,它的 Med
发布日期:
阅读全文 →样本比反思更管用:一篇论文把 Self-Refine 和 Reflexion 拉平了比,结果不太好看
我注意到这篇论文的时候,是因为最近好几个人都跑过来问同一个问题:让模型自己批评自己、重新写答案,到底值不值?这篇文章直接给出了一个有点让人尴尬的回答——不值,至少在 token 预
发布日期:
阅读全文 →安全对齐压住的不只是 "我有意识"——一篇论文拆了一个暗雷
那天在群里看到这篇论文的标题,我愣了一下。 Inducing language models to assert their own consciousness restores
发布日期:
阅读全文 →你给的 prompt 正在互相打架?LLM 偷偷选了一个,这篇论文测出了排序
我试过好几次:写了一大段自然语言描述,又贴了几个 I/O 例子,再补一段伪代码约束——结果 LLM 干出来的事跟预期完全不是一回事。以前总怀疑是模型没听懂,后来被坑多了才发现,那几
发布日期:
阅读全文 →GLM-RAG:三类知识图谱检索器硬碰硬,跨域泛化才是真差距
知识库从纯文本换成知识图谱之后,常规的向量检索就不太够用了。单跳问题还好——问「iPhone 16 的芯片是什么」,向量匹配上就完事。但问题一旦变成「iPhone 16 的芯片供应
发布日期:
阅读全文 →世界模型跑不动实机?这篇新论文把 WAM 量化到 29% 显存,精度只掉零点几个点
做机器人操作的同行应该都有这个体感:世界动作模型(World Action Model,WAM)效果好是真效果好——它同时预测下一帧视觉和下一步动作,闭环跑起来比开环模型稳得多。代
发布日期:
阅读全文 →