ALL HERE INDUSTRY INSIGHTS
行业咨询
来自一手发布、开源社区与论文平台的前沿动态。
Shieldstral 发布|把内容审核变成一道是非题,3B 模型追平 7 倍大的对手
大概从去年开始,有件事一直让我觉得不太对劲:每个人都在往产品里塞大模型,但内容审核这块基本靠猜。接 OpenAI 的 moderation API 够用吗?自己微调一个?还是直接上
发布日期:
阅读全文 →AI 评审给 AI 写的本子打更高分:一篇新论文戳破了什么
arXiv 今天挂了一篇有意思的论文。一群物理、天文、宇宙学的研究者认真测了一次 AI 在科研项目规划和评审里的实际表现,结论有点尴尬。 八位专家各自构思了一个项目,然后由人类研究
发布日期:
阅读全文 →测完 15 个多模态模型看病,结论是:方向感有了,推理还不行
AI 看病这事,之前的评测方式一直有个结构性缺口:要么给一张片子让模型直接说结论,要么给一段文本做单选题。但真在医院里,诊断不是这样走的。真实的临床流程是分步的、多轮的——先看主诉
发布日期:
阅读全文 →LLM 当政治信息中介:分数漂亮,一碰模糊信息就露馅
越来越多人把政治话题直接丢给 ChatGPT、Claude 这类模型——问它某个政策怎么看、某个候选人什么立场、某条新闻有没有水分。LLM 已经是很多人获取信息的默认入口了。但一个
发布日期:
阅读全文 →文本、表格、知识图谱三方打架,这篇论文把它做成了可检测的问题
如果你做过基于 Wikipedia 的 RAG,或者拿 Wikidata 做知识增强,大概率遇到过这个场景:同一件事,正文里写的是 A,信息框里写的是 B,去 Wikidata 查
发布日期:
阅读全文 →你说话的方式,AI比你学得更狠
前两天逛 arXiv,刷到一篇 2026 年 7 月 28 号挂出来的论文,标题直得不像学术文章:「Instruction-Tuned Models Locally Reuse H
发布日期:
阅读全文 →UniMem:LLM Agent 终于不用在「记太多」和「学不会」之间二选一了
When an LLM agent runs in production long enough, a pattern emerges. External retrieval-ba
发布日期:
阅读全文 →蒸馏小模型老是跑偏?这篇论文搞了个「接棒」机制,训练轨迹砍半还提点 5.73%
蒸馏过小模型的人,大概率见过这个场景:学生模型在某个推理步骤走歪了,顺着这个错误方向一路狂奔,生成了一长串毫无意义的内容。整条训练轨迹废掉,算力白烧,梯度白算。 做 on-poli
发布日期:
阅读全文 →全模态模型的算力账单,终于有人开始抠预算分配了 | OmniDelta
Qwen2.5-Omni 这类全模态模型的好处是直观的:文本、音频、视频一起吃,统一理解。坏处也摆在面上——音频加视频的 token 序列太长,显存和推理成本直接起飞。压缩 tok
发布日期:
阅读全文 →你给模型练的题,可能正在帮它"作弊"|DecoEvo 这篇论文戳了一个真问题
做 prompt 优化或者搭 agent 工作流的人,大概都遇到过这个场景:一轮轮改下来,benchmark 跑分确实在涨,但实际用起来,模型碰到没见过的场景还是犯同样的错。更让人
发布日期:
阅读全文 →Cognivia 发布|专治 LLM「过度讨好」,这篇论文造了一个真能开药的 CBT Copilot
用 LLM 做过心理疏导的人大概碰到过这种情况:说了半天焦虑,它回一句「你已经做得很好了,要相信自己」。话没错,但没用。通用模型在心理健康场景下有两个硬伤:一是 过度讨好 ,怎么说
发布日期:
阅读全文 →多 Agent 说你「很确定」的时候,可能在瞎编|一篇新论文给 LLM 系统装了置信度仪表盘
多 Agent 流水线的不确定性,终于有人做了个仪表盘 用不止一个 LLM Agent 串起来干活的人,多半遇到过这种场景:每个 Agent 单独看都还行,一组成流水线就开始互相喂
发布日期:
阅读全文 →跨厂商Agent工具信任,这篇论文想把它标准化
最近arXiv上有篇论文,标题很长——「Toward Standardized Cross-Vendor Agent Tool Trust Management in Autono
发布日期:
阅读全文 →