ALL HERE INDUSTRY INSIGHTS
行业咨询
来自一手发布、开源社区与论文平台的前沿动态。
UNICON 发布|一个能跨学科「读数据」的数值基础模型来了
最近跟几个做科学计算的朋友聊,发现一个共同的卡点:LLM 在文字上已经够用了,但一碰到数值系统——气象、流体、代谢网络、市场价格序列——就基本帮不上忙。LLM 的预训练语料是文本,
发布日期:
阅读全文 →arXiv 2607.28434: 不训练,不微调,一次前向传播就能读到模型在「理解」什么
有一篇 arXiv 论文发出来,光看摘要就能让人停下来想一会儿。它叫 Metaphor Tracer ,7 月 30 日提交,39 页,8 张图,目前还没有开源代码或权重。 核心主
发布日期:
阅读全文 →SVR 论文速读:模型学会自验自停,推理不用算死账
部署模型做数学推理时有一个两难:同一个模型,有的题一步就解对,有的题绕了十轮还在改答案。固定预算浪费算力,挂外部 verifier 又增加部署复杂度。 arXiv 上这篇 SVR(
发布日期:
阅读全文 →LeanCSP 论文|Lean 给约束求解上了「双验证」,搜索量压到两千万分之一
做调度、规划、配置、验证的人,日常跟约束求解器打交道。一个问题丢进去,求解器跑完返回 SAT 或 UNSAT,拿过来就用。这些求解器几十万行代码起步,堆满了启发式和剪枝策略,没人能
发布日期:
阅读全文 →28 万份肠镜报告「训」出一个接近专家水平的 AI,关键不在模型结构
每天早上,AI 圈都会消化几篇新论文,大多数是基线往上挪了零点几个点。但偶尔会出现一篇,读完第一反应不是「又涨了」,而是「之前怎么没人这么干」。刚挂上 arXiv 的这篇 Endo
发布日期:
阅读全文 →把AI推理塞进纳米卫星:不传图片,只传结论
前两天翻arXiv看到一篇有意思的preprint,标题很长但痛点一句话就能说清楚——纳米卫星拍了一堆航空影像,但传不回来。 不是设备坏了,是设计逻辑的问题。传统叫法叫「bent-
发布日期:
阅读全文 →下水道里的可解释AI:一篇新论文把管道缺陷检测从黑箱变成了可追溯推理
下水道、模糊规则、神经符号,这三个词同时出现在一篇论文标题里,看起来确实容易让人滑走。但如果关注 neuro-symbolic 的实际落地,或者正在想怎么让模型输出不再只是黑箱猜测
发布日期:
阅读全文 →供应链终于有了一个「端到端」的AI大脑|SCOPE论文解读
前两天在arXiv上翻到一篇新论文,标题叫SCOPE,全称是"Supply-Chain Operations through Coupled Policies for End-to
发布日期:
阅读全文 →InfoOps Bench 测了 17 个大模型:大部分能被用来搞信息战,中国模型的「选择性拒绝」最微妙
一篇新论文发了:InfoOps Bench,一个实时更新的 AI 安全基准。 它专门测前沿语言模型会不会被国家背景的信息操作(information operations)利用——
发布日期:
阅读全文 →你的 Agent 还在全盘接受信息?这篇论文给了它一个「挑着信」的框架
做 Agent 的人多半遇到过这种场景:给模型塞一段新信息,它要么照单全收,要么直接忽略,几乎没有中间态。 纯聊天场景下问题不大。但 Agent 一旦开始自主决策——跑一个多步骤任
发布日期:
阅读全文 →还在手调 Agent 协作拓扑?MANTA 让它自己进化,平均分 74.0
搭过多 Agent 系统的人都有这种体验:几个 Agent 分工跑起来,刚开始还行,任务一复杂就开始互相阻塞、重复劳动,关键信息流不到该去的人手里。停下来改拓扑、调链路、重新排执行
发布日期:
阅读全文 →给本地 Agent 加推理时长,效果越来越差?一篇论文把四种 Scaling 都测了一遍
最近「推理时缩放」(inference-time scaling)在 Agent 圈里很火,逻辑听着也顺:模型推理时多算一会儿,多思考几步,结果应该更好。OpenAI 的 o 系列
发布日期:
阅读全文 →DualG-MRAG 论文速读|多模态 RAG 的多跳推理顽疾,被一张双图架构解了
做多模态 RAG 多跳推理的人,大概率都卡过同一个问题:图建细了,视觉特征一加进来,节点爆炸,检索直接变成噪声扫射;图建粗了,局部关键证据又丢了,召回率惨不忍睹。两头都不讨好。 这
发布日期:
阅读全文 →