ALL HERE INDUSTRY INSIGHTS
行业咨询
来自一手发布、开源社区与论文平台的前沿动态。
让 Agent 猜自己下一步要调什么工具,这论文把等待时间偷回来了
跑过 Agent 的人都懂那种体验:模型思考得挺快,但一旦开始调工具——查数据库、搜网页、调 API——你就得眼巴巴等结果回来才能走下一步。一两秒还好,链条一长,累积的等待时间能把
发布日期:
阅读全文 →卫星调度做到 99% 请求满足,JPL 跟 CMU 这篇论文用上「定价」思路了
卫星调度是个经典难题。几百颗卫星在天上飞,地面科学家不断提交观测请求——拍这片农田、扫那段海岸线、盯着某个台风眼。每颗卫星有轨道窗口、存储限制、功耗约束,请求之间互相打架。规模一大
发布日期:
阅读全文 →AI 编码代理的安全缺口,有人用一根「缰绳」堵上了
AI 编码代理正在以历史性速度被接入开发流程。但安全团队看到的是另一面——大多数组织对 Agent 写代码这件事,态度是「先试试,别出乱子」,因为没人能说清楚怎么给一个自主行动的
发布日期:
阅读全文 →95 万条记录、714 个 Agent,Messier 把 Agent 评估的「混战」局面标准化了
搞 Agent 的人大概都经历过这个场景:同一个模型,在 A benchmark 上表现惊艳,在 B benchmark 上直接拉胯,分不清是模型的问题、框架的问题、评分规则的问题
发布日期:
阅读全文 →当 GUI Agent 干完活,怎么确认它真的干完了?IRA 给了个新答案
GUI Agent 跑完一轮,截图看起来操作都对,但任务到底完没完成,常常拿不准。 问题出在评测方式上。现在的 GUI 评测主流做法是看截图——Agent 执行完后,把最终界面跟预
发布日期:
阅读全文 →记忆正在成为 LLM 的独立维度,这篇综述画了一张全景图
「记忆」这个词在 AI 圈正在变得越来越难用。有人说大模型记忆,有人理解成注意力窗口,有人理解成 RNN 的隐状态,有人想到 RAG 检索,有人直接说微调就是记忆。都不是错的,但放
发布日期:
阅读全文 →给每个实体拍一张「身份签名」:IRIS 用冻结 LLM 把知识图谱对齐做到了 100% Hits@1
做过知识图谱实体对齐的人大概都遇到过这种场景:两个图谱指向同一个实体,但名字、描述角度甚至语言都不一样。传统方法翻来覆去就是文本相似度、图结构匹配,碰上「字节跳动」和「ByteDa
发布日期:
阅读全文 →LLM 回复里插广告,但不动模型本身|PILA 这篇论文想解决一个真问题
用 LLM API 做产品,模型调用成本怎么回收?直接向用户收费是一条路,广告是另一条。但给 LLM 回复里塞广告有个固有的矛盾——把广告放进系统 prompt,模型输出质量会往下
发布日期:
阅读全文 →科学摘要太难看懂?这套数据集把 GPT-4o-mini 和人类专家拉到一个环里了
跨学科研究越来越主流,但一个实际问题一直没解决——读隔壁领域的论文摘要,每个词都认识,凑一起就是看不懂。术语太专、背景假设太多、行文默认读者已经在这个领域泡了三年。 最近 arXi
发布日期:
阅读全文 →LLM 指纹注入新思路:不靠乱码,靠「语言混搭」绕过困惑度检测
开源大模型谁都能下,但怎么证明它是你的? 行业里一直在用「指纹注入」做所有权验证——在模型行为里埋一组 trigger-target 对,暗号只有模型主人知道。等模型被人扒走重新分
发布日期:
阅读全文 →LLM 当心理督导师:2100 场模拟治疗跑完,大部分模型打分太松
arXiv 上刚挂出来一篇论文,叫 MyMentorLLM,讲的是用多模态 GenAI 搭建心理治疗模拟环境,让学员跟 AI 病人做 CBT(认知行为疗法),然后 AI 督导师给反
发布日期:
阅读全文 →语音大模型也搞联邦学习了,FLICS2026 这篇论文打了第一枪
联邦学习给 SpeechLLM 训练开了条新路 语音数据拿不到手上,是训练语音模型最现实的阻力。 医疗记录、客服录音、会议转录——这些场景的语音数据既珍贵又敏感,企业不敢外传,法规
发布日期:
阅读全文 →你的Agent能找到正确的文档,但不会读
正在搭一个企业知识库 Agent,遇到一个具体的麻烦:Agent 能准确锁定正确的文档,跳到对应的表格那一页,但最终给出的答案要么是错的,要么少了一半关键数据。 上周 arXiv
发布日期:
阅读全文 →