ALL HERE INDUSTRY INSIGHTS
行业咨询
来自一手发布、开源社区与论文平台的前沿动态。
换了个句式,LLM 的立场就变了——一篇论文用因果追踪找到了病灶
句式微调导致 LLM 立场漂移:Stuttgart 团队的新发现与实操启示 如果你做过 prompt 调优,应该遇到过这种事:把一句「公司应该裁员降本」改成「裁员降本应该由公司来推
发布日期:
阅读全文 →第三方技能暗藏风险:OpenSkillRisk 基准测试揭示 Agent 安全漏洞
第三方技能暗藏风险:OpenSkillRisk 基准测试揭示 Agent 安全漏洞 如今,由大语言模型(LLM)驱动的 AI Agent 正变得越来越强大。它们不再仅仅是聊天机器人
发布日期:
阅读全文 →AI 生成艺术模仿能力计算分析:语义对齐提升,浅层特征仍存差距
AI艺术模仿再进化:新模型“懂”概念却丢了质感?2026最新计算分析揭示风格评估真相 2026年7月22日,一份题为《Back to Back with a Copy: A Com
发布日期:
阅读全文 →SLAI T-Rex:在Ascend SuperPOD上完成DeepSeek-V4全系列参数后训练,OR任务零样本Pass@1达71.81%
突破万亿参数瓶颈:在 Ascend NPU 上实现 DeepSeek-V4 高效后训练与运筹学领域适配 2026 年 7 月 22 日,由 Dongfang Li 领衔的 65 人
发布日期:
阅读全文 →Gotta Catch Them All: 谄媚行为的多种模式辨析
谄媚的“万花筒”:AI 为何总是“顺着你说话”? 你是否曾有过这样的经历:向 AI 提出一个带有明显倾向性的问题,而它几乎总是顺着你的思路给出答案?哪怕你的前提存在事实错误,它依然
发布日期:
阅读全文 →arXiv:2607.20208 论文辨析:为什么“Surprisal( surprisal )不是理论”?
核心事实判断 论文标题 :surprisal is Not a Theory 论文 ID / URL : arXiv:2607.20208 DOI : https://doi.or
发布日期:
阅读全文 →HalluTruthQA:首个细粒度阿拉伯语问答幻觉检测基准
从“是否幻觉”到“哪里错了”:HalluTruthQA 如何重新定义阿拉伯语大模型幻觉评估 在大语言模型(LLMs)快速发展的当下,多语言支持能力的评估显得尤为重要。然而,针对非英
发布日期:
阅读全文 →《红楼梦》作为文化透镜:大模型在文化负载翻译中的系统性挑战
文化负载机器翻译的系统性挑战:以《红楼梦》为透镜 在大型语言模型(LLMs)日益普及的今天,机器翻译的质量在许多通用场景下已接近人类水平。然而,当面对深嵌于社会文化语境、超越表层语
发布日期:
阅读全文 →曝光并非必要:语言模型如何习得“异类并列”结构
曝光并非必要:语言模型如何习得“异类并列”结构 在自然语言处理与计算语言学的交叉领域,一个长期存在的理论争议是关于“并列结构”(Coordination)的本质。传统语言学观点认为
发布日期:
阅读全文 →The Maskability Index: Predicting Task-Objective Alignment in Pretrained Language Models
提示工程新范式:用 Maskability Index 量化“任务-目标”对齐度 在大规模预训练语言模型(PLM)的落地应用中,开发者常面临一个核心痛点: 如何判断一个特定的提示策
发布日期:
阅读全文 →Schwartz 价值观评估:大模型在哪些概念上容易混淆?
LLM 在价值观识别上到底会混淆什么?最新研究揭示关键误差模式 2026年7月22日,Andrei Chetvergov 及其合作者将论文《Which Values Do LLMs
发布日期:
阅读全文 →LLM安全评估新范式:统计认证与概率安全界限
给LLM安全评估装上“统计学安全带”:一篇论文如何用数学保证模型不“越界” 在人工智能领域,我们常常面临一个令人不安的现实:大语言模型(LLM)就像一个博学但不可预测的脱口秀演员,
发布日期:
阅读全文 →PyroDash:基于 Token 级协作的“大小模型”协同推理框架
PyroDash:一种无需路由器的 Token 级大小模型协同推理新范式 在 2026 年 7 月 22 日,Niqi Lyu 及其研究团队向 arXiv 提交了一篇名为《Pyro
发布日期:
阅读全文 →