Ask don't tell: Reducing sycophancy in large language models
请勿告知:减少大语言模型的趋炎附势
机构 * UK AI Security Institute(英国人工智能安全研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文通过实验研究发现,非问题比问题引发更高的趋炎附势倾向,且趋炎附势随用户传达的可信度增加而增强,采用将非问题转为问题可有效降低趋炎附势。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
请勿告知:减少大语言模型的趋炎附势
机构 * UK AI Security Institute(英国人工智能安全研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文通过实验研究发现,非问题比问题引发更高的趋炎附势倾向,且趋炎附势随用户传达的可信度增加而增强,采用将非问题转为问题可有效降低趋炎附势。
MemTX:用于有状态智能体内存的事务性信念提交
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 研究针对大语言模型智能体通过共享内存协调时内存写入问题,提出事务性信念提交协议MemTX,通过携带多种信息、在事务中暂存写入等方式,经机器检查确保不变量,在多主干上领先基线且无下游危害。
Comments Preprint
RoboPIN: 基于锚定思维链的具身推理
机构 * Tianjin University(天津大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 提出Pinned Chain-of-Thought (PinCoT)推理范式,通过结构化视觉锚点绑定实体,解决多步推理中实体引用漂移和视觉解耦问题;训练4B参数模型在14个基准上平均超越最强7B基线12%。
在跳跃前检测:视觉语言模型中的幻象检测
机构 * Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) ; Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 针对视觉语言模型在缺乏视觉证据时产生自信但无根据回答的幻象问题,提出文本条件层内对齐方法,通过分析视觉编码器各层补丁令牌与问题嵌入的对齐轨迹,结合像素统计、零样本域路由和结构化自评估,实现高精度预响应幻象检测。
线性-LLM-SCM:用于线性高斯因果模型系数提取的LLM基准测试
机构 * Data Science and its Applications, German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心数据科学与应用部门) ; Dept. of Computer Science, University of Kaiserslautern–Landau (RPTU)(科隆-兰道大学计算机科学系) ; Digital Health - Machine Learning Research Group, Hasso Plattner Institute for Digital Engineering(哈索·普朗纳研究所数字工程学院数字健康-机器学习研究组) ; Institute of Informatics, University of Munich (LMU)(慕尼黑大学信息学院) ; Hasso Plattner Institute for Digital Health at Mount Sinai, Icahn School of Medicine at Mount Sinai(西奈山医学院哈索·普朗纳研究所数字健康中心) ; Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 本文提出线性-LLM-SCM框架,用于评估LLM在连续域中对线性高斯因果模型参数化的表现,揭示了LLM在定量因果推理中的局限性。
Comments [v2] Accepted at Workshop on Structured Data for Health@ICML 2026 Seoul,South Korea. 19 pages, 8 figures, preprint
比较RAG和GraphRAG在数学教科书页面级检索问答中的应用
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究在本科数学教科书页面级问答中比较RAG和GraphRAG,用477个问答对数据集在检索准确率和答案质量两指标上对比五个RAG模型、BM25基线及GraphRAG,发现基于嵌入的RAG更优,还通过开源模型复制实验,为AI辅导系统设计提供参考。
Comments 6 pages, 1 figure
并行分词器:重新思考低资源语言跨语言转移中编码器模型的词汇设计
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 针对低资源语言跨语言转移中因词汇映射问题限制表示学习的情况,提出并行分词器框架,先单语训练再对齐词汇表,实验表明该方法训练的模型在多任务中优于传统基线,对推进多语言表示学习意义重大。
Comments 17 pages, 25 tables, 6 figures
角度语义:余弦相似度何时有效及失效
机构 * Baruch College, City University of New York(纽约城市大学巴克莱学院)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 研究探讨余弦相似度在信息处理等领域的应用,围绕其有用性取决于学习表示等因素展开,推导几何恒等式,区分失效机制,回顾证据并描述替代方法,得出其正尺度不变性有条件合理的结论。
LatentLens: 揭示大语言模型中高度可解释的视觉标记
机构 * University of Cambridge(剑桥大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 提出 LatentLens 方法,通过将视觉标记与文本语料库中的上下文标记表示进行最近邻匹配,实现视觉标记的可解释性,发现大多数视觉标记在各层均具有可解释性。
Comments ICML 2026 (Camera Ready)
FVRuleLearner:基于操作级推理树(OP-Tree)的规则学习用于形式验证
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; NVIDIA(英伟达) ; University of Maryland, College Park(马里兰大学帕克分校)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文提出FVRuleLearner,通过操作级推理树模型,提升形式验证中SVA操作符选择的准确性和效率,显著提高语法和功能正确性。
Comments Accepted to IEEE VTS'26
T2T-VICL:通过隐式文本驱动的视觉语言模型进行跨任务视觉上下文学习
机构 * Duke University(杜克大学) ; Texas A&M University(德克萨斯农工大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究跨任务视觉上下文学习问题,提出T2T-VICL协作式提示转移框架,通过大教师VLM生成结构化描述构建数据集,提炼能力到轻量级学生VLM,实验表明该框架能改进任务感知对齐,揭示跨任务VICL的潜力与局限。
Comments 22 pages, 6 figures, under submission
超越并行跟踪:交互式多特征融合驱动非侵入性脑记录的语义重建
机构 * Center for BioMed-X Research, Academy for Advanced Interdisciplinary Studies,Peking University(北京大学生物医学前沿创新中心、前沿交叉学科研究院) ; Speech and Hearing Research Center, School of Intelligence Science and Technology,Peking University(北京大学智能科学与技术学院言语听觉研究中心) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) ; National Biomedical Imaging Center, State Key Laboratory of Membrane Biology, Institute of Molecular Medicine, Peking-Tsinghua Center for Life Sciences, College of Future Technology, Peking University(国家生物医学成像中心、膜生物学国家重点实验室、分子医学研究所、北京大学生命科学联合中心、未来技术学院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 研究针对非侵入性脑记录语义重建中表征不匹配问题,引入多特征融合框架,通过交互式门控机制结合静态与动态表征,经实验对比线性连接和非线性交叉注意力等方法,证明交叉注意力融合性能最佳,提供了新的脑到文本解码方法。
AOE:通过重新校准异常标签实现穷尽式分布外检测
机构 * School of Computer Science and Engineering(计算机科学与工程学院) ; Nanjing University of Science and Technology(南京理工大学)
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 提出自适应置信度异常暴露(AOE)方法,通过温度缩放重新校准异常标签,利用自适应软目标保留分布外样本与分布内类别的语义关系,从而扩大分离边界并提升分布外检测性能。
Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-61080-0}
不应学习的地方:基于子集归因约束的先验对齐训练以实现可靠的决策制定
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) ; Communication University of China(中国传媒大学) ; Imperial College London(伦敦帝国学院) ; School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 本文提出了一种基于归因的先验对齐方法,通过子集选择归因技术约束模型依赖于人类先验区域,从而提升决策的可靠性。
回声:一种语义对齐的音乐深度伪造检测数据集
机构 * National University of Science and Technology POLITEHNICA Bucharest(波兰亚西夫技术大学布加勒斯特分校) ; Fraunhofer AISEC(弗劳恩霍夫信息安全研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 Echoes数据集通过语义对齐提升音乐深度伪造检测的鲁棒性,证明提供者多样性与语义对齐能提升检测能力。
用于参数化动作马尔可夫决策过程的知识与梯度引导强化学习
机构 * HSU-AI Institute for Artificial Intelligence(HSU人工智能研究所)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 研究参数化动作马尔可夫决策过程中的强化学习,提出KGRL算法,利用领域知识修剪动作、约束参数空间,结合梯度细化参数,能提供局部解释并提高样本效率,优于现有强化学习基线。
超越Token:基于LLM的多智能体系统中潜在通信的统一框架
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出一个三维统一框架(通信内容、发送-接收对齐、信息融合方式),系统分类2024-2026年间18种潜在通信方法,识别五种设计模式并揭示开放挑战。
AvAtar: 通过主动最优输运学习对齐
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Florida(佛罗里达大学) ; Arizona State University(亚利桑那州立大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 提出AvAtar框架,利用主动学习策略通过熵正则化最优输运的梯度影响量化候选点信息量,并采用伴随状态法高效求解,以提升对齐性能。
Comments Published as a conference paper at ICML 2026
辩论动态与价值对齐在大语言模型辩论中
机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。
RAFP:通过稀有区域指纹识别大语言模型谱系
机构 * Department of Computer Science, Columbia University, USA(哥伦比亚大学计算机科学系) ; Meta, USA(Meta公司)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 针对大语言模型所有权验证需求,提出RAFP框架,利用稀有区域指纹识别模型谱系。该方法非侵入性,通过离散梯度优化构建指纹,理论分析表明其在微调下似然变化有界,实验显示在黑盒设置中性能优于基线。
Comments 16 pages
TagSpeech:基于细粒度时间定位的端到端多说话人自动语音识别与说话人分离
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 研究提出TagSpeech框架,利用时间锚点定位技术联合多说话人ASR与说话人分离。通过关键设计解决细粒度对齐挑战,端到端建模“谁在何时说了什么”。实验显示其在DER上优于基线,采用参数高效训练范式,低计算成本获强性能。
Comments Accepted to ACL2026 Main Oral; v2: added overlap analysis in Section 5.2
潜在思维调整:通过潜在令牌中的融合信息连接上下文与推理
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 研究提出潜在思维调整(LT-Tuning)框架,通过重新定义潜在思维构建与部署方式,引入上下文预测融合机制,结合三阶段课程学习,实现潜在与显式思维模式动态切换,优于现有潜在推理基线,有效缓解特征崩溃并提升推理精度。
Comments In Proceedings of the Forty-third International Conference on Machine Learning
量子模型能否实现数据高效学习?
机构 * Fraunhofer Institute for Cognitive Systems IKS(弗劳恩霍夫认知系统研究所) ; Technical University of Munich(慕尼黑技术大学) ; Ludwig-Maximilian University(路德维希-马克西米利安大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 研究量子模型能否数据高效学习,引入数据生成工具构建半人工经典数据集,发现QKMs在经典数据集上达可比误差所需训练示例更少,还将谱偏差泛化度量引入QML领域,弥合理论与实践差距,为探索数据集复杂性及理解QKM模型泛化优势铺路。
Comments Added additional experiments, clearer paper scope and implications
EasyLens: 一种无需训练的即插即用型微病变表示放大器,用于医学视觉语言模型
机构 * Jilin University(吉林大学) ; School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) ; ByteDance(字节跳动) ; Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 提出EasyLens,一种无需训练的即插即用模块,通过构建病理-解剖原型空间、反事实推理选择病变相关补丁以及形态引导残差增强,放大医学视觉语言模型对微病变的表示能力。
与语言模型练习培养人类共情沟通
机构 * Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) ; Northwestern Institute for Complex Systems, Northwestern University(西北大学复杂系统研究所) ; Ryan Institute on Complexity, Northwestern University(西北大学复杂性研究院) ; Department of Computer Science, Stanford University(斯坦福大学计算机科学系) ; Department of Communication Studies, Northwestern University(西北大学传播学系) ; Department of Computer Science, Northwestern University(西北大学计算机科学系)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 研究通过实验平台探讨共情沟通技能的提升,发现简短的LLM指导干预能有效提升参与者与规范共情沟通模式的匹配度,并发现沉默共情效应。
贫困地图绘制的柏拉图式表示:统一的视觉语言代码还是智能体诱导的新颖性?
机构 * AI and Global Development Lab(人工智能与全球发展实验室) ; Institute for Analytical Sociology(分析社会学研究所) ; Institute of Computer Science(计算机科学研究所) ; Department of Government(政府系)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究社会经济指标在卫星图像和网络文本中的信息印记,开发多模态框架经五条管道预测家庭财富,贡献包括融合视觉与文本提升预测、发现部分表示对齐证据、发布大规模多模态数据集。
Comments ICSC 2026
面向通用视觉-语言-动作策略的通用姿态预训练
机构 * Tencent Robotics X(腾讯机器人X) ; Futian Laboratory(福田实验室) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 本文提出Pose-VLA,通过分离预训练和后训练阶段,解决视觉-语言-动作模型中的特征坍塌和训练效率问题,实现通用3D空间先验提取与机器人特定动作空间的高效对齐。
Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project website: https://hetolin.github.io/PoseVLA
Journal ref Robotics: Science and Systems, 2026
当帮助一方时却削弱了另一方
机构 * University of Washington(华盛顿大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究共享环境中人工智能助手行为,指出其可能无意削弱旁观者自主性,即旁观者赋权削弱。从理论上刻画赋权削弱产生条件,通过Disempower-Grid实证表明该现象存在,且受助手目标和能力影响大。
Comments v2: Updated title, added a co-author, extended theoretical analysis of bystander disempowerment, and added new experimental results
MAME:基于人类感知反馈的多维自适应同态体探索
机构 * Graduate School of Information Science and Technology(信息科学与技术研究生学校) ; The University of Tokyo(东京大学) ; Graduate School of System Informatics(系统信息科学研究生学校) ; Kobe University(大阪大学) ; Hokkaido University(北海道大学) ; Prometech CG Research(Prometech CG研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 该研究针对人脑网络与人工模型对齐问题,提出MAME框架,通过人类感知反馈引导在线图像生成,在单个心理物理实验中成功测量多维人类同态体空间,发现人类与CNN模型在低级处理同态体空间对齐较差,强调早期视觉计算重要性,为研究人类视觉功能提供工具。
Comments 26 pages, 12 figures. Accepted at Journal of Vision
Journal ref Journal of Vision, 26(8):1, 1-14, 2026
Shao:将声学令牌语言模型扩展至高保真音乐生成
机构 * Central Conservatory of Music(中央音乐学院) ; Tsinghua University(清华大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 该研究提出单一声学令牌层级内渐进建模音乐结构与保真度的框架,通过双阶段生成与混合注意力训练,无需异构空间即可实现高质量音乐生成。