Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
通过注意力校准缓解大视觉-语言模型中的物体幻觉
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文提出动态注意力校准方法,通过对比学习动态强制位置不变性,有效缓解大视觉-语言模型中的物体幻觉问题,并在多个基准测试中取得最佳性能。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
通过注意力校准缓解大视觉-语言模型中的物体幻觉
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文提出动态注意力校准方法,通过对比学习动态强制位置不变性,有效缓解大视觉-语言模型中的物体幻觉问题,并在多个基准测试中取得最佳性能。
判别表示学习用于临床预测
机构 * The University of Hong Kong (HKU)(香港大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG
AI总结 本文提出一种监督深度学习框架,通过最大化类间分离与类内方差比,提升临床预测性能,优于其他预训练方法。
通过单世界干预程序在ProbLog中实现高效的反事实推理
机构 * University of Edinburgh(爱丁堡大学) ; The MITRE Corporation(MITRE公司)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出单世界干预程序(SWIPs)用于ProbLog中的反事实推理,通过将ProbLog子句分为观测和固定部分,减少计算复杂度并提升推理可靠性,实验表明在大规模数据上推理时间减少35%。
评估在用户压力下指令调优语言模型的证据基础
机构 * College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) ; Department of Computer Science, Old Dominion University(老 Dominion 大学计算机科学系)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 研究探讨了在用户压力下指令调优语言模型如何平衡用户对齐压力与上下文证据的忠实性,通过控制的认知冲突框架评估证据一致性准确性及排序表现。
既非此处亦非彼处:多语言编码器中混合语言文本的跨语言表示动态
机构 * Indian Institute of Science Education and Research(印度科学教育与研究学院) ; Microsoft Corporation(微软公司)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 研究探讨多语言编码器对混合语言文本的内部表示,发现标准模型在英语和印地语间表现良好,但混合文本与任一语言连接松散。通过训练混合数据可提升英语混合文本对齐,但损害英语-印地语对齐。引入三语后训练目标,使混合文本表示更接近构成语言,提升跨语言理解。
Comments 24 pages
审查审查者:图增强的大语言模型用于电商争议裁决
机构 * Purdue University(普渡大学) ; Amazon(亚马逊)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 本文提出图增强的大语言模型,通过显式动作建模和冲突建模解决电商争议裁决中的信息不对称问题,提升裁决一致性。
Comments 10 pages, 3 figures, KDD 2026 Applied Data Science Track
大语言模型幻觉:全面调查
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL
AI总结 本文全面调查大语言模型中的幻觉现象,分析其成因、检测与缓解方法,探讨现有评估指标及未来研究方向。
TxSum: 基于微粒语义锚定的用户导向以太坊交易理解
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Wuhan University(武汉大学) ; University of North Texas(北卡罗来纳州立大学) ; Fudan University(复旦大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL
AI总结 本文提出TxSum任务,通过构建187个复杂以太坊交易数据集,引入MATEX框架提升交易解释质量,使用户对复杂交易的理解率从52.9%提升至76.5%,恶意交易拒绝率提升至88%。
韧性与自主性:在关键基础设施中治理具身体验的人工智能
机构 * Department of Automation and Process Engineering (IAP)(自动化与过程工程系) ; UiT The Arctic University of Norway(北极大学) ; Department of Technology and Safety (ITS)(技术与安全系)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 本文探讨关键基础设施中具身体验AI的韧性与自主性治理,提出混合治理架构下的四种监管模式,结合欧盟AI法案和ISO标准,强调机器能力与人类判断的结构化分配。
Comments 6 pages
TheraAgent:具有自我进化记忆和证据校准推理的多智能体框架用于PET治疗诊断
机构 * Fudan University(复旦大学) ; University of Bern(伯尔尼大学) ; Nanjing University(南京大学) ; National University of Singapore(新加坡国立大学)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 TheraAgent通过自我进化记忆和证据校准推理,解决PET治疗诊断中数据稀缺、信息异构和证据推理的问题,实现75.7%的准确率。
基于几何的语义推理用于无训练视频异常检测
机构 * School of Computing, Engineering \& Mathematical Sciences, La Trobe University, Melbourne, Australia School of Engineering ; Applied Sciences, GIFT University, Gujranwala 52250, Pakistan
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文提出MM-VAD框架,通过将异常检测转为适应性测试时推理,利用双曲空间保留层次结构,并结合可学习提示和Mahalanobis细化提升性能,实现在多个基准上优于现有无训练方法。
运动想象脑机接口中分布外检测的挑战
机构 * Department of Artificial Intelligence, University of Groningen(格罗宁根大学人工智能系)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 本文研究了运动想象脑机接口中分布外检测的挑战,通过训练模型并观察对未知类别的检测能力,发现高不确定性影响检测效果,MC Dropout表现最佳,高分类准确率可提升检测鲁棒性。
基于高斯过程的锂离子电池锂沉积检测:一种机器学习方法
机构 * Department of Mechanical and Aerospace Engineering, University of California, Davis(加州大学戴维斯分校机械与航空航天工程系) ; Department of Energy, Environmental & Chemical Engineering and the Institute of Materials Science and Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校能源、环境与化学工程系及材料科学与工程学院)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 本文提出基于高斯过程的锂沉积检测方法,通过直接建模充放电电压关系Q(V)作为随机过程,实现鲁棒检测,具有噪声感知推理、闭式导数和可扩展性等优势。
Comments Accepted for presentation at American Control Conference 2026 - ACC 2026 to be held in New Orleans, Louisiana
CHiL(L)Grader: 带校准置信度的循环人工参与简答评分
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL
AI总结 CHiL(L)Grader通过校准置信度估计和人类参与流程,实现高置信度自动评分与不确定情况的人工处理,提升AI辅助评分的可靠性。
量化治疗效应的偶然不确定性:一种新的正交学习者
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 本文提出了一种新的正交学习者(AU-learner),用于量化治疗效应的偶然不确定性,通过部分可识别性方法获得CDTE的精确界限,并展示了其在Neyman正交性和准Oracle效率方面的优势。
Journal ref Proceedings of the 38th Conference on Neural Information Processing Systems (NeurIPS 2024), Vancouver, Canada, 2024
自动驾驶系统推理的综述:开放挑战与新兴范式
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 本文综述了自动驾驶系统推理的挑战与新兴范式,提出认知层次分解驾驶任务,并系统化七个核心推理挑战,强调发展可验证的神经符号架构以解决高延迟推理与安全需求的矛盾。
Comments Published in TMLR (March 2026) | OpenReview: https://openreview.net/forum?id=XwQ7dc4bqn
通过去校准实现高效的可信预测
机构 * LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; DFKI (DSA)(德意志联邦防务研究所)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 本文提出了一种基于相对似然的高效可信预测方法,通过去校准技术实现对复杂模型的高效可信集生成。
R-WoM:基于检索的世界模型用于计算机使用代理
机构 * Rutgers University(罗杰斯大学) ; AWS Agentic AI(亚马逊敏捷人工智能)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 R-WoM通过整合外部检索知识提升世界模型能力,有效改善长周期模拟中的决策表现。
去噪揭示集群承诺作为幻觉类型的几何分隔器
机构 * Independent Researcher(独立研究者)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 通过去噪揭示集群承诺作为幻觉类型分离的几何分隔器,证明类型1/2边界是容量限制而非测量伪影。
Comments 9 pages, 2 figures, appendices (reproducibility, sample generation, additional figures)
回望与前行:用于多图像幻觉缓解的跨图像注意力校准与关注偏好学习
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Beijing Institute of Technology(北京理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文提出CAPL框架,通过跨图像注意力校准和偏好学习缓解多图像幻觉问题,提升模型对跨图像关联的建模能力,并在多个任务中取得稳定性能提升。
InfoGatherer: 通过证据检索和策略性提问进行原理化的信息获取
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; CIFAR AI Chair(CIFAR人工智能主席) ; University of Washington(华盛顿大学) ; Dalhousie University(达尔豪斯大学)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL
AI总结 InfoGatherer通过证据检索和策略性提问,结合结构化证据网络和Dempster-Shafer理论,实现原理化的信息获取,提升医疗和法律任务中的可靠性与可解释性。
Comments Under review
HART: 基于数据的幻觉归因与证据导向追踪用于大语言模型
机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 HART通过结构化建模方法提升大语言模型幻觉归因与证据追踪的准确性与可解释性。
考虑不确定性的子集选择以在分布偏移下实现稳健的视觉可解释性
机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG
AI总结 本文提出一种结合子模子集选择与层间梯度不确定性估计的方法,以提高在分布偏移下的视觉可解释性鲁棒性和保真度。
Comments Accepted to the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026
Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026
展望人机协同AI:连续性、张力与未来研究
机构 * University of Southern California(南加州大学) ; Arizona State University(亚利桑那州立大学) ; Peking University(北京大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文提出Team SA理论作为人机协同AI转型的整合锚点,探讨在适应性自主下持续对齐的挑战与未来研究方向。
代理多角色框架用于证据感知的虚假新闻检测
机构 * Dept. of CSE, Indian Institute of Technology Indore(计算机科学与工程系,印度理工学院印度奥尔德分校) ; Dept. of CSE, Indian Institute of Technology Patna(计算机科学与工程系,印度理工学院帕纳分校)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 本文提出AMPEND-LS框架,通过LLM与SLM协同作用,实现多模态虚假新闻检测,提升准确率和鲁棒性,增强信息安全性。
Comments 10 pages, 3 tables, 2 figures
查询级不确定性在大语言模型中
机构 * Imperial College London(伦敦帝国学院) ; Hasso Plattner Institute / University of Potsdam(霍普夫纳研究所/波茨坦大学) ; Telecom Paris, Institut Polytechnique de Paris(电信巴黎学院,巴黎理工学院) ; Soda, Inria Saclay(Soda,法国国家信息与自动化技术研究院萨克利实验室)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL
AI总结 本研究提出了一种无需训练的内部置信度方法,用于检测大语言模型的知识边界,通过查询级不确定性提高回答质量并降低计算成本。
Comments ICLR 2026
思想图景:可视化大语言模型的推理过程
机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体) ; Stanford University(斯坦福大学) ; Mila - Québec AI Institute(魁北克 AI 院) ; Université de Montréal(蒙特利尔大学) ; HEC Montréal(蒙特利尔 HEC 学院) ; Intel AI Lab(英特尔 AI 实验室)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 提出思想图景(LoT)可视化工具,用于分析大语言模型的推理轨迹,揭示推理模式并提升推理准确性。
Comments Accepted by ICLR 2026
模态差距的解剖:剖析端到端语音大语言模型的内部状态
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 本文研究了端到端语音大语言模型中语音与文本表示的跨层对齐特性,揭示了语音冗余性导致的模态差距问题,并提出未来需在标记或时间粒度上进行优化。
通过注意力动态理解LLMs中键值缓存压缩的物理原理
机构 * IIT Delhi, India(德里印度理工学院)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL
AI总结 通过分析LLMs中键值缓存压缩的物理机制,揭示了压缩对内部表示和语义可达性的影响,以及不同架构在路由动态上的差异。
随机系统中的稳健策略:打破获胜策略需要多大的代价?
机构 * Ruhr University Bochum Germany ; Nanyang Technological University, Singapore ; Technical University of Munich \& University of Konstanz Germany ; Ruhr University Bochum \& Radboud University Nijmegen Germany ; Masaryk University Czech Republic ; Ruhr University Bochum ; Technical University of Munich \& University of Konstanz ; Ruhr University Bochum \& Radboud University Nijmegen ; Masaryk University
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 本文研究了随机系统中稳健策略的定义与问题,探讨了马尔可夫决策过程和随机游戏中的可达性和安全目标,提出了一种基于干扰频率的稳健性度量方法。
Comments To appear in Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026