arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1738 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1738 篇

2408.08448 2026-03-02 cs.LG 57%

Exploring Cross-model Neuronal Correlations in the Context of Predicting Model Performance and Generalizability

探索预测模型性能和泛化能力的跨模型神经元相关性

Haniyeh Ehsani Oskouie, Sajjad Ghiasvand, Lionel Levine, Majid Sarrafzadeh

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出通过跨模型神经元相关性评估模型性能和泛化能力,验证了表示对齐作为轻量级兼容性检查的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22814 2026-02-27 cs.AI cs.HC 57%

When Should an AI Act? A Human-Centered Model of Scene, Context, and Behavior for Agentic AI Design

AI何时行动?面向智能体AI设计的场景、情境与行为的人本模型

Soyoung Jung, Daehoo Yoon, Sung Gyu Koh, Young Hwan Kim, Yehan Ahn, Sung Park

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种人本模型,用于设计具有情境敏感性和判断力的智能体AI系统,通过整合场景、情境和人类行为因素,指导智能体的干预行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21701 2026-02-26 cs.LG physics.data-an stat.ML 57%

Learning Complex Physical Regimes via Coverage-oriented Uncertainty Quantification: An application to the Critical Heat Flux

通过覆盖导向的不确定性量化学习复杂物理区域:应用于临界热流的应用

Michele Cazzola, Alberto Ghione, Lucia Sargentini, Julien Nespoulous, Riccardo Finotello

机构 * Université Paris Saclay, Cea(巴黎萨克雷大学,CEA)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 通过覆盖导向的不确定性量化方法,提升对复杂物理区域(如临界热流)的建模能力,实现高预测精度和动态适应的不确定性估计。

Comments 34 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21588 2026-02-26 cs.LG cs.CE 57%

ABM-UDE: Developing Surrogates for Epidemic Agent-Based Models via Scientific Machine Learning

ABM-UDE:通过科学机器学习开发用于流行病代理模型的替代方案

Sharv Murgai, Utkarsh Utkarsh, Kyle C. Nguyen, Alan Edelman, Erin C. S. Acquesta, Christopher Vincent Rackauckas

机构 * Monta Vista High School(蒙塔维斯塔高中) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Sandia National Laboratories(桑塔纳国家实验室)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 ABM-UDE通过科学机器学习开发流行病代理模型的替代方案,利用UDEs学习接触率参数化,提升预测精度与可靠性,实现快速、可解释的流行病模拟。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05598 2026-02-25 cs.IR cs.AI 57%

AgentDR: Dynamic Recommendation with Implicit Item-Item Relations via LLM-based Agents

AgentDR: 通过基于LLM的代理进行动态推荐:利用隐式物品-物品关系

Mingdai Yang, Nurendra Choudhary, Jiangshu Du, Edward W. Huang, Philip S. Yu, Karthik Subbian, Danai Koutra

机构 * Amazon(亚马逊) University of Michigan(密歇根大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 AgentDR通过基于LLM的代理利用隐式物品-物品关系,结合记忆机制和提示策略,提升动态推荐的全排名性能和相关性。

Comments 12 pages, accepted by WWW'26 as long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18763 2026-02-24 cs.CV cs.AI 57%

TAG: Thinking with Action Unit Grounding for Facial Expression Recognition

TAG:基于动作单元的面部表情识别中的思维

Haobo Lin, Tianyi Bai, Jiajun Zhang, Xuanhao Chang, Sheng Lu, Fangming Gu, Zengjie Hu, Wentao Zhang

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 TAG通过基于动作单元的视觉-语言框架,提升面部表情识别的推理可信度和视觉一致性。

Comments 33 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16019 2026-02-19 cs.CV cs.AI 57%

MedProbCLIP: Probabilistic Adaptation of Vision-Language Foundation Model for Reliable Radiograph-Report Retrieval

MedProbCLIP: 基于概率适应的视觉-语言基础模型用于可靠放射影像-报告检索

Ahmad Elallaf, Yu Zhang, Yuktha Priya Masupalli, Jeong Yang, Young Lee, Zechun Cao, Gongbo Liang

机构 * Texas A&M University-San Antonio(德克萨斯A&M大学-圣安东尼奥分校) Boise State University(博伊州立大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 MedProbCLIP 通过概率适应提升放射影像与报告检索的可靠性,优于现有基线方法。

Comments Accepted to the 2026 Winter Conference on Applications of Computer Vision (WACV) Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14853 2026-02-17 cs.AI 57%

Uncertainty-Aware Measurement of Scenario Suite Representativeness for Autonomous Systems

面向自主系统的场景套件代表性不确定性测量

Robab Aghazadeh Chakherlou, Siddartha Khastgir, Xingyu Zhao, Jerein Jeyachandran, Shufeng Chen

机构 * WMG, University of Warwick, Coventry, UK(沃森学院,沃里克大学,科文特里,英国)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种概率方法,通过比较场景套件与预期运营领域特征分布,量化自主系统训练数据的代表性,并利用不精确贝叶斯方法处理有限数据和不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13567 2026-02-17 cs.CL 57%

DistillLens: Symmetric Knowledge Distillation Through Logit Lens

DistillLens: 通过Logit Lens实现对称的知识蒸馏

Manish Dhakal, Uthman Jinadu, Anjila Budathoki, Rajshekhar Sunderraman, Yi Ding

机构 * Georgia State University(佐治亚州立大学) Auburn University(阿肯色大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 DistillLens通过Logit Lens对称对齐学生和教师模型的思维过程,提升知识蒸馏性能。

Comments Knowledge Distillation in LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06014 2026-02-16 cs.CV cs.LG 57%

Post-hoc Probabilistic Vision-Language Models

事后概率视觉-语言模型

Anton Baumann, Rui Li, Marcus Klasson, Santeri Mentu, Shyamgopal Karthik, Zeynep Akata, Arno Solin, Martin Trapp

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出一种无需额外训练的VLMs事后不确定性估计方法,通过贝叶斯后验近似和余弦相似度不确定性量化,提升主动学习效率和预测可靠性。

Comments Published at ICLR 2026. Project page: https://aaltoml.github.io/BayesVLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11217 2026-02-13 cs.LG 57%

The Magic Correlations: Understanding Knowledge Transfer from Pretraining to Supervised Fine-Tuning

魔法相关性:从预训练到监督微调的知识转移理解

Simin Fan, Dimitris Paparas, Natasha Noy, Binbin Xiong, Noveen Sachdeva, Berivan Isik

机构 * Google Research(谷歌研究) EPFL(瑞士联邦理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究通过分析预训练到监督微调的知识转移,揭示了不同能力类别、基准测试和模型规模间转移可靠性的差异,为模型开发和数据整理提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06025 2026-02-12 cs.LG stat.ML 57%

Out-of-Distribution Detection from Small Training Sets using Bayesian Neural Network Classifiers

从少量训练集出发利用贝叶斯神经网络分类器进行分布外检测

Kevin Raina, Tanya Schmah

机构 * Department of Mathematics and Statistics University of Ottawa(数学与统计学系 马尼托瓦大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于贝叶斯神经网络的分布外检测方法,通过预期logit向量生成得分,并在MNIST和CIFAR-10数据集上验证了其在小训练集下的优越性能。

Comments British Machine Vision Conference (BMVC) 2025; 18 pages, 6 figures, 3 tables

Journal ref https://bmvc2025.bmva.org/proceedings/1187/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12814 2026-02-11 cs.SI cs.CY 57%

Tiered Anonymity on Social-Media Platforms as a Countermeasure against Deepfakes and LLM-Driven Mass Misinformation

社交媒体平台的分层匿名性:作为对抗深度伪造和大语言模型驱动的虚假信息的对策

David Khachaturov, Roxanne Schnyder, Robert Mullins

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CY

AI总结 本文提出通过三级匿名框架应对深度伪造和大语言模型驱动的虚假信息,通过影响力评分区分用户层级并实施差异化隐私保护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08693 2026-02-10 cs.LG 57%

Reasoning aligns language models to human cognition

推理使语言模型对齐人类认知

Gonçalo Guiomar, Elia Torre, Pehuen Moure, Victoria Shavina, Mario Giulianelli, Shih-Chii Liu, Valerio Mante

机构 * ETH AI Center, Zürich, Switzerland ETH Zürich, Switzerland Institute for Neuroinformatics, University of Zürich \& ETH Zürich, Switzerland University College London, London, United Kingdom

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究通过主动概率推理任务揭示语言模型与人类在不确定性决策中的差异,发现延长推理能显著提升推理性能,但对信息获取影响有限。

Comments 38 pages, 4 main figures, multiple appendix figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07674 2026-02-10 cs.LG 57%

ElliCE: Efficient and Provably Robust Algorithmic Recourse via the Rashomon Sets

ElliCE: 通过Rashomon集实现高效且可证明稳健的算法补救

Bohdan Turbal, Iryna Voitsitska, Lesia Semenova

机构 * Princeton University(普林斯顿大学) Ukrainian Catholic University(乌克兰天主教大学) Rutgers University(罗格斯大学) Taras Shevchenko National University of Kyiv(塔拉斯·谢甫琴科基斯林国立大学) Microsoft Research NYC(微软研究院纽约)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 ElliCE通过椭球近似Rashomon集,提供高效且可证明稳健的算法补救方法,提升反事实解释的鲁棒性和灵活性。

Journal ref The Thirty-ninth Annual Conference on Neural Information Processing Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21083 2026-02-10 cs.AI 57%

OpenSec: Measuring Incident Response Agent Calibration Under Adversarial Evidence

OpenSec: 在对抗性证据下评估事件响应代理的校准

Jarrod Barnes

机构 * Jarrod Barnes

专题命中 幻觉与事实性 :prompt injection(abstract);分类 cs.AI

AI总结 OpenSec通过双控制强化学习环境评估事件响应代理在对抗性证据下的校准能力,发现前沿模型存在过度触发问题,校准差距体现在克制而非检测。

Comments 7 pages, 3 figures, 3 tables. Code: https://github.com/jbarnes850/opensec-env. Dataset: https://huggingface.co/datasets/Jarrodbarnes/opensec-seeds

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06570 2026-02-09 cs.CL 57%

Baichuan-M3: Modeling Clinical Inquiry for Reliable Medical Decision-Making

Baichuan-M3:用于可靠医疗决策的临床查询建模

M3 Team, Chengfeng Dou, Fan Yang, Fei Li, Jiyuan Jia, Qiang Ju, Shuai Wang, Tianpeng Li, Xiangrong Zeng, Yijie Zhou, Hongda Zhang, Jinyang Tai, Linzhuang Sun, Peidong Guo, Yichuan Mo, Xiaochuan Wang, Hengfu Cui, Zhishou Zhang

机构 * Baichuan-M3 Team(Baichuan-M3团队)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 Baichuan-M3通过建模临床查询流程,实现了医疗决策支持的可靠性和准确性,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26829 2026-02-09 cs.LG cs.CR 57%

Layer of Truth: Probing Belief Shifts under Continual Pre-Training Poisoning

真相层:在持续预训练中毒下的信念转变探究

Svetlana Churina, Niranjan Chebrolu, Kokil Jaidka

机构 * Centre for Trusted Internet \& Community, National University of Singapore, Singapore

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究揭示了持续预训练中虚假信息如何取代模型内部事实表示,通过实验发现中毒对模型信念的影响及可逆性,强调了对事实完整性进行监控的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05456 2026-02-06 cs.RO cs.AI cs.SY eess.SY 57%

Ontology-Driven Robotic Specification Synthesis

基于本体的机器人规范综合

Maksym Figat, Ryan M. Mackey, Michel D. Ingham

机构 * Warsaw University of Technology (WUT)(华沙技术大学) NASA Jet Propulsion Laboratory (JPL)(美国国家航空航天局喷气推进实验室) California Institute of Technology(加州理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文提出基于本体的RSTM2方法,用于安全关键任务中机器人系统规范综合,通过随机时Petri网实现多层级蒙特卡洛模拟,支持架构权衡与资源分配。

Comments 8 pages, 9 figures, 3 tables, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01522 2026-02-03 cs.LG cs.CV 57%

When Is Rank-1 Enough? Geometry-Guided Initialization for Parameter-Efficient Fine-Tuning

何时秩-1足够?基于几何的初始化方法用于参数高效微调

Haoran Zhao, Soyeon Caren Han, Eduard Hovy

机构 * School of Computing and Information Systems, University of Melbourne, Melbourne, Australia(计算机与信息系统学院,墨尔本大学,墨尔本,澳大利亚)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出Gap-Init方法,通过几何感知初始化稳定秩-1 LoRA微调,证明初始对齐对训练稳定性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01078 2026-02-03 cs.AI 57%

AutoHealth: An Uncertainty-Aware Multi-Agent System for Autonomous Health Data Modeling

AutoHealth:一种面向自主健康数据建模的不确定性感知多智能体系统

Tong Xia, Weibin Li, Gang Liu, Yong Li

机构 * Vanke School of Public Health, Tsinghua University(清华大学万科公共卫生学院) Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心电子工程系) Tsinghua University, China(清华大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 AutoHealth通过多智能体系统自主建模健康数据,提升预测性能和不确定性估计,有效解决健康数据建模中的泛化和可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00850 2026-02-03 cs.CY 57%

PS$^2$: Parameterized Control for Fine-Grained Student Proficiency Simulation

PS$^2$: 基于参数化控制的细粒度学生能力模拟

Ruochen Liu, Zhiyuan Wen, Hao Yan, Jun Yin, Senzhang Wang, Jiannong Cao

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY

AI总结 PS$^2$提出一种基于参数化控制的细粒度学生能力模拟方法,通过混合比率在强弱模型间插值得到更精确的能力模拟,提升学生行为相似性和题目难度预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19145 2026-02-03 stat.ME cs.LG stat.AP 57%

Do Large Language Models (Really) Need Statistical Foundations?

大型语言模型(真的需要统计基础吗?

Weijie Su

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文探讨大型语言模型是否需要统计学基础,指出其统计本质和黑箱特性使统计方法成为必要,并强调统计学界在LLMs研究中的重要性。

Comments Accepted at The Annals of Applied Statistics; Added discussions on more topics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23188 2026-02-02 cs.CL 57%

Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive Neuroscience

受认知神经科学启发的深度搜索与分层元认知监控

Zhongxiang Sun, Qipeng Wang, Weijie Yu, Jingxuan Yang, Haolang Lu, Jun Xu

机构 * Gaoling School of Artificial Intelligence\ University of China Beijing China School of Information Technology Search Applications Department, Tencent Beijing China Beijing University of Posts Gaoling School of Artificial Intelligence\ University of China Search Applications Department, Tencent

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本研究提出DS-MCM框架,通过分层元认知监控机制提升深度搜索的性能和鲁棒性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22595 2026-02-02 cs.AI 57%

Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR

学得更多,用得更少:不确定性一致性引导的查询选择用于RLVR

Hao Yi, Yulan Hu, Xin Li, Sheng Ouyang, Lizhong Ding, Yong Liu

机构 * Renmin University of China(中国人民大学) Gaoling School of Artificial Intelligence(北京人工智能学院) Amap, Alibaba Group(阿里集团阿里的地图部门) School of Computer Science & Technology(计算机科学与技术学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于不确定性一致性的查询选择方法,通过改进RLVR的样本选择策略,减少查询预算,提升推理任务的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11352 2026-02-02 cs.AI cs.FL 57%

Foundation Models for Logistics: Toward Certifiable, Conversational Planning Interfaces

物流领域的基础模型:迈向可验证、对话式规划界面

Yunhao Yang, Neel P. Bhatt, Christian Ellis, Samuel Li, Alvaro Velasquez, Zhangyang Wang, Ufuk Topcu

机构 * Neurosymbolic Intelligence(神经符号智能) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Colorado Boulder(科罗拉多大学波德分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于神经符号框架的视觉-语言物流代理,通过自然语言对话和可验证保证实现可信赖的物流规划决策,模型在少量训练样本下实现了高效且准确的物流规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21113 2026-01-30 cs.AI cs.MA 57%

Planner-Auditor Twin: Agentic Discharge Planning with FHIR-Based LLM Planning, Guideline Recall, Optional Caching and Self-Improvement

计划-审核双胞胎:基于FHIR的LLM计划、指南回忆、可选缓存和自我改进的代理出院计划

Kaiyuan Wu, Aditya Nagori, Rishikesan Kamaleswaran

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 基于FHIR的LLM计划与审核框架,通过自我改进和缓存优化,提升临床出院计划的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17865 2026-01-30 cs.CL 57%

D-Models and E-Models: Diversity-Stability Trade-offs in the Sampling Behavior of Large Language Models

D模型和E模型:大语言模型采样行为中的多样性-稳定性权衡

Jia Gu, Liang Pang, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 研究揭示了大语言模型中D模型与E模型在采样行为上的多样性-稳定性权衡,为任务应用中的模型选择提供了指导。

Comments 12 pages, 10 figures. Accepted by WWW'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16468 2026-01-29 cs.AI 57%

Quantifying Fidelity: A Decisive Feature Approach to Comparing Synthetic and Real Imagery

量化保真度:一种基于决定性特征的方法用于比较合成与真实图像

Danial Safaei, Siddartha Khastgir, Mohsen Alirezaei, Jeroen Ploeg, Son Tong, Chih-Hong Cheng, Xingyu Zhao

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文提出决定性特征保真度(DFF)方法,用于评估合成与真实图像的保真度差异,通过分析决策证据一致性提升模拟器保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17986 2026-01-27 cs.LG 57%

Federated learning for unpaired multimodal data through a homogeneous transformer model

通过同质Transformer模型实现无配对多模态数据的联邦学习

Anders Eklund

机构 * Department of Biomedical Engineering, Linköping University, Sweden(_linköping大学生物医学工程系) Department of Computer and Information Science, Linköping University, Sweden(_linköping大学计算机与信息科学系) Center for Medical Image Science and Visualization (CMIV), Linköping University, Sweden(_linköping大学医学影像科学与可视化中心)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出通过同质Transformer模型实现联邦学习,解决无配对多模态数据的训练问题,通过公共锚点对齐和子空间稳定化微调方法,在不传输私有数据的情况下实现全局模型统一表示。

详情

展开后加载摘要…

URL PDF HTML 收藏