arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-17 至 2026-03-17 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 9 篇

2603.13255 2026-03-17 cs.CY cs.AI 88%

The Ghost in the Grammar: Methodological Anthropomorphism in AI Safety Evaluations

语法中的幽灵:人工智能安全评估中的方法论人类学

Mariana Lins Costa

专题命中 幻觉与事实性 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文通过分析近期技术报告,探讨人工智能安全领域中对AI系统投射意图、人格等属性的隐性人类学倾向,质疑其对安全评估方法论的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15397 2026-03-17 cs.CR cs.AI 85%

SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and Calibration

SFCoT:通过主动安全评估和校准实现更安全的推理链

Yu Pan, Wenlong Yu, Tiejun Wu, Xiaohu Ye, Qiannan Si, Guangquan Xu, Bin Wu

机构 * Department College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) NSFOCUS Technologies Group Co., Ltd.(NSFOCUS技术集团有限公司) College of Management and Economics(管理与经济学院) School of Cyber Security(网络安全学院)

专题命中 幻觉与事实性 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出SFCoT框架,通过实时评估和校准潜在不安全的推理步骤,有效降低对抗攻击成功率,提升大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11248 2026-03-17 cs.LG cs.CL 62%

Reasoning-Grounded Natural Language Explanations for Language Models

基于推理的自然语言解释方法用于语言模型

Vojtech Cahlik, Rodrigo Alves, Pavel Kordik

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种通过推理过程生成可信自然语言解释的方法,通过将推理过程转化为token序列并解码为自然语言,提升解释的准确性与答案质量。

Comments (v2) Added acknowledgements section

Journal ref In: Guidotti, R., Schmid, U., Longo, L. (eds) Explainable Artificial Intelligence. xAI 2025. Communications in Computer and Information Science, vol 2578. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13676 2026-03-17 cs.AI 57%

TheraAgent: Multi-Agent Framework with Self-Evolving Memory and Evidence-Calibrated Reasoning for PET Theranostics

TheraAgent:具有自我进化记忆和证据校准推理的多智能体框架用于PET治疗诊断

Zhihao Chen, Jiahui Wang, Yizhou Chen, Xiaozhong Ji, Xiaobin Hu, Jimin Hong, Wolfram Andreas Bosbach, Axel Rominger, Ali Afshar-Oromieh, Hongming Shan, Kuangyu Shi

机构 * Fudan University(复旦大学) University of Bern(伯尔尼大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 TheraAgent通过自我进化记忆和证据校准推理,解决PET治疗诊断中数据稀缺、信息异构和证据推理的问题,实现75.7%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13374 2026-03-17 cs.CV cs.AI 57%

Geometry-Aware Semantic Reasoning for Training Free Video Anomaly Detection

基于几何的语义推理用于无训练视频异常检测

Ali Zia, Usman Ali, Muhammad Umer Ramzan, Hamza Abid, Abdul Rehman, Wei Xiang

机构 * School of Computing, Engineering \& Mathematical Sciences, La Trobe University, Melbourne, Australia School of Engineering Applied Sciences, GIFT University, Gujranwala 52250, Pakistan

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出MM-VAD框架,通过将异常检测转为适应性测试时推理,利用双曲空间保留层次结构,并结合可学习提示和Mahalanobis细化提升性能,实现在多个基准上优于现有无训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13324 2026-03-17 cs.LG 57%

The Challenge of Out-Of-Distribution Detection in Motor Imagery BCIs

运动想象脑机接口中分布外检测的挑战

Merlijn Quincent Mulder, Matias Valdenegro-Toro, Andreea Ioana Sburlea, Ivo Pascal de Jong

机构 * Department of Artificial Intelligence, University of Groningen(格罗宁根大学人工智能系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文研究了运动想象脑机接口中分布外检测的挑战,通过训练模型并观察对未知类别的检测能力,发现高不确定性影响检测效果,MC Dropout表现最佳,高分类准确率可提升检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26234 2026-03-17 cs.LG cs.SY eess.SY 57%

Machine Learning Detection of Lithium Plating in Lithium-ion Cells: A Gaussian Process Approach

基于高斯过程的锂离子电池锂沉积检测:一种机器学习方法

Ayush Patnaik, Jackson Fogelquist, Adam B Zufall, Yiwei Ji, Stephen K Robinson, Peng Bai, Xinfan Lin

机构 * Department of Mechanical and Aerospace Engineering, University of California, Davis(加州大学戴维斯分校机械与航空航天工程系) Department of Energy, Environmental & Chemical Engineering and the Institute of Materials Science and Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校能源、环境与化学工程系及材料科学与工程学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出基于高斯过程的锂沉积检测方法,通过直接建模充放电电压关系Q(V)作为随机过程,实现鲁棒检测,具有噪声感知推理、闭式导数和可扩展性等优势。

Comments Accepted for presentation at American Control Conference 2026 - ACC 2026 to be held in New Orleans, Louisiana

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15557 2026-03-17 cs.CV 50%

Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models

Lie的解剖:一种多阶段诊断框架,用于追踪视觉-语言模型中的幻觉

Lexiang Xiong, Qi Li, Jingwen Ye, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学)

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本文提出一种多阶段诊断框架,通过动态认知轨迹分析视觉-语言模型中的幻觉问题,结合几何信息双重视角,实现高效且鲁棒的幻觉检测,提升模型透明度和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16443 2026-03-17 cs.CV 50%

VGGT-Long: Chunk it, Loop it, Align it -- Pushing VGGT's Limits on Kilometer-scale Long RGB Sequences

VGGT-Long:分块、循环、对齐——在千米级长RGB序列上推动VGGT的极限

Kai Deng, Zexin Ti, Jiawei Xu, Jian Yang, Jin Xie

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出VGGT-Long,通过分块处理、重叠对齐和轻量循环闭合优化,解决现有模型的可扩展性瓶颈,实现千米级户外环境的单目3D重建。

Comments IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏