arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-13 至 2026-03-13 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 6 篇

2505.19240 2026-03-13 cs.CL cs.AI cs.LG 67%

LLLMs: A Data-Driven Survey of Evolving Research on Limitations of Large Language Models

LLMs: 一种数据驱动的关于大语言模型局限性研究演变的调查

Aida Kostikova, Zhipin Wang, Deidamea Bajri, Ole Pütz, Benjamin Paaßen, Steffen Eger

机构 * University of Bielefeld(比勒菲尔德大学) University of Technology Nuremberg(纽伦堡技术大学) University of Mannheim(曼海姆大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过数据驱动的方法分析了大语言模型局限性研究的演变趋势,揭示了推理、泛化等关键问题的热点及研究进展。

Comments ACM Computing Surveys (CSUR); 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11957 2026-03-13 cs.CL 57%

CHiL(L)Grader: Calibrated Human-in-the-Loop Short-Answer Grading

CHiL(L)Grader: 带校准置信度的循环人工参与简答评分

Pranav Raikote, Korbinian Randl, Ioanna Miliou, Athanasios Lakes, Panagiotis Papapetrou

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 CHiL(L)Grader通过校准置信度估计和人类参与流程,实现高置信度自动评分与不确定情况的人工处理,提升AI辅助评分的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03387 2026-03-13 cs.LG stat.ML 57%

Quantifying Aleatoric Uncertainty of the Treatment Effect: A Novel Orthogonal Learner

量化治疗效应的偶然不确定性:一种新的正交学习者

Valentyn Melnychuk, Stefan Feuerriegel, Mihaela van der Schaar

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种新的正交学习者(AU-learner),用于量化治疗效应的偶然不确定性,通过部分可识别性方法获得CDTE的精确界限,并展示了其在Neyman正交性和准Oracle效率方面的优势。

Journal ref Proceedings of the 38th Conference on Neural Information Processing Systems (NeurIPS 2024), Vancouver, Canada, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11093 2026-03-13 cs.AI cs.RO 57%

A Survey of Reasoning in Autonomous Driving Systems: Open Challenges and Emerging Paradigms

自动驾驶系统推理的综述:开放挑战与新兴范式

Kejin Yu, Yuhan Sun, Taiqiang Wu, Ruixu Zhang, Zhiqiang Lin, Yuxin Meng, Junjie Wang, Yujiu Yang

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文综述了自动驾驶系统推理的挑战与新兴范式,提出认知层次分解驾驶任务,并系统化七个核心推理挑战,强调发展可验证的神经符号架构以解决高延迟推理与安全需求的矛盾。

Comments Published in TMLR (March 2026) | OpenReview: https://openreview.net/forum?id=XwQ7dc4bqn

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10061 2026-03-13 cs.RO 50%

Decision-Aware Uncertainty Evaluation of Vision-Language Model-Based Early Action Anticipation for Human-Robot Interaction

基于视觉语言模型的早期动作预测在人机交互中的决策感知不确定性评估

Zhaoda Du, Michael Bowman, Qiaojie Zheng, Xiaoli Zhang

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本文提出了一种系统评估基于视觉语言模型的短期动作识别在人机交互中的不确定性方法,通过引入时间前缀评估协议和校准度量标准,揭示了部分观测下的误校准模式和失败模式,为信心门控的人机交互模块提供了可靠性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18463 2026-03-13 cs.CV 50%

Decoupling Perception from Reasoning for Hallucination-Resistant Video Understanding

解耦感知与推理以实现抗幻觉的视频理解

Bowei Pu, Chuanbin Liu, Yifan Ge, Peicheng Zhou, Yiwei Sun, Zhiying Lu, Zhangchi Hu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出DPL模型,通过解耦感知与推理以提升视频理解的抗幻觉能力,引入感知奖励和FAE评估器,有效提高训练后性能和数据效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏