arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1732 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1732 篇

2501.10385 2025-07-08 cs.CY cond-mat.mtrl-sci cs.AI physics.ins-det 73%

Autonomous Microscopy Experiments through Large Language Model Agents

Indrajeet Mandal, Jitendra Soni, Mohd Zaki, Morten M. Smedskjaer, Katrin Wondraczek, Lothar Wondraczek, Nitya Nand Gosvami, N. M. Anoop Krishnan

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09176 2025-06-12 cs.AI cs.LG cs.RO 73%

Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism

Haoyuan Cai, Zhenghao Peng, Bolei Zhou

机构 * Computer Science Department, University of California, Los Angeles (UCLA)(加州大学洛杉矶分校计算机科学系)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

Comments ICML 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21589 2025-05-29 cs.CV cs.AI cs.LG 73%

Do you see what I see? An Ambiguous Optical Illusion Dataset exposing limitations of Explainable AI

Carina Newen, Luca Hinkamp, Maria Ntonti, Emmanuel Müller

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

Comments 19 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14815 2025-03-11 cs.AI cs.LG cs.RO 73%

Distributionally Robust Statistical Verification with Imprecise Neural Networks

Souradeep Dutta, Michele Caprio, Vivian Lin, Matthew Cleaveland, Kuk Jin Jang, Ivan Ruchkin, Oleg Sokolsky, Insup Lee

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15820 2025-03-05 cs.AI cs.LG stat.ML 73%

Universal AI maximizes Variational Empowerment

Yusuke Hayashi, Koichi Takahashi

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

Comments 9 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06730 2024-07-11 cs.CL cs.AI cs.HC 73%

Relying on the Unreliable: The Impact of Language Models' Reluctance to Express Uncertainty

Kaitlyn Zhou, Jena D. Hwang, Xiang Ren, Maarten Sap

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments ACL 2024 (Camera Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13261 2024-07-10 cs.CL cs.AI 73%

BeHonest: Benchmarking Honesty in Large Language Models

Steffi Chern, Zhulin Hu, Yuqing Yang, Ethan Chern, Yuan Guo, Jiahe Jin, Binjie Wang, Pengfei Liu

专题命中 幻觉与事实性 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09259 2024-06-04 cs.CL cs.AI 73%

SyntaxShap: Syntax-aware Explainability Method for Text Generation

Kenza Amara, Rita Sevastjanova, Mennatallah El-Assady

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01954 2024-04-16 cs.CL cs.AI 73%

HyperCLOVA X Technical Report

Kang Min Yoo, Jaegeun Han, Sookyo In, Heewon Jeon, Jisu Jeong, Jaewook Kang, Hyunwook Kim, Kyung-Min Kim, Munhyong Kim, Sungju Kim, Donghyun Kwak, Hanock Kwak, Se Jung Kwon, Bado Lee, Dongsoo Lee, Gichang Lee, Jooho Lee, Baeseong Park, Seongjin Shin, Joonsang Yu, Seolki Baek, Sumin Byeon, Eungsup Cho, Dooseok Choe, Jeesung Han, Youngkyun Jin, Hyein Jun, Jaeseung Jung, Chanwoong Kim, Jinhong Kim, Jinuk Kim, Dokyeong Lee, Dongwook Park, Jeong Min Sohn, Sujung Han, Jiae Heo, Sungju Hong, Mina Jeon, Hyunhoon Jung, Jungeun Jung, Wangkyo Jung, Chungjoon Kim, Hyeri Kim, Jonghyun Kim, Min Young Kim, Soeun Lee, Joonhee Park, Jieun Shin, Sojin Yang, Jungsoon Yoon, Hwaran Lee, Sanghwan Bae, Jeehwan Cha, Karl Gylleus, Donghoon Ham, Mihak Hong, Youngki Hong, Yunki Hong, Dahyun Jang, Hyojun Jeon, Yujin Jeon, Yeji Jeong, Myunggeun Ji, Yeguk Jin, Chansong Jo, Shinyoung Joo, Seunghwan Jung, Adrian Jungmyung Kim, Byoung Hoon Kim, Hyomin Kim, Jungwhan Kim, Minkyoung Kim, Minseung Kim, Sungdong Kim, Yonghee Kim, Youngjun Kim, Youngkwan Kim, Donghyeon Ko, Dughyun Lee, Ha Young Lee, Jaehong Lee, Jieun Lee, Jonghyun Lee, Jongjin Lee, Min Young Lee, Yehbin Lee, Taehong Min, Yuri Min, Kiyoon Moon, Hyangnam Oh, Jaesun Park, Kyuyon Park, Younghun Park, Hanbae Seo, Seunghyun Seo, Mihyun Sim, Gyubin Son, Matt Yeo, Kyung Hoon Yeom, Wonjoon Yoo, Myungin You, Doheon Ahn, Homin Ahn, Joohee Ahn, Seongmin Ahn, Chanwoo An, Hyeryun An, Junho An, Sang-Min An, Boram Byun, Eunbin Byun, Jongho Cha, Minji Chang, Seunggyu Chang, Haesong Cho, Youngdo Cho, Dalnim Choi, Daseul Choi, Hyoseok Choi, Minseong Choi, Sangho Choi, Seongjae Choi, Wooyong Choi, Sewhan Chun, Dong Young Go, Chiheon Ham, Danbi Han, Jaemin Han, Moonyoung Hong, Sung Bum Hong, Dong-Hyun Hwang, Seongchan Hwang, Jinbae Im, Hyuk Jin Jang, Jaehyung Jang, Jaeni Jang, Sihyeon Jang, Sungwon Jang, Joonha Jeon, Daun Jeong, Joonhyun Jeong, Kyeongseok Jeong, Mini Jeong, Sol Jin, Hanbyeol Jo, Hanju Jo, Minjung Jo, Chaeyoon Jung, Hyungsik Jung, Jaeuk Jung, Ju Hwan Jung, Kwangsun Jung, Seungjae Jung, Soonwon Ka, Donghan Kang, Soyoung Kang, Taeho Kil, Areum Kim, Beomyoung Kim, Byeongwook Kim, Daehee Kim, Dong-Gyun Kim, Donggook Kim, Donghyun Kim, Euna Kim, Eunchul Kim, Geewook Kim, Gyu Ri Kim, Hanbyul Kim, Heesu Kim, Isaac Kim, Jeonghoon Kim, Jihye Kim, Joonghoon Kim, Minjae Kim, Minsub Kim, Pil Hwan Kim, Sammy Kim, Seokhun Kim, Seonghyeon Kim, Soojin Kim, Soong Kim, Soyoon Kim, Sunyoung Kim, Taeho Kim, Wonho Kim, Yoonsik Kim, You Jin Kim, Yuri Kim, Beomseok Kwon, Ohsung Kwon, Yoo-Hwan Kwon, Anna Lee, Byungwook Lee, Changho Lee, Daun Lee, Dongjae Lee, Ha-Ram Lee, Hodong Lee, Hwiyeong Lee, Hyunmi Lee, Injae Lee, Jaeung Lee, Jeongsang Lee, Jisoo Lee, Jongsoo Lee, Joongjae Lee, Juhan Lee, Jung Hyun Lee, Junghoon Lee, Junwoo Lee, Se Yun Lee, Sujin Lee, Sungjae Lee, Sungwoo Lee, Wonjae Lee, Zoo Hyun Lee, Jong Kun Lim, Kun Lim, Taemin Lim, Nuri Na, Jeongyeon Nam, Kyeong-Min Nam, Yeonseog Noh, Biro Oh, Jung-Sik Oh, Solgil Oh, Yeontaek Oh, Boyoun Park, Cheonbok Park, Dongju Park, Hyeonjin Park, Hyun Tae Park, Hyunjung Park, Jihye Park, Jooseok Park, Junghwan Park, Jungsoo Park, Miru Park, Sang Hee Park, Seunghyun Park, Soyoung Park, Taerim Park, Wonkyeong Park, Hyunjoon Ryu, Jeonghun Ryu, Nahyeon Ryu, Soonshin Seo, Suk Min Seo, Yoonjeong Shim, Kyuyong Shin, Wonkwang Shin, Hyun Sim, Woongseob Sim, Hyejin Soh, Bokyong Son, Hyunjun Son, Seulah Son, Chi-Yun Song, Chiyoung Song, Ka Yeon Song, Minchul Song, Seungmin Song, Jisung Wang, Yonggoo Yeo, Myeong Yeon Yi, Moon Bin Yim, Taehwan Yoo, Youngjoon Yoo, Sungmin Yoon, Young Jin Yoon, Hangyeol Yu, Ui Seon Yu, Xingdong Zuo, Jeongin Bae, Joungeun Bae, Hyunsoo Cho, Seonghyun Cho, Yongjin Cho, Taekyoon Choi, Yera Choi, Jiwan Chung, Zhenghui Han, Byeongho Heo, Euisuk Hong, Taebaek Hwang, Seonyeol Im, Sumin Jegal, Sumin Jeon, Yelim Jeong, Yonghyun Jeong, Can Jiang, Juyong Jiang, Jiho Jin, Ara Jo, Younghyun Jo, Hoyoun Jung, Juyoung Jung, Seunghyeong Kang, Dae Hee Kim, Ginam Kim, Hangyeol Kim, Heeseung Kim, Hyojin Kim, Hyojun Kim, Hyun-Ah Kim, Jeehye Kim, Jin-Hwa Kim, Jiseon Kim, Jonghak Kim, Jung Yoon Kim, Rak Yeong Kim, Seongjin Kim, Seoyoon Kim, Sewon Kim, Sooyoung Kim, Sukyoung Kim, Taeyong Kim, Naeun Ko, Bonseung Koo, Heeyoung Kwak, Haena Kwon, Youngjin Kwon, Boram Lee, Bruce W. Lee, Dagyeong Lee, Erin Lee, Euijin Lee, Ha Gyeong Lee, Hyojin Lee, Hyunjeong Lee, Jeeyoon Lee, Jeonghyun Lee, Jongheok Lee, Joonhyung Lee, Junhyuk Lee, Mingu Lee, Nayeon Lee, Sangkyu Lee, Se Young Lee, Seulgi Lee, Seung Jin Lee, Suhyeon Lee, Yeonjae Lee, Yesol Lee, Youngbeom Lee, Yujin Lee, Shaodong Li, Tianyu Liu, Seong-Eun Moon, Taehong Moon, Max-Lasse Nihlenramstroem, Wonseok Oh, Yuri Oh, Hongbeen Park, Hyekyung Park, Jaeho Park, Nohil Park, Sangjin Park, Jiwon Ryu, Miru Ryu, Simo Ryu, Ahreum Seo, Hee Seo, Kangdeok Seo, Jamin Shin, Seungyoun Shin, Heetae Sin, Jiangping Wang, Lei Wang, Ning Xiang, Longxiang Xiao, Jing Xu, Seonyeong Yi, Haanju Yoo, Haneul Yoo, Hwanhee Yoo, Liang Yu, Youngjae Yu, Weijie Yuan, Bo Zeng, Qian Zhou, Kyunghyun Cho, Jung-Woo Ha, Joonsuk Park, Jihyun Hwang, Hyoung Jo Kwon, Soonyong Kwon, Jungyeon Lee, Seungho Lee, Seonghyeon Lim, Hyunkyung Noh, Seungho Choi, Sang-Woo Lee, Jung Hwa Lim, Nako Sung

专题命中 幻觉与事实性 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

Comments 44 pages; updated authors list and fixed author names

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04590 2024-03-19 cs.LG cs.AI 73%

Proximity-Informed Calibration for Deep Neural Networks

Miao Xiong, Ailin Deng, Pang Wei Koh, Jiaying Wu, Shen Li, Jianqing Xu, Bryan Hooi

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

Comments The paper is accepted by NeurIPS 2023. The code is available at: https://github.com/MiaoXiong2320/ProximityBias-Calibration

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13657 2024-01-26 cs.LG cs.AI 73%

Inadequacy of common stochastic neural networks for reliable clinical decision support

Adrian Lindenmeyer, Malte Blattmann, Stefan Franke, Thomas Neumuth, Daniel Schneider

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

Comments Keywords: probabilistic inference, uncertainty estimation, uncertainty quantification, epistemic uncertainty, clinical prognosis, electronic health records

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.01848 2020-08-06 cs.CY cs.AI 73%

Forecasting AI Progress: A Research Agenda

Ross Gruetzemacher, Florian Dorner, Niko Bernaola-Alvarez, Charlie Giattino, David Manheim

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

Comments 40 pages including Appendices, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00072 2025-06-03 cs.CY cs.AI cs.CL cs.LG 72%

Evaluating Prompt Engineering Techniques for Accuracy and Confidence Elicitation in Medical LLMs

Nariman Naderi, Zahra Atf, Peter R Lewis, Aref Mahjoub far, Seyed Amir Ahmad Safavi-Naini, Ali Soroush

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY;trustworthy(comments)

Comments This paper was accepted for presentation at the 7th International Workshop on EXplainable, Trustworthy, and Responsible AI and Multi-Agent Systems (EXTRAAMAS 2025). Workshop website: https://extraamas.ehealth.hevs.ch/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09749 2026-04-14 cs.CV 71%

See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment

看清真相:公平关注提升 groundedness 并减少 hallucination 在视觉语言对齐中

Mohammad Anas Azeez, Ankan Deria, Zohaib Hasan Siddiqui, Adinath Madhavrao Dukre, Rafiq Ali, Sara Atito, Yutong Xie, Imran Razzak

机构 * Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学,阿布扎比,阿联酋) King Fahd University of Petroleum and Minerals, Dhahran, Saudi Arabia(法赫德国王石油矿产大学,达兰,沙特阿拉伯) Macquarie University, Sydney, Australia(麦考瑞大学,悉尼,澳大利亚) University of Surrey, Guildford, United Kingdom(萨里大学,吉尔福德,英国) University of New South Wales, Sydney, Australia(新南威尔士大学,悉尼,澳大利亚)

专题命中 幻觉与事实性 :alignment(title)

AI总结 本文提出DOP-OBC方法,通过公平分配注意力减少视觉语言对齐中的幻觉问题,提升生成的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09541 2026-02-11 cs.CV 71%

Scalpel: Fine-Grained Alignment of Attention Activation Manifolds via Mixture Gaussian Bridges to Mitigate Multimodal Hallucination

Scalpel: 通过混合高斯桥梁实现细粒度注意力激活流形对齐以缓解多模态幻觉

Ziqiang Shi, Rujie Liu, Shanshan Yu, Satoshi Munakata, Koichi Shirahata

机构 * Fujitsu Research & Development Center Co.,LTD.(Fujitsu 研究与开发中心有限公司) Fujitsu Limited(Fujitsu 有限公司)

专题命中 幻觉与事实性 :alignment(title)

AI总结 Scalpel通过高斯混合模型和熵最优传输减少多模态幻觉,实现注意力激活流形的细粒度对齐,提升视觉-语言模型的输出一致性。

Comments WACV 2026 (It was accepted in the first round, with an acceptance rate of 6%.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22282 2025-07-31 cs.MA cs.RO 71%

Multi-Agent Path Finding Among Dynamic Uncontrollable Agents with Statistical Safety Guarantees

Kegan J. Strawn, Thomy Phan, Eric Wang, Nora Ayanian, Sven Koenig, Lars Lindemann

专题命中 幻觉与事实性 :safety(title)

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23105 2025-04-01 cs.CV 71%

Open-Vocabulary Semantic Segmentation with Uncertainty Alignment for Robotic Scene Understanding in Indoor Building Environments

Yifan Xu, Vineet Kamat, Carol Menassa

专题命中 幻觉与事实性 :alignment(title)

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.07240 2020-09-24 physics.soc-ph 71%

A multi-layer model for long-term KPI alignment forecasts for the air transportation system

Luis Delgado, Gerald Gurtner, Andrew Cook, Samuel Cristobal, Jorge Martin

专题命中 幻觉与事实性 :alignment(title)

Journal ref Journal of Air Transport Management 89 (2020) 101905

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.04354 2020-05-07 cs.RO cs.SY eess.SY 71%

Inference-Based Strategy Alignment for General-Sum Differential Games

Lasse Peters, David Fridovich-Keil, Claire J. Tomlin, Zachary N. Sunberg

专题命中 幻觉与事实性 :alignment(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15782 2026-08-04 cs.AI cs.CV 版本更新 70%

Mitigating Visual Hallucinations in Multimodal Systems through Retrieval-Augmented Reliability-Aware Inference

通过检索增强的可靠性感知推理缓解多模态系统中的视觉幻觉

Pratheswaran Hariharan, Haiping Xu, Donghui Yan

机构 * University of Massachusetts, Dartmouth(马萨诸塞大学达特茅斯分校)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出一种检索增强的可靠性感知推理框架,利用外部视觉证据库和多个可靠性指标进行决策门控,在不重训练模型的情况下减少视觉幻觉,将接受预测准确率从85.84%提升至88.88%。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29062 2026-08-03 cs.AI 新提交 70%

On the Generalization of Steering Vectors for Chain-of-Thought Faithfulness

论用于思维链忠实性的引导向量的泛化性

Matthew Nguyen, Kyle Cox, Austin Meek, Iván Arcuschin

机构 * University of Virginia(弗吉尼亚大学) University of Delaware(特拉华大学) Poseidon Research(波塞冬研究院)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 该研究针对三个模型探究提升思维链忠实性的引导向量的泛化性,发现其效果主要由评估设置决定,且仅对最大型模型有效,引导可减少未被确认的提示使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04480 2026-07-30 cs.AI cs.CE cs.SY eess.SY math.OC 70%

Prescriptive Artificial Intelligence: A Formal Paradigm for Auditing Human Decisions Under Uncertainty

规范性人工智能:一种用于在不确定性下审计人类决策的正式范式

Pedro Passos

机构 * Institute of Computing, Universidade Federal Fluminense (UFF)(联邦弗鲁米嫩塞大学计算研究所)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出规范性人工智能作为高风险环境下的人类-人工智能决策协作范式,通过四个公理证明了其与预测系统的核心区别,并展示了在决策模仿中系统性偏差的限制。

Comments Preprint; suitable for AI, decision sciences, and prescriptive analytics. Short versions published in Wharton Sports Analytics Journal Fall 2025 (AI Feature Spotlight) and accepted to AAAI Bridge on LM Reasoning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08784 2026-07-27 stat.ML cs.LG math.ST stat.ME stat.TH 版本更新 70%

PCS-UQ: Uncertainty Quantification via the Predictability-Computability-Stability Framework

PCS-UQ:基于可预测性-可计算性-稳定性框架的不确定性量化

Abhineet Agarwal, Fange Xiao, Rebecca Barter, Omer Ronen, Boyu Fan, Bin Yu

机构 * Department of Statistics, University of California, Berkeley(加州大学伯克利分校统计学系) Department of Epidemiology, University of Utah(犹他大学流行病学系) Department of Electrical Engineering and Computer Science, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 提出PCS-UQ框架,通过预测检查、bootstrap采样和乘法校准实现不确定性量化,在回归和分类任务中优于或媲美共形预测方法,并提供理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13596 2026-07-16 cs.CR cs.AI 新提交 70%

Protective Capacity Hallucination: When Large Language Models Claim Nonexistent Capabilities

保护能力幻觉:当大语言模型声称具备不存在的能力时

Eunna Lee, Jungpyo Nam, Sunjun Hwang

机构 * Korea Cyber University(韩国网络大学) Yonsei University(延世大学)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究大语言模型的保护能力幻觉现象,通过三阶段研究发现其受情境严重程度和交互形式影响,体现了角色分配与能力边界规范的差距,提出能力边界的部署端规范是缓解该问题的目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02569 2026-07-07 cs.CV cs.LG 新提交 70%

Uncertainty-Aware Last-Layer Adaptation of RETFound for Referable Diabetic Retinopathy Screening Under Dataset Shift

数据集偏移下用于可参考糖尿病视网膜病变筛查的RETFound不确定性感知最后一层自适应

Karim Mardhani

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 用RETFound对糖尿病视网膜病变筛查的不确定性感知最后一层自适应进行以安全为中心的实证评估,比较多种方法,在APTOS上不确定性感知操作点改善了敏感性等,在DDR上结果有差异,强调安全评估的价值。

Comments 12 pages, 8 tables, 6 figures. Code available at https://github.com/kmardhani/uncertainty-aware-retfound

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05952 2026-07-03 cs.CY 版本更新 70%

Dean of LLM Tutors: A Framework for Automated Quality Review of AI-generated Feedback

LLM导师院长:AI生成反馈的自动质量审查框架

Keyang Qian, Yixin Cheng, Rui Guan, Wei Dai, Flora Jin, Kaixun Yang, Sadia Nawaz, Zachari Swiecki, Guanliang Chen, Lixiang Yan, Dragan Gašević

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 提出DeanLLM框架,通过16维度评估LLM导师反馈的内容、教育效果和幻觉风险,并利用微调GPT-4.1实现与人类专家高度一致的自动审查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31916 2026-07-01 cs.CL 新提交 70%

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action

超越对话的心智理论与说服:通过规划与行动评估LLMs诱导信念状态的能力

Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

机构 * Leverhulme Centre for the Future of Intelligence(勒沃霍姆未来智能中心) Prolific Google, Paradigms of Intelligence Team(谷歌智能范式团队)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 提出非对话式规划心智理论(NCP-ToM)框架,评估LLMs通过行动而非对话诱导他人信念状态的能力,发现GPT-5在80%任务中优于人类,但鲁棒性不足。

Comments 29 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02896 2026-06-29 cs.LG 版本更新 70%

Bridging Mechanistic Interpretability and Prompt Engineering with Gradient Ascent for Interpretable Persona Control

通过梯度上升实现可解释人格控制与提示工程的桥梁

Harshvardhan Saini, Yiming Tang, Dianbo Liu

机构 * Department of Computer Science(计算机科学系) Indian Institute of Technology (ISM), Dhanbad(印度理工学院(ISM),丹巴德) National University of Singapore(新加坡国立大学) CIFAR Fellow(CIFAR研究员)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 本文提出RESGA和SAEGA方法,利用梯度上升优化随机初始化提示,以实现与识别的人格方向更一致的表示,有效控制LLM中的人格行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22181 2026-06-23 cs.LG 新提交 70%

Residue-Level Attributions in Protein Language Models Do Not Recover Allergen Epitopes

蛋白质语言模型中的残基级归因不能恢复过敏原表位

Jianzhou Yao, Anxiong Song, Katja Baerenfaller, Damir Zhakparov

机构 * Swiss Institute of Allergy and Asthma Research, Davos, Switzerland(瑞士过敏与哮喘研究所,达沃斯,瑞士) ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院,苏黎世,瑞士) Swiss Institute of Bioinformatics, Lausanne, Switzerland(瑞士生物信息学研究所,洛桑,瑞士)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本研究通过引入表位基准,评估蛋白质过敏原性模型的可解释性,发现分类器残基级归因与注释表位对齐不显著,模型可能依赖理化特征而非表位特异性机制。

Comments Accepted at the ICML 2026 Mechanistic Interpretability Workshop (peer-reviewed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18259 2026-06-18 cs.HC cs.AI 新提交 70%

Caring Without Feeling: Affective Dynamics as the Control Layer of Human-AI Agent Collaboration

无感关怀:情感动态作为人-AI智能体协作的控制层

Junjie Xu, Xingjiao Wu, Zihao Zhang, Yujia Xu, Yuzhe Yang, Jin Zhu, Luwei Xiao, Wen Wu, Liang He

机构 * East China Normal University(华东师范大学) National University of Singapore(新加坡国立大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文综述情感动态在人-AI智能体协作中的作用,提出将情感视为协调层而非AI内部属性,用于校准信任、委托和治理。

详情

展开后加载摘要…

URL PDF HTML 收藏