arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1732 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1732 篇

2601.22947 2026-06-02 cs.CL cs.LG 62%

Reconsidering Positional Supervision in Masked Diffusion Language Model Training

重新审视掩码扩散语言模型训练中的位置监督

Mengyu Ye, Keito Kudo, Ryosuke Takahashi, Jun Suzuki

机构 * Tohoku University(东大大学) RIKEN(理化学研究所) NII LLMC(国家信息研究所LLMC)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 针对掩码扩散语言模型对位置偏移敏感的问题,提出基于连接主义时序分类(CTC)的目标函数,通过引入松弛令牌和更新折叠映射来吸收位置不确定性,从而在开放生成基准上取得一致提升。

Comments preprint, WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30585 2026-06-01 cs.LG cs.AI cs.CE 62%

Benchmarking Machine Learning Uncertainty Quantification Methodologies for Predicting Turbine Gas Temperature Degradation

机器学习不确定性量化方法在预测涡轮燃气温度退化中的基准测试

Jostein Barry-Straume, Changmin Son, Adrian Sandu, Gavan Burke, Rekha Sundararajan, Andrew Rimell, James G. Steinrock

机构 * Computational Science Laboratory(计算科学实验室) Department of Computer Science(计算机科学系) Virginia Tech(弗吉尼亚理工大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了五种预测区间构建方法(Delta法、贝叶斯蒙特卡洛Dropout、Bootstrap法、下上界估计和均值方差估计),在统一实验框架下评估其捕捉涡轮燃气温度神经网络预测不确定性的能力,并基于覆盖概率、归一化平均预测区间宽度和覆盖宽度准则等指标比较了各方法的可靠性、锐度及权衡,为发动机健康管理中的预测区间方法选择和调优提供了实用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03585 2026-05-27 cs.CL cs.AI 62%

Belief-Sim: Towards Belief-Driven Simulation of Demographic Misinformation Susceptibility

Belief-Sim:迈向信念驱动的人口统计错误信息易感性模拟

Angana Borah, Zohaib Khan, Rada Mihalcea, Verónica Pérez-Rosas

机构 * University of Michigan - Ann Arbor(密歇根大学安娜堡分校) Texas State University(德克萨斯州立大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出BeliefSim框架,利用心理学分类和调查先验构建人口信念档案,通过提示条件化和后训练适应,实现基于信念模拟人口统计错误信息易感性,对齐度达92%。

Comments Paper Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20586 2026-05-27 cs.AI cs.LG 62%

PaTAS: A Framework for Trust Propagation in Neural Networks Using Subjective Logic

PaTAS:基于主观逻辑的神经网络信任传播框架

Koffi Ismael Ouattara, Ioannis Krontiris, Theo Dimitrakos, Dennis Eisermann, Houda Labiod, Frank Kargl

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出PaTAS框架,利用主观逻辑在神经网络中并行传播信任,通过信任节点和信任函数量化输入、参数和激活的信任,并设计参数信任更新和推理路径信任评估方法,以在对抗或退化条件下提供可解释的信任估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25120 2026-05-26 cs.CL cs.AI cs.HC 62%

Evidence-Linked Radiology Reporting: A Human-Supervised Reference Architecture for Structured Imaging Intelligence

证据关联放射学报告:面向结构化成像智能的人机协同参考架构

Houman Kazemzadeh, Kamyar Naderi

机构 * Xylemed

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出一种人机协同、证据关联的参考架构,通过结合特定检查模板、语音到结构处理、测量与分割捕获、受控AI辅助起草以及基于DICOM、HL7 FHIR等标准的互操作性,将放射学报告从自由文本转化为结构化智能层,支持审阅报告、纵向比较、临床数据重用及系统集成。

Comments Technical report, 27 pages, 2 figures, 12 tables, 1 listing; reference architecture paper; does not report clinical outcomes or validated diagnostic performance

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25110 2026-05-26 cs.CV cs.AI cs.LG 62%

Uncertainty-DTW for Sequences and Visual Tokens

Uncertainty-DTW 用于序列和视觉标记

Lei Wang, Syuan-Hao Li, Yongsheng Gao, Piotr Koniusz

机构 * School of Engineering and Built Environment, Electrical and Electronic Engineering, Griffith University(工程与建筑环境学院,电气与电子工程学院,格里菲斯大学) School of Computer Science and Engineering, University of New South Wales(计算机科学与工程学院,新南威尔士大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出不确定性感知的动态时间规整(uDTW)框架,通过异方差不确定性建模和最大似然估计实现鲁棒对齐,并推广到视觉标记集,在多个领域取得优于现有方法的结果。

Comments Research report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04295 2026-05-26 cs.LG cs.AI 62%

LLMs Uncertainty Quantification via Adaptive Conformal Semantic Entropy

通过自适应共形语义熵进行LLM不确定性量化

Hamed Karimi, Vaishali Meyappan, Reza Samavi

机构 * Toronto Metropolitan University(多伦多 Metropolitan 大学) Vector Institute(向量研究所)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出自适应共形语义熵(ACSE)方法,通过聚类语义熵并自适应调整不确定性分数,结合共形校准实现统计可靠的接受/弃权决策,在多个数据集上优于现有基线。

Comments Accepted for publication in the Proceedings of the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026); 14 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23315 2026-05-25 cs.CL cs.AI 62%

Convergence Without Understanding: When Language Models Agree on Representations but Disagree on Reasoning

没有理解的趋同:当语言模型在表示上一致但在推理上分歧时

Muhammad Usama, Dong Eui Chang

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过分析16个语言模型在800个推理问题上的表示相似性,发现模型在表示上趋同但推理策略不同,表明表示趋同反映的是共享的输入处理约束而非共享的推理策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21801 2026-05-22 cs.LG cs.CL 62%

Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization

为何语义熵失效:面向策略优化的几何感知与校准不确定性

Zheyuan Zhang, Kaiwen Shi, Han Bao, Zehong Wang, Tianyi Ma, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种新的策略优化框架GCPO,通过几何感知措施捕捉语义分歧,并利用基于奖励的校准对齐不确定性与学习信号强度,从而更准确地跟踪梯度变化并提升训练后性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20084 2026-05-20 cs.CL cs.AI 62%

BalanceRAG: Joint Risk Calibration for Cascaded Retrieval-Augmented Generation

BalanceRAG: 为级联检索增强生成进行联合风险校准

Zijun Jia, Yuanchang Ye, Sen Jia, Yiyao Qian, Haoning Wang, Baojie Chen, Diyin Tang, Jinsong Yu, Zhiyuan Wang

机构 * Beihang University(北航) Shenzhen Institute of Advanced Technology(深圳先进技术研究院) Zhejiang University of Finance & Economics(浙江财经大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BalanceRAG,一种用于级联检索增强生成的联合风险校准方法,通过在二维晶格上确定安全操作点,实现风险自适应的阈值校准,从而在控制系统级错误率的同时保留更多示例,并扩展到多风险校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18562 2026-05-19 stat.ME cs.AI cs.LG stat.AP 62%

Estimating Item Difficulty with Large Language Models as Experts

利用大语言模型作为专家估算项目难度

Diana Kolesnikova, Kirill Fedyanin, Abe D. Hofman, Matthieu J. S. Brinkhuis, Maria Bolsinova

机构 * Department of Methodology and Statistics, Tilburg University(蒂尔堡大学方法学与统计学系) Smart Business Technologies(智能商务技术公司) Department of Psychological Methods, University of Amsterdam(阿姆斯特丹大学心理方法系) Prowise Learn, Amsterdam(Prowise Learn公司,阿姆斯特丹) Department of Information and Computing Sciences, Utrecht University(乌得勒支大学信息与计算科学系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了如何利用大语言模型估算新任务的难度,通过对比不同配置下的模型表现,发现基于对偶比较的配置在无额外优化时表现更优,而结合token概率和已知难度示例的绝对判断配置也表现出中等至高水平的对齐度。

Comments 24 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18163 2026-05-19 cs.AI cs.CL 62%

TRACE: Trajectory Correction from Cross-layer Evidence for Hallucination Reduction

TRACE: 通过跨层证据进行轨迹修正以减少幻觉

Tej Sanibh Ranade

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TRACE算法,通过跨层证据在推理时修正LLM中的幻觉,无需训练或标注,通过内部证据选择修正策略,提升多个基准测试的性能。

Comments 25 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23912 2026-05-15 cs.CL cs.AI 62%

LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generations

LoVeC:强化学习用于长文生成中的更可靠的 verbalized 自信度

Caiqi Zhang, Xiaochen Zhu, Chengzu Li, Nigel Collier, Andreas Vlachos

机构 * University of Cambridge(剑桥大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LoVeC,一种基于强化学习的方法,通过在长文生成过程中实时附加数值自信度评分,提升事实性生成的可靠性。实验表明,该方法在多个长文问答数据集上实现了更好的校准和跨领域泛化能力,且效率显著高于传统自一致性方法。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13723 2026-05-14 cs.HC cs.AI cs.LG cs.SI 62%

Humanwashing -- It Should Leave You Feeling Dirty

人类洗清——它应该让你感到肮脏

Ben Wilson, Matimba Swana, Peter Winter, Matt Roach

机构 * Computational Foundry, Swansea University, UK(计算泉研究所,斯wansea大学,英国) University of Bristol, UK(布里斯托大学,英国)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文质疑'人类在环'概念在AI决策系统中的有效性,指出其可能掩盖真实过程与结果,提出'人类洗清'现象需引起关注。

Comments 10 pages, 1 figure. Reviewed and accepted for presentation at HHAI 2026, Brussels

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12521 2026-05-14 cs.CL cs.AI 62%

ToolWeave: Structured Synthesis of Complex Multi-Turn Tool-Calling Dialogues

ToolWeave:复杂多轮工具调用对话的结构化合成

Dinesh Khandelwal, Gnana Prakash Punnavajhala, GPS Bhargav, Gaurav Pandey, Sachin Joshi, Hima Karanam, Dinesh Raghu

机构 * IBM Research(IBM研究院) IIIT Hyderabad(Hyderabad理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ToolWeave通过构建带有内置依赖关系的工具,生成更真实的多轮工具调用对话,减少参数幻觉,提升LLM在多步骤任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12510 2026-05-14 cs.SI cs.CL cs.CY 62%

WhatsApp Vaccine Discourse (WhaVax): An Expert-Annotated Dataset and Benchmark for Health Misinformation Detection

WhatsApp疫苗 discourse(WhaVax):一个专家标注的数据集和基准,用于健康虚假信息检测

Jônatas H. dos Santos, Julio C. S. Reis, Philipe Melo, João F. H. Olivetti, Thales H. Silva, Matheus Gontijo Guimaraes, Glaucio de Souza, Marcos A. Gonçalves, Fabricio Benevenuto, Filipe B. B. Zanovello, Marco A. G. Rodrigues, Cristiano X. Lima

机构 * Universidade Federal de Minas Gerais (UFMG)(巴西联邦大学矿务学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文介绍了WhaVax数据集,用于检测健康虚假信息,通过专家标注和多阶段协议生成高质量数据集,并评估了不同模型在数据稀缺条件下的表现。

Comments 10 pages. This is a preprint version of a paper accepted for the International AAAI Conference on Web and Social Media (ICWSM'26). Please cite the conference version rather than this preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10082 2026-05-13 cs.CL cs.LG 62%

FERA: Uncertainty-Aware Federated Reasoning for Large Language Models

FERA:面向大语言模型的不确定性感知联邦推理

Ruhan Wang, Chengkai Huang, Zhiyong Wang, Junda Wu, Rui Wang, Tong Yu, Julian McAuley, Lina Yao, Dongruo Zhou

机构 * Indiana University(印第安纳大学) The University of New South Wales(新南威尔士大学) The Chinese University of Hong Kong(香港中文大学) University of California San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 FERA通过迭代服务器-客户端协同细化,解决联邦推理中客户端可靠性依赖查询的问题,提升多步骤推理能力,实验表明其在多个推理基准上优于联邦训练和无训练基线。

Comments 44 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06908 2026-05-11 cs.LG cs.AI 62%

Same Signal, Opposite Meaning: Direction-Informed Adaptive Learning for LLM Agents

同信号,异意义:方向感知的自适应学习用于大语言模型代理

Ziming Li, Jiatan Huang, Xiaoguang Guo, Guilin Wang, Chuxu Zhang

机构 * University of Connecticut(康奈尔大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DIAL方法,通过方向感知的自适应学习解决LLM代理中计算需求与计算适宜性差异问题,提升性能-成本平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09839 2026-05-11 cs.AI cs.LG 62%

Steered LLM Activations are Non-Surjective

引导的LLM激活不是满射的

Aayush Mishra, Daniel Khashabi, Anqi Liu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了激活引导是否能通过文本提示实现,证明引导行为在实际中无法通过提示复现,区分了白盒引导与黑盒提示的差异。

Comments 10 pages main text. ICLR 2026 Workshops (Sci4DL, Re-Align)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13224 2026-05-11 cs.AI cs.CL 62%

A Geometric Taxonomy of Hallucinations in LLMs

大语言模型幻觉的几何分类

Javier Marín

机构 * Javier Marín

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于嵌入空间几何的幻觉检测方法,通过三种操作类型区分可检测与不可检测的幻觉,验证了在不同领域数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11653 2026-05-01 cs.IR cs.AI cs.LG 62%

GroupRank: A Groupwise Paradigm for Effective and Efficient Passage Reranking with LLMs

GroupRank: 一种用于基于LLM的高效有效段落重排序的组内方法

Meixiu Long, Duolin Sun, Dan Yang, Yihan Jiao, Lei Liu, Jiahai Wang, BinBin Hu, Yue Shen, Jie Feng, Zhehao Tan, Junjie Wang, Lianzhen Zhong, Jian Wang, Peng Wei, Jinjie Gu

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Ant Group(蚂蚁集团)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 GroupRank提出一种组内方法平衡灵活性和上下文感知,通过合成数据融合局部点状信号与全局列表排名,提升重排序效果和效率,实验显示在BRIGHT上达到65.2 NDCG@10,且推理速度提升6.4倍。

Comments Accepted by ACL-Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14352 2026-05-01 cs.CY cs.AI cs.LO 62%

Epistemic reflections on AI answering our questions: overwatch, erudite, logician, interlocutor

关于AI回答问题的认知反思:监视、博学、逻辑学家、对话者

Johan F. Hoorn, Ella-Jenna Oosterglorenwoud

机构 * The Hong Kong Polytechnic University(香港理工大学) Eindhoven University of Technology (TU/e)(埃因霍温理工大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨AI在金融、法律等领域被广泛依赖的问题,指出其缺乏逻辑验证和实证验证,可能导致误判和剽窃。提出需了解推理系统以使AI成为可信的对话伙伴。

Comments 22 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25934 2026-04-30 cs.CY cs.AI 62%

LLM Psychosis: A Theoretical and Diagnostic Framework for Reality-Boundary Failures in Large Language Models

LLM精神病:一种理论和诊断框架,用于大语言模型中现实边界失败

Ashutosh Raj

机构 * NeuraCare AI IIT Ropar(罗帕理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出LLM精神病理论框架,用于描述大语言模型认知崩溃现象,通过五个特征定义诊断工具LCIS,分析不同严重等级的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03247 2026-04-24 cs.LG cs.AI 62%

Towards Multimodal Active Learning: Efficient Learning with Limited Paired Data

迈向多模态主动学习:在有限配对数据下高效学习

Jiancheng Zhang, Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出首个处理对齐数据的多模态主动学习框架,结合不确定性与多样性原则,实现线性时间获取,降低多模态标注成本且保持性能。

Comments Accepted by Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09781 2026-04-23 cs.LG cs.AI 62%

Explainability in Generative Medical Diffusion Models: A Faithfulness-Based Analysis on MRI Synthesis

生成医学扩散模型的可解释性:基于忠实度的MRI合成分析

Surjo Dey, Pallabi Saikia

机构 * Rajiv Gandhi institute of petroleum technology(拉吉夫·甘地石油技术学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨生成扩散模型在医学影像中的可解释性,聚焦MRI合成,通过分析原型方法评估生成与训练特征的关系,实验表明EPPNet在忠实度上表现最佳,提升生成过程的透明度和可信度。

Comments Accepted at 3rd World Congress on Smart Computing (WCSC2026) conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20598 2026-04-23 cs.IR cs.CL cs.DB cs.LG 62%

Self-Aware Vector Embeddings for Retrieval-Augmented Generation: A Neuroscience-Inspired Framework for Temporal, Confidence-Weighted, and Relational Knowledge

具有自我意识的向量嵌入用于检索增强生成:一种受神经科学启发的框架,用于时间、置信度加权和关系知识

Naizhong Xu

机构 * Principal Consultant, CMC APAC(CMC APAC 主任顾问)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SmartVector框架,通过引入时间意识、置信度衰减和关系意识,改进检索增强生成系统,提升准确性与鲁棒性。

Comments 17 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18963 2026-04-22 cs.LG cs.AI 62%

Distillation Traps and Guards: A Calibration Knob for LLM Distillability

知识蒸馏陷阱与守护:一种用于LLM可蒸馏性的校准调节器

Weixiao Zhan, Yongcheng Jing, Leszek Rutkowski, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science(生成人工智能实验室,计算与数据科学学院) Nanyang Technological University(南洋理工大学) Systems Research Institute of the Polish Academy of Sciences(波兰科学院系统研究所) AGH University of Krakow(克拉科夫AGH大学) SAN University(SAN大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文分析了知识蒸馏中的陷阱,提出了一种后处理校准方法,通过强化学习微调控制教师模型的可蒸馏性,提升蒸馏效果和模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22977 2026-04-20 cs.LG cs.AI 62%

The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination

推理陷阱:增强大语言模型推理能力如何放大工具幻觉

Chenlong Yin, Zeyang Sha, Shiwen Cui, Changhua Meng, Zechao Li

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Nanjing University of Science and Technology(南京理工大学) Independent Researcher(独立研究者)

专题命中 幻觉与事实性 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨增强LLM推理能力是否导致工具幻觉增加,通过SimpleToolHalluBench验证因果关系,发现推理增强与幻觉成正比,且不受过拟合影响,揭示需新的训练目标平衡能力和可靠性。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20020 2026-04-20 cs.AI cs.CL 62%

Persona-Assigned Large Language Models Exhibit Human-Like Motivated Reasoning

具有人格分配的大型语言模型表现出类似人类的动机推理

Saloni Dash, Amélie Reymond, Emma S. Spiro, Aylin Caliskan

机构 * University of Washington(华盛顿大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了分配不同政治和社会人口属性的人格对大型语言模型动机推理的影响,发现人格分配的模型在评估信息真实性时表现下降,且政治人格在科学证据评估中更倾向于与自身身份一致的结论,传统去偏方法效果有限。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05024 2026-04-17 stat.ME cs.AI cs.LG 62%

Model-Free Assessment of Simulator Fidelity via Quantile Curves

通过分位数曲线进行无模型的模拟器保真度评估

Garud Iyengar, Yu-Shiou Willy Lin, Kaizheng Wang

机构 * Department of IEOR and Data Science Institute, Columbia University(工业工程与数据科学学院,哥伦比亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过分位数曲线评估模拟器保真度,构建置信区间以估计潜变量参数差异,支持统计推断和风险测量,适用于多种输出空间。

Comments 39 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏