arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-23 至 2026-03-23 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 5 篇

2603.20162 2026-03-23 cs.CL 57%

Evaluating Evidence Grounding Under User Pressure in Instruction-Tuned Language Models

评估在用户压力下指令调优语言模型的证据基础

Sai Koneru, Elphin Joe, Christine Kirchhoff, Jian Wu, Sarah Rajtmajer

机构 * College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) Department of Computer Science, Old Dominion University(老 Dominion 大学计算机科学系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 研究探讨了在用户压力下指令调优语言模型如何平衡用户对齐压力与上下文证据的忠实性,通过控制的认知冲突框架评估证据一致性准确性及排序表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19771 2026-03-23 cs.CL 57%

Neither Here Nor There: Cross-Lingual Representation Dynamics of Code-Mixed Text in Multilingual Encoders

既非此处亦非彼处:多语言编码器中混合语言文本的跨语言表示动态

Debajyoti Mazumder, Divyansh Pathak, Prashant Kodali, Jasabanta Patro

机构 * Indian Institute of Science Education and Research(印度科学教育与研究学院) Microsoft Corporation(微软公司)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 研究探讨多语言编码器对混合语言文本的内部表示,发现标准模型在英语和印地语间表现良好,但混合文本与任一语言连接松散。通过训练混合数据可提升英语混合文本对齐,但损害英语-印地语对齐。引入三语后训练目标,使混合文本表示更接近构成语言,提升跨语言理解。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19267 2026-03-23 cs.CL cs.IR 57%

Reviewing the Reviewer: Graph-Enhanced LLMs for E-commerce Appeal Adjudication

审查审查者:图增强的大语言模型用于电商争议裁决

Yuchen Du, Ashley Li, Zixi Huang

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出图增强的大语言模型,通过显式动作建模和冲突建模解决电商争议裁决中的信息不对称问题,提升裁决一致性。

Comments 10 pages, 3 figures, KDD 2026 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19596 2026-03-23 cs.IR 50%

CO-EVOLVE: Bidirectional Co-Evolution of Graph Structure and Semantics for Heterophilous Learning

CO-EVOLVE:图结构与语义的双向共演用于异质学习

Jinming Xing, Muhammad Shahzad

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出CO-EVOLVE框架,通过双向共演解决异质学习中的语义-结构不一致、误差传播和盲从问题,引入对比损失、自适应门控和不确定性门控策略提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08453 2026-03-23 cs.SI 50%

Whose Values? Measuring the (Subjective) Expression of Basic Human Values in Social Media

谁的价值?在社交媒体中测量(主观)基本人类价值观的表达

Ziv Epstein, Farnaz Jahanbakhsh, Tiziano Piccardi, Isabel Gallegos, Dora Zhao, Johan Ugander, Michael Bernstein

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文基于Schwartz价值观体系,提出一种规模化测量社交媒体中价值观表达的框架,通过个性化校准注释提升预测准确性,揭示人类价值观测量的新方法。

Comments Proceedings of the International AAAI Conference on Web and Social Media. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏