arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-13 至 2026-04-13 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 12 篇

2604.03058 2026-04-13 cs.CL cs.AI cs.CY 67%

Verbalizing LLMs' assumptions to explain and control sycophancy

使LLM的假设 verbal化以解释和控制谄媚行为

Myra Cheng, Isabel Sieh, Humishka Zope, Sunny Yu, Lujain Ibrahim, Aryaman Arora, Jared Moore, Desmond Ong, Dan Jurafsky, Diyi Yang

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出Verbalized Assumptions框架,通过揭示LLM对用户的错误假设来解释和控制其谄媚行为,发现LLM在面对用户提问时倾向于提供验证而非客观信息,进而提出可解释的细粒度控制方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04144 2026-04-13 cs.CL cs.AI 62%

Many Preferences, Few Policies: Towards Scalable Language Model Personalization

多种偏好,少数政策:迈向可扩展的语言模型个性化

Cheol Woo Kim, Jai Moondra, Roozbeh Nahavandi, Andrew Perrault, Milind Tambe, Swati Gupta

机构 * Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) The Ohio State University(俄亥俄州立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PALM方法,通过多维权重向量建模用户偏好,生成小规模LLM组合以实现个性化,理论保证了规模和近似质量的平衡。

Comments Fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08606 2026-04-13 cs.GT cs.AI econ.TH 57%

Extrapolating Volition with Recursive Information Markets

通过递归信息市场预测意志

Abhimanyu Pallavi Sudhir, Long Tran-Thanh

机构 * University of Warwick(华威大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文通过递归机制分析信息市场中的信息不对称问题,探讨如何通过LLM买家的遗忘特性激励信息按真实价值定价,为AI对齐研究提供新方法。

Comments Accepted to Games, Agents and Incentives Workshop at AAMAS-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07361 2026-04-13 cs.LG 57%

BLEG: LLM Functions as Powerful fMRI Graph-Enhancer for Brain Network Analysis

BLEG: LLM作为强大的fMRI图增强器用于脑网络分析

Rui Dong, Zitong Wang, Jiaxing Li, Weihuang Zheng, Youyong Kong

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出BLEG方法,通过结合大语言模型与图神经网络,提升fMRI脑网络分析性能,采用三阶段流程增强图神经网络表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07142 2026-04-13 cs.HC cs.AI 57%

Exploring Teachers' Perspectives on Using Conversational AI Agents for Group Collaboration

探索教师使用对话式AI代理进行小组协作的视角

Prerna Ravi, Carúmey Stevens, Beatriz Flamia Azevedo, Jasmine David, Brandon Hanks, Hal Abelson, Grace Lin, Emma Anderson

机构 * Massachusetts Institute of Technology(麻省理工学院) Instituto Politécnico de Bragança(布拉干萨理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究探讨教师如何感知对话式AI代理对小组协作的影响,揭示设计中的核心矛盾及教学应用考量。

Comments Accepted to 27th International Conference on AI in Education (AIED) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03353 2026-04-13 cs.MA cs.AI 57%

Decentralized Collective World Model for Emergent Communication and Coordination

去中心化的集体世界模型用于涌现通信与协调

Kentaro Nomura, Tatsuya Aoki, Tadahiro Taniguchi, Takato Horii

机构 * The University of Osaka(大阪大学) Kyoto University(京都大学) Ritsumeikan University(立命馆大学) The University of Tokyo(东京大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种去中心化的多智能体世界模型,通过时间扩展的集体预测编码实现通信与协调的同步发展,通过对比学习促进信息对齐,展示了在双智能体轨迹绘制任务中优于非通信模型的协调能力。

Comments Accepted at IEEE ICDL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09444 2026-04-13 cs.HC 50%

Confidence Without Competence in AI-Assisted Knowledge Work

人工智能辅助知识工作中缺乏能力的自信

Elena Eleftheriou, George Pallis, Marios Constantinides

专题命中 其他安全 :alignment(abstract)

AI总结 本文研究了不同LLM交互设计对深度思考的影响,发现未来自我解释能提高理解和学习效果,而引导提示能带来最大学习收益。

Comments 25 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07779 2026-04-13 cs.CV 50%

Plug-and-Play Logit Fusion for Heterogeneous Pathology Foundation Models

即插即用的逻辑融合用于异构病理基础模型

Gexin Huang, Anqi Li, Yusheng Tan, Beidi Zhao, Gang Wang, Zu-Hua Gao, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Washington University in St. Louis(圣路易斯华盛顿大学) Vector Institute(向量研究所)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出LogitProd方法,通过融合独立训练的病理基础模型预测器,实现高效且无需重新训练的多专家融合,提升异构模型在多种病理任务中的性能。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08959 2026-04-13 cs.HC 50%

How Do LLMs See Charts? A Comparative Study on High-Level Visualization Comprehension in Humans and LLMs

LLMs如何解读图表?人类与LLMs在高级可视化理解上的比较研究

Hyotaek Jeon, Hyunwook Lee, Minjeong Shin, Tapendra Pandey, Joohee Kim, Shinwook Seon, Daeun Jeong, Sungahn Ko, Ghulam Jilani Quadri

专题命中 其他安全 :alignment(abstract)

AI总结 研究比较了人类与LLMs在图表高级理解上的差异,发现LLMs采用结构化列举而非人类的趋势叙事,揭示了可视化设计的新挑战与机遇。

Comments 15 pages, 8 figures, Accepted to EuroVis 2026

Journal ref The Eurographics Conference on Visualization (EuroVis 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08709 2026-04-13 eess.AS 50%

Enhancing Conversational TTS with Cascaded Prompting and ICL-Based Online Reinforcement Learning

通过级联提示和基于ICL的在线强化学习增强对话式TTS

Zhicheng Ouyang, Seong-Gyun Leem, Bach Viet Do, Haibin Wu, Ariya Rastrow, Yuzong Liu, Florian Metze

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种级联框架,结合文本风格标记和高质量音频提示,实现单次适应细粒度语音风格和角色声音,并引入基于ICL的在线强化学习策略提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08600 2026-04-13 q-bio.TO eess.IV 50%

Gaze2Report: Radiology Report Generation via Visual-Gaze Prompt Tuning of LLMs

Gaze2Report:通过视觉-凝视提示调优LLM实现放射学报告生成

Aishik Konwer, Moinak Bhattacharya, Prateek Prasanna

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出Gaze2Report框架,利用扫描路径预测模块和图神经网络生成视觉-凝视标记,结合指令和报告标记对LLM进行微调,提升报告生成质量并实现推理时无需凝视输入。

Comments Accepted at ISBI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08125 2026-04-13 cs.CV 50%

PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction

PolySLGen:多对多交互中的在线多模态说话-倾听反应生成

Zhi-Yi Lin, Thomas Markhorst, Jouh Yeong Chew, Xucong Zhang

机构 * Computer Vision Lab, Delft University of Technology(代尔夫特理工大学计算机视觉实验室) Honda Research Institute Japan(本田日本研究所)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出PolySLGen框架,用于多对多交互中的多模态反应生成,通过融合姿态和社交信号提升对话连贯性和真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏