arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-13 至 2026-04-13 共收录 55 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 18 篇

2604.08559 2026-04-13 cs.CL cs.AI 62%

Medical Reasoning with Large Language Models: A Survey and MR-Bench

基于大语言模型的医学推理:综述与MR-Bench

Xiaohan Ren, Chenxiao Fan, Wenyin Ma, Hongliang He, Chongming Gao, Xiaoyan Zhao, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) The First Affiliated Hospital of USTC(中国科学技术大学附属第一医院) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型在医学推理中的应用,提出MR-Bench基准测试,揭示了考试级性能与真实临床任务准确性之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12509 2026-04-13 cs.LG cs.AI 62%

Revitalizing Black-Box Interpretability: Actionable Interpretability for LLMs via Proxy Models

重振黑盒可解释性:通过代理模型实现LLM的可操作可解释性

Junhao Liu, Haonan Yu, Zhenyu Yan, Xin Zhang

机构 * Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education(高可信软件技术教育部重点实验室(北京大学)) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种低成本代理框架,利用高效模型近似昂贵LLM的决策边界,通过统计验证局部对齐,实现可操作的可解释性,提升LLM优化效率。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09378 2026-04-13 cs.CR cs.AI 57%

BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning

BadSkill: 通过模型-技能污染对代理技能进行后门攻击

Guiyao Tie, Jiawen Shi, Pan Zhou, Lichao Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Lehigh University(里海大学)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 研究针对代理技能中嵌入的模型提出后门攻击,通过污染技能中的模型实现隐蔽攻击,验证了在不同模型规模和扰动类型下的有效性,并指出模型承载技能作为代理生态系统中的新型供应链风险。

Comments 4 pages, 4 fIGURES

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08457 2026-04-13 cs.CV cs.AI cs.RO 57%

CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning

CrashSight:面向交通事故场景理解与推理的相位感知、基础设施导向视频基准

Rui Gan, Junyi Ma, Pei Li, Xingyou Yang, Kai Chen, Sikai Chen, Bin Ran

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Wyoming(怀俄明大学) Columbia University(哥伦比亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 CrashSight通过真实道路摄像头数据构建大规模视频基准,评估视觉语言模型在交通事故场景中的理解与推理能力,揭示现有模型在时间与因果推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09368 2026-04-13 cs.MM cs.CV 50%

Through Their Eyes: Fixation-aligned Tuning for Personalized User Emulation

通过他们的眼睛:基于注视点的个性化用户模拟调谐

Lingfeng Huang, Huizhong Guo, Tianjun Wei, Yingpeng Du, Zhu Sun

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出FixATE方法,通过将视觉语言模型的视觉注意力与用户特定的注视模式对齐,提升推荐系统模拟的准确性,实验表明这种对齐能有效提高点击预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09235 2026-04-13 cs.CR 50%

Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor

Unreal Thinking: 通过两阶段后门实现链式思维劫持

Wenhan Chang, Tianqing Zhu, Ping Xiong, Faqian Guan, Wanlei Zhou

专题命中 安全评测 :safety(abstract)

AI总结 本文提出MRTS和TSBH方法,解决LLM链式思维劫持中的数据稀缺和稳定性问题,通过生成对齐的CoT实现可控的恶意行为诱导,并提供安全推理数据集和缓解方法。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09056 2026-04-13 cs.CR cs.CE 50%

Conversations Risk Detection LLMs in Financial Agents via Multi-Stage Generative Rollout

通过多阶段生成 rollout 检测金融代理中的对话风险

Xiaotong Jiang, Jun Wu

专题命中 安全评测 :safety(abstract)

AI总结 本文提出FinSec框架,通过多阶段生成rollout方法检测金融代理中的对话风险,提升高风险对话检测的鲁棒性,实验显示其在F1分数、ASR和AUPRC等方面均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08799 2026-04-13 cs.GR cs.CV 50%

MeshOn: Intersection-Free Mesh-to-Mesh Composition

MeshOn:无交集的网格到网格组合

Hyunwoo Kim, Itai Lang, Hadar Averbuch-Elor, Silvia Sellán, Rana Hanocka

机构 * Columbia University(哥伦比亚大学) University of Chicago(芝加哥大学) Cornell University(康奈尔大学)

专题命中 安全评测 :alignment(abstract)

AI总结 MeshOn通过多步骤优化框架实现两个输入网格的物理和语义真实组合,利用结构对齐方案和几何损失防止表面交叠,适用于多种材质配件的精准拟合。

Comments Project page: \hyperlink{https://threedle.github.io/MeshOn/}{this https URL}

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08778 2026-04-13 math.HO 50%

Open Preparation, Human Explanation, and Instructor Synthesis: A Human-Scale Methodology for AI-Rich Higher Education

开放准备、人类解释与教师合成:面向AI丰富高等教育的人尺度方法论

Siniša Miličić

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出一种人尺度方法论,通过信息学案例,强调将证据信任从工具禁用转向实时解释与观察,构建了操作周期、现实框架及口头证据模型,回应AI与主动学习的教育需求。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 4 篇

2601.23045 2026-04-13 cs.AI 57%

The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?

AI的混乱:模型智能与任务复杂性如何影响对齐问题

Alexander Hägele, Aryo Pradipta Gema, Henry Sleight, Ethan Perez, Jascha Sohl-Dickstein

机构 * Anthropic Fellows Program(Anthropic 研究员计划) EPFL(瑞士联邦理工学院洛桑) University of Edinburgh(爱丁堡大学) Constellation Anthropic

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究探讨了高智能AI模型在复杂任务中失败的机制,发现模型规模越大,失败行为越不一致,强调对齐研究在防止奖励黑客和目标误指定中的重要性。

Comments ICLR 2026. 10 pages main text, 40 total, 27 figures. v2: typos, improved writing, references

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08691 2026-04-13 cs.SI cs.AI 57%

AgentSociety: Large-Scale Simulation of LLM-Driven Generative Agents Advances Understanding of Human Behaviors and Society

AgentSociety: 基于大语言模型的生成代理大规模模拟推动对人类行为与社会的理解

Jinghua Piao, Yuwei Yan, Jun Zhang, Nian Li, Junbo Yan, Xiaochong Lan, Zhihong Lu, Zhiheng Zheng, Jing Yi Wang, Di Zhou, Chen Gao, Fengli Xu, Fang Zhang, Ke Rong, Jun Su, Yong Li

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出AgentSociety平台,通过大规模模拟人类行为和社会动态,探索社会问题如极化、虚假信息传播等,验证其在社会科学研究中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08926 2026-04-13 cs.LG 57%

Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning

弥合SFT与RL:面向鲁棒推理的动态策略优化

Taojie Zhu, Dongyang Xu, Ding Zou, Sen Zhao, Qiaobo Hao, Zhiguo Yang, Yonghong He

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司智能系统部) Institute of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学前沿交叉研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出DYPO框架,通过组对齐损失、多教师蒸馏和动态探索-利用门控机制,解决SFT与RL间的偏倚-方差权衡问题,提升复杂推理和分布外任务性能。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08698 2026-04-13 cs.LG q-bio.GN 57%

EvoLen: Evolution-Guided Tokenization for DNA Language Model

EvoLen:基于进化的标记化方法用于DNA语言模型

Nan Huang, Xiaoxiao Zhou, Junxia Cui, Mario Tapia-Pacheco, Tiffany Amariuta, Yang Li, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 EvoLen通过整合进化信息优化DNA标记化,优先保留功能序列模式,提升基因组上下文区分和进化约束对齐,优于标准BPE。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 12 篇

2604.03058 2026-04-13 cs.CL cs.AI cs.CY 67%

Verbalizing LLMs' assumptions to explain and control sycophancy

使LLM的假设 verbal化以解释和控制谄媚行为

Myra Cheng, Isabel Sieh, Humishka Zope, Sunny Yu, Lujain Ibrahim, Aryaman Arora, Jared Moore, Desmond Ong, Dan Jurafsky, Diyi Yang

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出Verbalized Assumptions框架,通过揭示LLM对用户的错误假设来解释和控制其谄媚行为,发现LLM在面对用户提问时倾向于提供验证而非客观信息,进而提出可解释的细粒度控制方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04144 2026-04-13 cs.CL cs.AI 62%

Many Preferences, Few Policies: Towards Scalable Language Model Personalization

多种偏好,少数政策:迈向可扩展的语言模型个性化

Cheol Woo Kim, Jai Moondra, Roozbeh Nahavandi, Andrew Perrault, Milind Tambe, Swati Gupta

机构 * Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) The Ohio State University(俄亥俄州立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PALM方法,通过多维权重向量建模用户偏好,生成小规模LLM组合以实现个性化,理论保证了规模和近似质量的平衡。

Comments Fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08606 2026-04-13 cs.GT cs.AI econ.TH 57%

Extrapolating Volition with Recursive Information Markets

通过递归信息市场预测意志

Abhimanyu Pallavi Sudhir, Long Tran-Thanh

机构 * University of Warwick(华威大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文通过递归机制分析信息市场中的信息不对称问题,探讨如何通过LLM买家的遗忘特性激励信息按真实价值定价,为AI对齐研究提供新方法。

Comments Accepted to Games, Agents and Incentives Workshop at AAMAS-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07361 2026-04-13 cs.LG 57%

BLEG: LLM Functions as Powerful fMRI Graph-Enhancer for Brain Network Analysis

BLEG: LLM作为强大的fMRI图增强器用于脑网络分析

Rui Dong, Zitong Wang, Jiaxing Li, Weihuang Zheng, Youyong Kong

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出BLEG方法,通过结合大语言模型与图神经网络,提升fMRI脑网络分析性能,采用三阶段流程增强图神经网络表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07142 2026-04-13 cs.HC cs.AI 57%

Exploring Teachers' Perspectives on Using Conversational AI Agents for Group Collaboration

探索教师使用对话式AI代理进行小组协作的视角

Prerna Ravi, Carúmey Stevens, Beatriz Flamia Azevedo, Jasmine David, Brandon Hanks, Hal Abelson, Grace Lin, Emma Anderson

机构 * Massachusetts Institute of Technology(麻省理工学院) Instituto Politécnico de Bragança(布拉干萨理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究探讨教师如何感知对话式AI代理对小组协作的影响,揭示设计中的核心矛盾及教学应用考量。

Comments Accepted to 27th International Conference on AI in Education (AIED) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03353 2026-04-13 cs.MA cs.AI 57%

Decentralized Collective World Model for Emergent Communication and Coordination

去中心化的集体世界模型用于涌现通信与协调

Kentaro Nomura, Tatsuya Aoki, Tadahiro Taniguchi, Takato Horii

机构 * The University of Osaka(大阪大学) Kyoto University(京都大学) Ritsumeikan University(立命馆大学) The University of Tokyo(东京大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种去中心化的多智能体世界模型,通过时间扩展的集体预测编码实现通信与协调的同步发展,通过对比学习促进信息对齐,展示了在双智能体轨迹绘制任务中优于非通信模型的协调能力。

Comments Accepted at IEEE ICDL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09444 2026-04-13 cs.HC 50%

Confidence Without Competence in AI-Assisted Knowledge Work

人工智能辅助知识工作中缺乏能力的自信

Elena Eleftheriou, George Pallis, Marios Constantinides

专题命中 其他安全 :alignment(abstract)

AI总结 本文研究了不同LLM交互设计对深度思考的影响,发现未来自我解释能提高理解和学习效果,而引导提示能带来最大学习收益。

Comments 25 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07779 2026-04-13 cs.CV 50%

Plug-and-Play Logit Fusion for Heterogeneous Pathology Foundation Models

即插即用的逻辑融合用于异构病理基础模型

Gexin Huang, Anqi Li, Yusheng Tan, Beidi Zhao, Gang Wang, Zu-Hua Gao, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Washington University in St. Louis(圣路易斯华盛顿大学) Vector Institute(向量研究所)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出LogitProd方法,通过融合独立训练的病理基础模型预测器,实现高效且无需重新训练的多专家融合,提升异构模型在多种病理任务中的性能。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08959 2026-04-13 cs.HC 50%

How Do LLMs See Charts? A Comparative Study on High-Level Visualization Comprehension in Humans and LLMs

LLMs如何解读图表?人类与LLMs在高级可视化理解上的比较研究

Hyotaek Jeon, Hyunwook Lee, Minjeong Shin, Tapendra Pandey, Joohee Kim, Shinwook Seon, Daeun Jeong, Sungahn Ko, Ghulam Jilani Quadri

专题命中 其他安全 :alignment(abstract)

AI总结 研究比较了人类与LLMs在图表高级理解上的差异,发现LLMs采用结构化列举而非人类的趋势叙事,揭示了可视化设计的新挑战与机遇。

Comments 15 pages, 8 figures, Accepted to EuroVis 2026

Journal ref The Eurographics Conference on Visualization (EuroVis 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08709 2026-04-13 eess.AS 50%

Enhancing Conversational TTS with Cascaded Prompting and ICL-Based Online Reinforcement Learning

通过级联提示和基于ICL的在线强化学习增强对话式TTS

Zhicheng Ouyang, Seong-Gyun Leem, Bach Viet Do, Haibin Wu, Ariya Rastrow, Yuzong Liu, Florian Metze

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种级联框架,结合文本风格标记和高质量音频提示,实现单次适应细粒度语音风格和角色声音,并引入基于ICL的在线强化学习策略提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08600 2026-04-13 q-bio.TO eess.IV 50%

Gaze2Report: Radiology Report Generation via Visual-Gaze Prompt Tuning of LLMs

Gaze2Report:通过视觉-凝视提示调优LLM实现放射学报告生成

Aishik Konwer, Moinak Bhattacharya, Prateek Prasanna

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出Gaze2Report框架,利用扫描路径预测模块和图神经网络生成视觉-凝视标记,结合指令和报告标记对LLM进行微调,提升报告生成质量并实现推理时无需凝视输入。

Comments Accepted at ISBI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08125 2026-04-13 cs.CV 50%

PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction

PolySLGen:多对多交互中的在线多模态说话-倾听反应生成

Zhi-Yi Lin, Thomas Markhorst, Jouh Yeong Chew, Xucong Zhang

机构 * Computer Vision Lab, Delft University of Technology(代尔夫特理工大学计算机视觉实验室) Honda Research Institute Japan(本田日本研究所)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出PolySLGen框架,用于多对多交互中的多模态反应生成,通过融合姿态和社交信号提升对话连贯性和真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏