arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-27 至 2026-05-27 共收录 18 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 18 篇

2605.26615 2026-05-27 cs.AI 79%

FAST-GOAL: Fast and Efficient Global-local Object Alignment Learning

FAST-GOAL: 快速高效的全局-局部对象对齐学习

Hyungyu Choi, Young Kyun Jang, Chanho Eom

机构 * Department of Virtual Convergence, Graduate School of Advanced Imaging Science, Multimedia & Films (GSAIM), Chung-Ang University(虚拟融合系,高级影像科学研究生院,多媒体与电影系(GSAIM), Chung-Ang 大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 提出FAST-GOAL微调方法,通过全局-局部语义对齐增强CLIP处理长文本的能力,包括快速局部图像-句子匹配和基于token相似性的学习,并在GLIT100k数据集上训练,在长/短描述数据集上均取得显著提升。

Comments 21 pages, 8 figures, IEEE/TIP 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26878 2026-05-27 cs.AI 74%

Multi-Stakeholder LLM Alignment: Decomposing Estimation from Aggregation

多方利益相关者LLM对齐:从聚合中分解估计

Lulu Zheng, Wenjin Yang, Xiangwen Zhang, Rong Yin, Yulan Hu, Zheng Pan, Xin Li

机构 * AMAP, Alibaba Group(阿里集团AMAP) Beihang University(北京航空航天大学)

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 针对多方利益相关者任务中用户偏好冲突的问题,提出DecompR方法,通过反事实校准权重固定查询结构,独立估计角色效用,消除候选依赖的权重漂移并降低估计噪声。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26670 2026-05-27 cs.CL cs.AI 73%

The Labyrinth and the Thread: Rethinking Regularizations in Sequential Knowledge Editing for Large Language Models

迷宫与线索:重新思考大语言模型顺序知识编辑中的正则化方法

Zheng Wang, Kaixuan Zhang, Wanfang Chen, Jingwen Zhang, Xiaonan Lu

机构 * Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI)) Bosch (China) Investment Ltd.(博世(中国)投资有限公司) School of Statistics, East China Normal University(东华大学统计学院)

专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文通过优化分析证明顺序编辑与一次性编辑的等价性,揭示稳定性源于累积编辑约束而非专门正则化,从而简化大语言模型知识编辑流程。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07632 2026-05-27 cs.CL cs.AI cs.LG 67%

Post-training makes large language models less human-like

后训练使大型语言模型更不像人类

Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brändle, David Broska, Jason W. Burton, Nuno Busch, Frederick Callaway, Vanessa Cheung, Brian Christian, Julian Coda-Forno, Can Demircan, Vittoria Dentella, Maria K. Eckstein, Noémi Éltető, Michael Franke, Thomas L. Griffiths, Fritz Günther, Susanne Haridi, Sebastian Hellmann, Stefan Herytash, Linus Hof, Eleanor Holton, Isabelle Hoxha, Zak Hussain, Akshay Jagadish, Elif Kara, Valentin Kriegmair, Evelina Leivada, Li Ji-An, Tobias Ludwig, Maximilian Maier, Marcelo G. Mattar, Marvin Mathony, Alireza Modirshanechi, Robin Na, Mariia Nadverniuk, Antonios Nasioulas, Surabhi S. Nath, Helen Niemeyer, Kate Nussenbaum, Sebastian Olschewski, Thorsten Pachur, Stefano Palminteri, Aliona Petrenco, Camille V. Phaneuf-Hadd, Angelo Pirrone, Manuel Rausch, Laura Raveling, Shashank Reddy, Milena Rmus, Evan M. Russek, Tankred Saanum, Kai Sandbrink, Louis Schiekiera, Johannes A. Schubert, Luca M. Schulze Buschoff, Nishad Singhi, Leah H. Somerville, Mikhail S. Spektor, Xin Sui, Christopher Summerfield, Mirko Thalmann, Anna I. Thoma, Taisiia Tikhomirova, Vuong Truong, Polina Tsvilodub, Konstantinos Voudouris, Kristin Witte, Shuchen Wu, Dirk U. Wulff, Hua-Dong Xiong, Songlin Xu, Lance Ying, Xinyu Zhang, Jian-Qiao Zhu, Eric Schulz

机构 * Helmholtz Munich(海德堡-慕尼黑亥姆霍兹中心) Massachusetts Institute of Technology(麻省理工学院) University of Tübingen(图宾根大学) University of Oxford(牛津大学) Stanford(斯坦福大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过引入Psych-201数据集,发现后训练(将基础模型转化为有用助手的过程)一致地降低了模型与人类行为的对齐度,且这种错位在新模型世代中加剧,而人物诱导技术无法改善个体层面的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08999 2026-05-27 cs.CL cs.AI cs.LG 67%

ASTRA: Adaptive Semantic Tree Reasoning Architecture for Complex Table Question Answering

ASTRA: 面向复杂表格问答的自适应语义树推理架构

Xiaoke Guo, Songze Li, Zhiqiang Liu, Zhaoyan Gong, Yuanxiang Liu, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ASTRA架构,通过AdaSTR将表格重构为逻辑语义树,并利用DuTR双模式推理框架结合树搜索文本导航与符号代码执行,在复杂表格问答中达到最优性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11394 2026-05-27 cs.CL cs.AI cs.LG 67%

Stop Listening to Me! How Multi-turn Conversations Can Degrade LLM Reliability

别听我的!多轮对话如何降低LLM的可靠性

Kevin H. Guo, Chao Yan, Avinash Baidya, Katherine Brown, Xiang Gao, Juming Xiong, Zhijun Yin, Bradley A. Malin

机构 * Vanderbilt University(范德比尔大学) Vanderbilt University Medical Center(范德比尔大学医学中心) Intuit AI Research(Intuit人工智能研究)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出“坚持或切换”(SoS)框架,通过将问答空间分割为多个顺序呈现来评估LLM在多轮对话中的可靠性,发现对话税导致准确性和拒绝错误建议的能力平均下降30%,并观察到盲目切换现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26174 2026-05-27 cs.SE cs.AI cs.CL cs.MA 62%

A Universal Cliff and a Design Fingerprint: Cross-Section Defect Detection Under LLM Orchestration

一个通用悬崖与一个设计指纹:LLM编排下的跨段缺陷检测

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry(刑事精神病研究机构) Sex Offender Medical Center(性犯罪医疗中心) Department of Neuropsychiatry, Graduate School of Medicine, Kyoto University(京都大学医学研究生院神经精神病学部门)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示在LLM编排下,所有模型检测跨段矛盾缺陷的能力大幅下降(检测率降低三分之二以上),并发现不同对齐范式下的模型行为差异,其中一家开发商的模型随对齐增强呈现报告标准偏移。

Comments 24 pages, 2 figures. Data and code: doi:10.5281/zenodo.20372696

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27076 2026-05-27 cs.MA cs.LG 57%

Cost of Structural Learning Under Censored Feedback: A Threshold-Bandit Approach

审查反馈下结构学习的代价:一种阈值-老虎机方法

Michael Ledford, William Regli

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 针对任务仅当联盟达到未知规模阈值时才产生奖励的审查反馈问题,提出阈值激活合作多臂老虎机模型,并通过集中式算法C-TAC实现O(log T)累积遗憾,以及去中心化事件触发协议D-TAC在保持可行性对齐的同时减少23倍通信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26898 2026-05-27 cs.SE cs.AI 57%

Strategies for Guiding LLMs to Use Software Design Patterns: A Case of Singleton

引导LLM使用软件设计模式的策略:以单例模式为例

Viktor Kjellberg, Farnaz Fotrousi, Miroslaw Staron

机构 * University of Gothenburg and Chalmers University of Technology(哥德堡大学和查尔姆斯理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 通过实验比较四种提示策略(指令、二元自动反馈、详细自动反馈、少样本详细反馈),评估13个LLM在164个Java编码挑战中生成遵循单例模式的代码的能力,发现迭代二元反馈在保持或提升功能性的同时最佳地实现了单例模式对齐。

Comments Accepted at PROMISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26415 2026-05-27 cs.CV cs.AI 57%

The Rescue Effect: Spatio-Semantic Early Exit Bypasses Quantization Collapse in CLIP

拯救效应:时空语义早期退出绕过CLIP中的量化崩溃

Kahyeon Nam, Hyesong Choi

机构 * Soongsil University(顺斯大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 针对CLIP模型INT8量化导致的表示崩溃问题,提出LRA-EE方法,通过时空语义聚合、多特征门控和层自适应阈值实现早期退出,在ImageNet-1K零样本分类中降低13.4% FLOPs并提升2.44%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26119 2026-05-27 cs.DC cs.AI 57%

Edge AI Deployment Beyond Models: A BSP-Aware Systems Framework for Industrial Embedded Platforms

超越模型的边缘AI部署:面向工业嵌入式平台的BSP感知系统框架

Pitchai Muthu M

机构 * Advantech Industrial Computing India Pvt. Ltd.(Advantech印度工业计算有限公司)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 提出一个五层BSP感知系统框架,将边缘AI部署视为系统工程问题,解决工业嵌入式平台中模型与硬件、BSP、运行时等环节的集成挑战,提升可复现性、可诊断性、持续吞吐量和现场可靠性。

Comments 17 pages, 5 figures, industrial white paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13770 2026-05-27 eess.IV cs.LG 57%

NeuroMambaLLM: Dynamic Graph Learning of fMRI Functional Connectivity in Autistic Brains Using Mamba and Language Model Reasoning

NeuroMambaLLM:使用Mamba和语言模型推理的自闭症大脑fMRI功能连接的动态图学习

Yasaman Torabi, Parsa Razmara, Hamed Ajorlou, Bardia Baraeinejad

机构 * Department of Electrical and Computer Engineering, McMaster University(麦基尔大学电气与计算机工程系) Department of Biomedical Engineering, University of Southern California(南加州大学生物医学工程系) Department of Electrical and Computer Engineering, University of Rochester(罗切斯特大学电气与计算机工程系) BIOSEN Group(BIOSEN集团)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出NeuroMambaLLM框架,结合动态潜在图学习、选择性状态空间时序建模与冻结的大语言模型,通过低秩适应实现fMRI动态功能连接的诊断分类与临床文本报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05141 2026-05-27 cs.CL 57%

To model human linguistic prediction, make LLMs less superhuman

为了模拟人类语言预测,让大语言模型不那么超人类

Byung-Doh Oh, Tal Linzen

机构 * Division of Linguistics and Multilingual Studies, Nanyang Technological University, Singapore(南洋理工大学语言学与多语言研究系,新加坡) Department of Linguistics, New York University, New York, USA(纽约大学语言学系,纽约,美国) Center for Data Science, New York University, New York, USA(纽约大学数据科学中心,纽约,美国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文指出大语言模型因超人类预测能力而无法解释人类阅读行为,主张通过模拟人类记忆来改进模型,并提出新实验方向。

Comments Accepted to Trends in Cognitive Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23149 2026-05-27 cs.CL 57%

AlignEvoSkill: Towards Knowledge-Aware and Task-Aligned Agent Skill Evolution

AlignEvoSkill: 迈向知识感知与任务对齐的智能体技能进化

Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che, Yang Deng

机构 * Singapore Management University(新加坡国立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出AlignEvoSkill框架,通过联合建模知识覆盖和任务对齐,从失败轨迹中识别知识标签、检索并适配候选技能,再基于知识覆盖和任务对齐分数筛选高质量技能,在3个基准和4个LLM骨干上相对提升34.7%,实现技能进化新SOTA且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26656 2026-05-27 cs.CV 50%

DV-SFT: Direct Vision Supervision for Fine-Grained Visual Understanding

DV-SFT: 直接视觉监督用于细粒度视觉理解

Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Bing Wang, Zhixing Tan

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Zhongguancun Academy(中关村学院) Beihang University(北航) Zhongguancun Laboratory(中关村实验室) Southeast Academy of Information Technology, Beijing Institute of Technology(北京理工大学信息科学技术东南学院)

专题命中 其他安全 :alignment(abstract)

AI总结 提出DV-SFT方法,通过为视觉令牌构建显式令牌级监督信号,利用OCR场景中的直接视觉-文本对应关系,在不修改模型架构或增加前向传播的情况下,显著提升多模态大语言模型的细粒度视觉理解能力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15477 2026-05-27 cs.CV 50%

EgoExo-WM: Unlocking Exo Video for Ego World Models

EgoExo-WM: 利用外部视频解锁自我世界模型

Danny Tran, Roberto Martín-Martín, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他安全 :alignment(abstract)

AI总结 提出通过从外部视频提取结构化身体姿态并利用人体运动学先验将其转换为自我视频,从而利用丰富的野外外部数据训练自我世界模型,显著提升预测质量和下游规划性能。

Comments Project Page: https://vision.cs.utexas.edu/projects/EgoExo-WM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24764 2026-05-27 cs.CV 50%

World-R1: Reinforcing 3D Constraints for Text-to-Video Generation

World-R1:通过强化学习为文本到视频生成注入3D约束

Weijie Wang, Xiaoxuan He, Youping Gu, Yifan Yang, Zeyu Zhang, Yefei He, Yanbo Ding, Xirui Hu, Donny Y. Chen, Zhiyuan He, Yuqing Yang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Independent Researcher(独立研究者)

专题命中 其他安全 :alignment(abstract)

AI总结 提出World-R1框架,利用强化学习(Flow-GRPO)结合3D基础模型和视觉语言模型的反馈,在不修改架构的情况下增强视频生成的3D一致性,并采用周期解耦训练策略平衡刚体几何与动态场景。

Comments ICML 2026, Project Page: https://aka.ms/world-r1, Code: https://github.com/microsoft/World-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09878 2026-05-27 cs.CV 50%

MVISTA-4D: View-Consistent 4D World Model with Test-Time Action Inference for Robotic Manipulation

MVISTA-4D: 用于机器人操作的一致性视图4D世界模型与测试时动作推理

Jiaxu Wang, Yicheng Jiang, Tianlun He, Jingkai Sun, Qiang Zhang, Junhao He, Jiahang Cao, Zesen Gan, Mingyuan Sun, Qiming Shao, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong, Hong Kong SAR(香港理工大学MMLab,香港中文大学,香港特别行政区) The Hong Kong University of Science(香港理工大学) The University of Hong Kong(香港大学) Tsinghua University(清华大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出一种基于世界模型的4D场景生成方法,通过多视图RGBD预测和测试时动作优化,实现几何一致的4D动态预测与机器人操作。

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏