arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3266 篇

2511.12712 2025-12-29 cs.CL cs.AI 62%

Adaptive Focus Memory for Language Models

自适应聚焦记忆用于语言模型

Christopher Cruz

机构 * Purdue University(普渡大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 自适应聚焦记忆通过动态分配保真度级别,实现多轮对话中有效约束保持,无需修改模型权重或外部检索系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15784 2025-12-19 cs.AI cs.LG 62%

Beyond Training: Enabling Self-Evolution of Agents with MOBIMEM

超越训练:通过MOBIMEM实现智能体的自我进化

Zibin Liu, Cheng Zhang, Xi Zhao, Yunfei Feng, Bingyu Bai, Dahu Feng, Erhu Feng, Yubin Xia, Haibo Chen

机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(并行与分布式系统研究所,上海交通大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 MOBIMEM通过引入内存原语和操作系统启发的服务,实现了无需模型重训练的智能体自我进化,显著提升了任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17468 2025-12-19 cs.CV cs.AI cs.LG cs.RO 62%

A Synthetic Dataset for Manometry Recognition in Robotic Applications

用于机器人应用的测压识别合成数据集

Pedro Antonio Rabelo Saraiva, Enzo Ferreira de Souza, Joao Manoel Herrera Pinheiro, Thiago H. Segreto, Ricardo V. Godoy, Marcelo Becker

机构 * University of São Paulo(圣保罗大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种混合数据合成方法,通过结合过程渲染和AI驱动视频生成,提升机器人应用中测压识别的训练效果和可靠性。

Journal ref 2025 Latin American Robotics Symposium (LARS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14761 2025-12-18 cs.SE cs.AI cs.LG 62%

CAPE: Capability Achievement via Policy Execution

通过策略执行实现能力:CAPE

David Ball

机构 * Superficial Labs(超浅实验室)

专题命中 安全训练 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 CAPE通过策略执行实现能力,系统性地将要求转化为可执行规范并训练模型默认满足,减少违规率81%,提升能力评估效率。

Comments 32 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09909 2025-12-11 cs.LG cs.AI 62%

STACHE: Local Black-Box Explanations for Reinforcement Learning Policies

STACHE:强化学习策略的局部黑盒解释

Andrew Elashkin, Orna Grumberg

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 STACHE提出一种用于生成强化学习策略局部黑盒解释的框架,通过鲁棒区域和最小反事实分析,揭示策略行为的演变过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09127 2025-12-11 cs.CL cs.AI 62%

Knowledge-Guided Large Language Model for Automatic Pediatric Dental Record Understanding and Safe Antibiotic Recommendation

基于知识引导的大型语言模型用于自动解析儿童牙科记录并安全推荐抗生素

Zihan Han, Junyan Ge, Caifeng Li

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于知识引导的大型语言模型,通过整合知识图谱、检索增强生成和多阶段安全验证,提升儿童牙科记录解析与安全抗生素推荐的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08952 2025-12-11 cs.LG cs.AI cs.HC cs.RO 62%

Learning When to Ask: Simulation-Trained Humanoids for Mental-Health Diagnosis

学习何时提问:为心理健康诊断训练的仿真 humanoid

Filippo Cenacchi, Deborah Richards, Longbing Cao

机构 * Macquarie University(麦考瑞大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于仿真的方法,通过训练人形机器人以更有效地进行心理健康诊断,利用反事实回放和安全学习循环提升对话节奏和关系建立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07092 2025-12-09 cs.LG cs.AI 62%

The Geometry of Persona: Disentangling Personality from Reasoning in Large Language Models

人格的几何学:从推理中分离人格特征于大型语言模型

Zhixiang Wang

机构 * Precision and Intelligence Medical Imaging Lab, Beijing Friendship Hospital, Capital Medical University(首都医科大学北京友谊医院精准与智能医学影像实验室)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Soul Engine框架,通过解耦人格特质于LLM推理,实现安全可控的人格个性化。

Comments 10 pages, 3 figures, 1 table. Code and dataset available at https://huggingface.co/Zx93/Soul-Engine-Qwen2.5-0.5B

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05731 2025-12-09 cs.AI cs.CL 62%

InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization

InfiGUI-G1: 通过自适应探索策略优化推进GUI接地

Yuhang Liu, Zeyu Liu, Shuanghe Zhu, Pengxiang Li, Congkai Xie, Jiasheng Wang, Xavier Hu, Xiaotian Han, Jianbo Yuan, Xinyao Wang, Shengyu Zhang, Hongxia Yang, Fei Wu

机构 * Amazon(亚马逊)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 InfiGUI-G1通过自适应探索策略优化改进GUI接地,实现显著的语义对齐和性能提升。

Comments Accepted to AAAI 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06981 2025-12-02 cs.AI cs.LG 62%

Deep RL Needs Deep Behavior Analysis: Exploring Implicit Planning by Model-Free Agents in Open-Ended Environments

深度强化学习需要深度行为分析:通过无模型智能体在开放性环境中探索隐式规划

Riley Simmons-Edler, Ryan P. Badman, Felix Baastad Berg, Raymond Chua, John J. Vastola, Joshua Lunger, William Qian, Kanaka Rajan

机构 * Department of Neurobiology, Harvard Medical School(哈佛医学院神经生物学系) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) Department of Mathematics, NTNU(NTNU数学系) School of Computer Science, McGill University & Mila(麦吉尔大学计算机科学学院及Mila) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Biophysics Graduate Program, Harvard University(哈佛大学生物物理学研究生项目)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文通过ForageWorld环境研究DRL智能体的行为,发现无模型智能体可通过涌现动态展现规划行为,提出通用分析框架用于研究复杂智能体的学习动态。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20804 2025-12-02 cs.CR cs.AI cs.LG 62%

AED: Automatic Discovery of Effective and Diverse Vulnerabilities for Autonomous Driving Policy with Large Language Models

AED: 利用大语言模型自动发现自主驾驶策略的有效且多样的漏洞

Le Qiu, Zelai Xu, Qixin Tan, Wenhao Tang, Chao Yu, Yu Wang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 AED 利用大语言模型自动发现自动驾驶策略的有效且多样的漏洞,提升漏洞发现的多样性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23311 2025-12-01 cs.CV cs.AI cs.CL 62%

Toward Automatic Safe Driving Instruction: A Large-Scale Vision Language Model Approach

迈向自动安全驾驶指令:一种大规模视觉语言模型方法

Haruki Sakajo, Hiroshi Takato, Hiroshi Tsutsui, Komei Soda, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) Teatis inc.(Teatis公司) Queensland university of technology(昆士兰理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种大规模视觉语言模型方法,用于生成安全驾驶指令,通过构建数据集并评估模型性能,展示了微调模型在自动驾驶安全中的应用与挑战。

Comments Accepted to MMLoSo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17818 2025-11-25 cs.LG cs.AI 62%

APRIL: Annotations for Policy evaluation with Reliable Inference from LLMs

APRIL:利用LLM可靠推断进行策略评估的标注

Aishwarya Mandyam, Kalyani Limaye, Barbara E. Engelhardt, Emily Alsentzer

机构 * Stanford University(斯坦福大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 APRIL利用大语言模型生成医疗领域的反事实注释,以提高离线策略评估的准确性与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16688 2025-11-24 cs.CL cs.AI 62%

Prompt-Based Value Steering of Large Language Models

基于提示的价值引导大型语言模型

Giulio Antonio Abbo, Tony Belpaeme

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于提示的价值引导方法,通过评估提示候选者对生成文本的价值引导能力,展示在不修改模型的情况下实现价值对齐的可行性。

Comments 9 pages, 1 figure, 4 tables. Presented at the 3rd International Workshop on Value Engineering in AI (VALE 2025), 28th European Conference on AI. To appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08136 2025-11-17 cs.LG cs.AI stat.ML 62%

SafeMIL: Learning Offline Safe Imitation Policy from Non-Preferred Trajectories

Returaj Burnwal, Nirav Pravinbhai Bhatt, Balaraman Ravindran

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 18 pages, Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06262 2025-11-11 cs.AI cs.CY 62%

GAIA: A General Agency Interaction Architecture for LLM-Human B2B Negotiation & Screening

Siming Zhao, Qi Li

机构 * Alibaba.com US E-Commerce(阿里巴巴美国电子商务) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02875 2025-11-06 cs.CY cs.AI 62%

Academics and Generative AI: Empirical and Epistemic Indicators of Policy-Practice Voids

R. Yamamoto Ravenor

机构 * Tokyo Women’s Medical University(东京女子医科大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

Comments 14 pages, 2 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00993 2025-11-04 cs.AI cs.LG 62%

Aligning LLM agents with human learning and adjustment behavior: a dual agent approach

Tianming Liu, Jirong Yang, Yafeng Yin, Manzi Li, Linghao Wang, Zheng Zhu

机构 * Department of Civil and Environmental Engineering, University of Michigan, Ann Arbor, United States(美国密歇根大学土木与环境工程系) Department of Electrical Engineering and Computer Science, University of Michigan, Ann Arbor, United States(美国密歇根大学电气工程与计算机科学系) College of Civil Engineering and Architecture, Zhejiang University, Hangzhou, China(浙江大学建筑工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments 32 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00880 2025-11-04 cs.LG cs.AI 62%

KFCPO: Kronecker-Factored Approximated Constrained Policy Optimization

Joonyoung Lim, Younghwan Yoo

机构 * School of Computer Science and Engineering, Pusan National University, Busan, Korea(计算机科学与工程学院,釜山国立大学,韩国釜山)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 8 figures, submitted to ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16813 2025-11-04 cs.CL cs.AI 62%

Incivility and Rigidity: Evaluating the Risks of Fine-Tuning LLMs for Political Argumentation

Svetlana Churina, Kokil Jaidka

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00029 2025-11-04 cs.LG cs.AI 62%

Feature-Guided SAE Steering for Refusal-Rate Control using Contrasting Prompts

Samaksh Bhargav, Zining Zhu

机构 * Edison Academy Magnet School New Jersey, USA(新泽西州埃迪森磁校) Department of Computer Science(计算机科学系) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27087 2025-11-03 cs.CL cs.CY 62%

Characterizing Selective Refusal Bias in Large Language Models

Adel Khorramrouz, Sharon Levy

机构 * Rutgers University(罗格斯大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.CY

Comments 21 pages, 12 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23659 2025-10-28 cs.CL cs.AI 62%

Aligning LLMs for Multilingual Consistency in Enterprise Applications

Amit Agarwal, Hansa Meghwani, Hitesh Laxmichand Patel, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17873 2025-10-28 cs.CL cs.AI cs.CE 62%

MOOSE-Chem3: Toward Experiment-Guided Hypothesis Ranking via Simulated Experimental Feedback

Wanhao Liu, Zonglin Yang, Jue Wang, Lidong Bing, Di Zhang, Dongzhan Zhou, Yuqiang Li, Houqiang Li, Erik Cambria, Wanli Ouyang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) MiroMind

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19599 2025-10-28 cs.AI cs.LG 62%

GVPO: Group Variance Policy Optimization for Large Language Model Post-Training

Kaichen Zhang, Yuzhong Hong, Junwei Bao, Hongfei Jiang, Yang Song, Dingqian Hong, Hui Xiong

机构 * Thrust of Artificial Intelligence, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能研究所) Zuoyebang Education Technology(佐业邦教育科技) Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21885 2025-10-28 cs.CL cs.AI 62%

Preventing Catastrophic Forgetting: Behavior-Aware Sampling for Safer Language Model Fine-Tuning

Anh Pham, Mihir Thalanki, Michael Sun, Aditya Chaloo, Ankita Gupta, Tian Xia, Aditya Mate, Ehimwenma Nosakhare, Soundararajan Srinivasan

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10226 2025-10-27 cs.CV cs.AI cs.LG 62%

ScoreMix: Synthetic Data Generation by Score Composition in Diffusion Models Improves Recognition

Parsa Rahimi, Sebastien Marcel

机构 * EPFL(苏黎世联邦理工学院) Idiap(日内瓦智能感知研究院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments Extended version of ICMLw25 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12733 2025-10-27 cs.RO cs.AI cs.LG 62%

HYPE: Hybrid Planning with Ego Proposal-Conditioned Predictions

Hang Yu, Julian Jordan, Julian Schmidt, Silvan Lindner, Alessandro Canevaro, Wilhelm Stork

机构 * Mercedes-Benz AG, Research & Development(梅赛德斯-奔驰集团,研发部) Karlsruhe Institute of Technology, ITIV(卡尔斯鲁厄理工学院,ITIV) University of Tübingen(图宾根大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to IEEE ITSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20187 2025-10-24 cs.LG cs.CL 62%

Every Question Has Its Own Value: Reinforcement Learning with Explicit Human Values

Dian Yu, Yulai Zhao, Kishan Panaganti, Linfeng Song, Haitao Mi, Dong Yu

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15720 2025-10-22 cs.LG cs.AI 62%

ProSh: Probabilistic Shielding for Model-free Reinforcement Learning

Edwin Hamel-De le Court, Gaspard Ohlmann, Francesco Belardinelli

机构 * Imperial College(帝国学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏