arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3278 篇

2503.11742 2026-01-13 cs.CV cs.AI 57%

Safe Vision-Language Models via Unsafe Weights Manipulation

通过不安全权重操作实现安全的视觉-语言模型

Moreno D'Incà, Elia Peruzzo, Xingqian Xu, Humphrey Shi, Nicu Sebe, Massimiliano Mancini

机构 * University of Trento(特伦托大学) NVIDIA(NVIDIA公司) Georgia Tech(佐治亚理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出UWM方法,通过不训练的方式提升视觉-语言模型在不安全查询上的安全性,同时在安全输入上表现更优。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06364 2026-01-13 cs.HC cs.AI 57%

Human-in-the-Loop Interactive Report Generation for Chronic Disease Adherence

具有临床医生的交互式报告生成用于慢性病依从性

Xiaotian Zhang, Jinhong Yu, Pengwei Yan, Le Jiang, Xingyi Shen, Mumo Cheng, Xiaozhong Liu

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种具有临床医生的交互式报告生成系统,通过AI生成与医生审查的分工,提高慢性病依从性报告的效率和准确性,同时确保问责制。

Comments 5 pages, 3 figures. Accepted at the AAAI 2026 Workshop on AI for Healthy Aging and Longevity

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06115 2026-01-13 cs.AI 57%

Dreaming Is Not a Bug: A Jung-Inspired Dream Layer for Multi-Agent LLM Companions

梦境并非bug:一种基于荣格思想的多智能体LLM伴侣的梦境层

V. Cheung

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于荣格思想的梦境层,通过离线生成梦境叙事来增强多智能体LLM伴侣的学习与关系建立能力,将幻觉转化为资源而非bug。

Comments Preprint, 35 pages (5 pages of appendix), 2 figures, 3 tables. Conceptual and architectural proposal with preliminary simulation results

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05624 2026-01-12 cs.CL 57%

Text Detoxification in isiXhosa and Yorùbá: A Cross-Lingual Machine Learning Approach for Low-Resource African Languages

西语和约鲁巴语中的文本净化:一种跨语言机器学习方法用于资源有限的非洲语言

Abayomi O. Agbeyangi

机构 * Walter Sisulu University, Buffalo City Campus, East London, South Africa(沃尔特·西苏卢大学,比夫福城校区,东伦敦,南非)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本研究提出了一种跨语言机器学习方法,用于西语和约鲁巴语的文本净化,结合可解释模型和规则编辑,实现了高准确率的有毒文本检测与重写。

Comments 26 pages, 9 figures and 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15906 2026-01-12 cs.AI 57%

Darth Vecdor: An Open-Source System for Generating Knowledge Graphs Through Large Language Model Queries

Darth Vecdor:通过大语言模型查询生成知识图谱的开源系统

Jonathan A. Handler

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 Darth Vecdor是一个开源系统,通过大语言模型查询生成结构化的知识图谱,旨在解决LLM响应的准确性和一致性问题,以提高医疗领域应用的安全性和效率。

Comments 17 pages, 3 figures. Changes to best of my recollection: 1) Added to Acknowledgements that Darth Vecdor software was created with the help of LLMs and many other resources, clearly noted on software GitHub site, but added here. 2) Fixed content related to the Are You Sure paper that was referenced, as the previous version incorrectly summarized the article's finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10509 2026-01-09 cs.LG 57%

From Actions to Words: Towards Abstractive-Textual Policy Summarization in RL

从动作到词语:迈向强化学习中基于抽象文本的策略摘要

Sahar Admoni, Assaf Hallak, Yftah Ziser, Omer Ben-Porat, Ofra Amir

机构 * Nvidia Research(英伟达研究)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 SySLLM通过将策略解释转化为语言生成问题,利用大型语言模型生成连贯的摘要,以解释复杂强化学习行为。

Comments In Proceedings of AAMAS 2026 (The 25th International Conference on Autonomous Agents and Multi-Agent Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04668 2026-01-09 cs.RO cs.AI 57%

Optimizing Path Planning using Deep Reinforcement Learning for UGVs in Precision Agriculture

利用深度强化学习优化无人机在精准农业中的路径规划

Laukik Patade, Rohan Rane, Sandeep Pillai

机构 * Sardar Patel Institute of Technology(萨达尔·帕特尔技术学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究利用深度强化学习优化无人机在精准农业中的路径规划,通过DDPG和TD3算法在动态环境中实现高成功率的导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04603 2026-01-09 cs.CR cs.AI 57%

Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks

宪法分类器++:高效生产级防御对抗通用劫持攻击

Hoagy Cunningham, Jerry Wei, Zihan Wang, Andrew Persic, Alwin Peng, Jordan Abderrachid, Raj Agarwal, Bobby Chen, Austin Cohen, Andy Dau, Alek Dimitriev, Rob Gilson, Logan Howard, Yijin Hua, Jared Kaplan, Jan Leike, Mu Lin, Christopher Liu, Vladimir Mikulik, Rohit Mittapalli, Clare O'Hara, Jin Pan, Nikhil Saxena, Alex Silverstein, Yue Song, Xunjie Yu, Giulio Zhou, Ethan Perez, Mrinank Sharma

专题命中 安全训练 :jailbreak(abstract);分类 cs.AI

AI总结 宪法分类器++通过高效算法和两阶段分类器流水线,实现生产级防御,大幅降低计算成本并保持高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04582 2026-01-09 cs.CL 57%

Aligning Text, Code, and Vision: A Multi-Objective Reinforcement Learning Framework for Text-to-Visualization

对齐文本、代码和视觉:一种多目标强化学习框架用于文本到可视化

Mizanur Rahman, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Salesforce AI Research(Salesforce人工智能研究) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本文提出RL-Text2Vis框架,通过多目标强化学习提升文本到可视化的准确性和代码执行率。

Comments Accepted to EACL Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02577 2026-01-07 cs.AI astro-ph.IM hep-ph 57%

Orchestral AI: A Framework for Agent Orchestration

Orchestral AI: 一个用于智能体协调的框架

Alexander Roman, Jacob Roman

机构 * Orchestral AI

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 Orchestral AI 提供了一个统一的Python框架,用于跨多个LLM供应商构建智能体,通过类型安全接口和自动工具模式生成,简化了工具调用和跨供应商集成。

Comments 17 pages, 3 figures. For more information visit https://orchestral-ai.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23738 2026-01-01 cs.PL cs.AI cs.FL cs.LO 57%

Enforcing Temporal Constraints for LLM Agents

为LLM代理强制执行时间约束

Adharsh Kamath, Sishen Zhang, Calvin Xu, Shubham Ugare, Gagandeep Singh, Sasa Misailovic

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois at Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国) Meta

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 Agent-C通过运行时保证确保LLM代理遵守时间安全属性,提高任务实用性并实现完美安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23366 2025-12-30 cs.DB cs.AI 57%

AGRO-SQL: Agentic Group-Relative Optimization with High-Fidelity Data Synthesis

AGRO-SQL:基于高保真数据合成的群体相对优化

Cehua Yang, Dongyu Xiao, Junming Lin, Yuyang Song, Hanxu Yan, Shawn Guo, Wei Zhang, Jian Yang, Mingjie Tang, Bryan Dai

机构 * Sichuan University(四川大学) IQuest Research(IQuest研究院) Beihang University(北航大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 AGRO-SQL通过高保真数据合成和群体相对策略优化,提升文本到SQL系统的推理能力与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22568 2025-12-30 cs.AI physics.bio-ph q-bio.NC 57%

Lessons from Neuroscience for AI: How integrating Actions, Compositional Structure and Episodic Memory could enable Safe, Interpretable and Human-Like AI

从神经科学中汲取教训:如何通过整合动作、组合结构和事件记忆来实现安全、可解释和类人的人工智能

Rajesh P. N. Rao, Vishwas Sathish, Linxing Preston Jiang, Matthew Bryan, Prashant Rangarajan

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 通过整合动作、组合结构和事件记忆,改进基础模型以实现安全、可解释和类人的人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20082 2025-12-25 cs.AI 57%

Adaptive Financial Sentiment Analysis for NIFTY 50 via Instruction-Tuned LLMs , RAG and Reinforcement Learning Approaches

通过指令调优LLMs、RAG和强化学习方法实现NIFTY 50的自适应金融情绪分析

Chaithra, Kamesh Kadimisetty, Biju R Mohan

机构 * National Institute of Technology Karnataka(印度卡纳塔克国家理工学院) Gayatri Vidya Parishad College of Engineering(迦雅利维达帕希拉工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出结合指令调优LLMs、RAG和强化学习的方法,提升NIFTY 50金融情绪分析的准确性和市场适应性。

Comments Accepted in CODS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20275 2025-12-24 cs.AI cs.NI 57%

Graph-Symbolic Policy Enforcement and Control (G-SPEC): A Neuro-Symbolic Framework for Safe Agentic AI in 5G Autonomous Networks

图符号政策执行与控制(G-SPEC):一种用于5G自治网络安全代理AI的神经符号框架

Divya Vijay, Vignesh Ethiraj

机构 * NetoAI Solutions Ltd(NetoAI解决方案有限公司)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 G-SPEC是一种神经符号框架,通过确定性验证约束概率规划,提升5G自治网络中代理AI的安全性和可靠性。

Comments 15 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12511 2025-12-24 cs.SE cs.AI cs.PL 57%

SACTOR: LLM-Driven Correct and Idiomatic C to Rust Translation with Static Analysis and FFI-Based Verification

SACTOR:基于大语言模型的C到Rust翻译工具,结合静态分析和FFI验证

Tianyang Zhou, Ziyi Zhang, Haowen Lin, Somesh Jha, Mihai Christodorescu, Kirill Levchenko, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google(谷歌)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 SACTOR通过结合静态分析和FFI验证,利用大语言模型实现C到Rust的正确且习惯性翻译,提升了代码安全性和效率

Comments 35 pages, 15 figures Previously named as "LLM-Driven Multi-step Translation from C to Rust using Static Analysis"

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19361 2025-12-23 cs.LG 57%

Interpretable Hybrid Deep Q-Learning Framework for IoT-Based Food Spoilage Prediction with Synthetic Data Generation and Hardware Validation

可解释的混合深度Q学习框架用于基于物联网的食品变质预测:合成数据生成与硬件验证

Isshaan Singh, Divyansh Chawla, Anshu Garg, Shivin Mangal, Pallavi Gupta, Khushi Agarwal, Nimrat Singh Khalsa, Nandan Patel

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Vellore Institute of Technology(韦洛雷理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种结合LSTM和RNN的可解释混合深度Q学习框架,用于基于物联网的食品变质预测,通过合成数据生成和硬件验证提升预测准确性和决策效率,同时保持可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18669 2025-12-23 cs.AI 57%

IntelliCode: A Multi-Agent LLM Tutoring System with Centralized Learner Modeling

IntelliCode:一个具有集中式学习者建模的多智能体LLM辅导系统

Jones David, Shreya Ghosh

机构 * School of Computer Science and Engineering, VIT-AP University(计算机科学与工程学院,VIT-AP大学) School of Electrical and Computer Sciences, Indian Institute of Technology Bhubaneswar(电气与计算机科学学院,印度理工学院布巴内斯瓦尔学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 IntelliCode通过集中式学习者建模和多智能体协作,实现透明且可靠的LLM辅导系统,提升学习效率和课程适应性。

Comments Submitted to EACL 2026 System Demonstrations Track. 6 pages (main content), 6 figures, includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12815 2025-12-23 cs.LG 57%

From Novelty to Imitation: Self-Distilled Rewards for Offline Reinforcement Learning

从新颖性到模仿:用于离线强化学习的自蒸馏奖励

Gaurav Chaudhary, Laxmidhar Behera

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 ReLOAD通过自蒸馏生成内在奖励,解决离线强化学习中显式奖励标注的难题,实现稳健的策略学习并达到传统方法的性能水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18504 2025-12-23 cs.CV cs.AI 57%

GTMA: Dynamic Representation Optimization for OOD Vision-Language Models

GTMA:面向视觉-语言模型的动态表示优化

Jensen Zhang, Ningyuan Liu, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 GTMA通过动态表示优化提升视觉-语言模型在分布外任务中的性能,有效解决模态不对称问题,提升零样本和少样本准确率15-20%。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16650 2025-12-19 cs.AI cs.CR 57%

Prefix Probing: Lightweight Harmful Content Detection for Large Language Models

前缀探查:用于大型语言模型的轻量有害内容检测

Jirui Yang, Hengqi Guo, Zhihui Lu, Yi Zhao, Yuansen Zhang, Shijing Hu, Qiang Duan, Yinggui Wang, Tao Wei

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 Prefix Probing通过高效前缀探查实现轻量有害内容检测,在保持检测效果的同时大幅降低计算成本和部署需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08158 2025-12-19 cs.CL 57%

Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs

超越过度拒绝:基于场景的诊断与事后缓解措施以应对大语言模型中的夸大拒绝

Shuzhou Yuan, Ercong Nie, Yinuo Sun, Chenxuan Zhao, William LaCroix, Michael Färber

机构 * ScaDS.AI and TU Dresden(ScaDS.AI 和图腾德斯雷克大学) LMU Munich and MCML(慕尼黑大学和MCML) Saarland University(萨尔兰州大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文提出基于场景的诊断与事后缓解方法,以减少大语言模型中的夸大拒绝问题,通过两个基准测试和三种轻量级策略提升合规性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14994 2025-12-19 cs.RO cs.CV cs.LG cs.SY eess.SY 57%

A Vision-Based Shared-Control Teleoperation Scheme for Controlling the Robotic Arm of a Four-Legged Robot

基于视觉的共享控制远程操作方案用于控制四足机器人的机械臂

Murilo Vinicius da Silva, Matheus Hipolito Carvalho, Juliano Negri, Thiago Segreto, Gustavo J. G. Lahr, Ricardo V. Godoy, Marcelo Becker

机构 * Department of Mechanical Engineering, University of São Paulo(机械工程系,圣保罗大学) Instituto Israelita de Ensino e Pesquisa Albert Einstein, Hospital Israelita Albert Einstein(艾利哈德研究所,以色列医院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于视觉的姿态估计方法,通过检测操作员手腕位置来实现四足机器人机械臂的直观远程控制,提高了安全性和易用性。

Journal ref 2025 Latin American Robotics Symposium (LARS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23165 2025-12-19 cs.LG cs.NE 57%

Mirror Descent Policy Optimisation for Robust Constrained Markov Decision Processes

镜像下降策略优化用于鲁棒约束马尔可夫决策过程

David M. Bossens, Atsushi Nitanda

机构 * Centre for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(前沿人工智能研究中心,科技研究局(A*STAR)) Singapore Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(新加坡高性能计算研究所,科技研究局(A*STAR)) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出一种镜像下降策略优化方法,用于鲁棒约束马尔可夫决策过程,通过优化策略和转移核实现收敛率和鲁棒性提升。

Journal ref Transactions on Machine Learning Research (TMLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14985 2025-12-18 stat.ME cs.CY 57%

Measuring Nonlinear Relationships and Spatial Heterogeneity of Influencing Factors on Traffic Crash Density Using GeoXAI

利用GeoXAI测量交通碰撞密度影响因素的非线性关系与空间异质性

Jiaqing Lu, Ziqi Li, Lei Han, Qianwen Guo

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本研究利用GeoXAI框架分析佛罗里达州交通碰撞密度的影响因素,揭示非线性关系与空间异质性,并提出针对性的地理敏感政策建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14744 2025-12-18 q-fin.CP cs.AI 57%

VERAFI: Verified Agentic Financial Intelligence through Neurosymbolic Policy Generation

VERAFI:通过神经符号策略生成实现验证的代理金融智能

Adewale Akinfaderin, Shreyas Subramanian

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 VERAFI通过神经符号策略生成实现验证的代理金融智能,显著提升金融领域事实正确性与合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14112 2025-12-17 cs.AI 57%

STEMS: Spatial-Temporal Enhanced Safe Multi-Agent Coordination for Building Energy Management

STEMS: 基于空间-时间增强的安全多智能体协调的建筑能源管理

Huiliang Zhang, Di Wu, Arnaud Zinflou, Benoit Boulet

机构 * Department of Electrical Computer Engineering, McGill University(电气计算机工程系,麦吉尔大学) Data Science Team, Institut de Recherche Hydro Québec(水电研究所数据科学团队)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 STEMS提出一种安全约束的多智能体强化学习框架,通过空间-时间图表示学习和控制屏障函数,提升建筑能源管理的效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12806 2025-12-16 cs.AI 57%

Fault-Tolerant Sandboxing for AI Coding Agents: A Transactional Approach to Safe Autonomous Execution

面向AI编码代理的容错沙盒:一种用于安全自主执行的事务方法

Boyang Yan

机构 * University of Virginia(弗吉尼亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于事务的容错沙盒框架,通过事务性文件系统快照和策略拦截层,实现对AI编码代理自主执行的安全保障,显著降低延迟并提高安全性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11270 2025-12-15 cs.AI 57%

A-LAMP: Agentic LLM-Based Framework for Automated MDP Modeling and Policy Generation

A-LAMP:基于代理的大型语言模型框架用于自动马尔可夫决策过程建模与策略生成

Hong Je-Gal, Chan-Bin Yi, Hyun-Suk Lee

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 A-LAMP通过基于代理的大型语言模型自动将自然语言任务描述转换为马尔可夫决策过程并生成策略,提升了自动化建模和策略生成的效率与准确性。

Comments NeurIPS 2025 Workshop: Multi-Turn Interactions in Large Language Models. 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10789 2025-12-12 cs.NI cs.AI 57%

Natural Language Interface for Firewall Configuration

防火墙配置的自然语言接口

F. Taghiyev, A. Aslanbayli

机构 * Tandon School of Engineering(塔恩顿工程学院) Department of Electrical and Computer Engineering(电气与计算机工程系) New York University(纽约大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于自然语言的防火墙配置接口,通过中间表示和验证层实现策略翻译与安全检查,旨在提升防火墙管理的可审计性和人机交互性。

Comments 7 pages, 3 figures. Preliminary version of an ongoing research project on natural language interfaces for firewall configuration

详情

展开后加载摘要…

URL PDF HTML 收藏