arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-17 至 2026-04-17 共收录 75 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 15 篇

2604.15236 2026-04-17 cs.CY cs.AI 87%

Agentic Microphysics: A Manifesto for Generative AI Safety

代理微物理:生成AI安全的宣言

Federico Pierucci, Matteo Prandi, Marcantonio Bracale Syrnikov, Marcello Galisai, Piercosma Bisconti

机构 * DEXAI – Icaro Lab Sant’Anna School of Advanced Studies(DEXAI–伊卡洛实验室圣安娜高级研究学院) DEXAI – Icaro Lab Sapienza University of Rome(DEXAI–伊卡洛实验室罗马萨皮恩扎大学) DEXAI – Icaro Lab VU Amsterdam(DEXAI–伊卡洛实验室阿姆斯特丹伏里克大学) Lucidi DEXAI – Icaro Lab Sapienza University of Rome(Lucidi DEXAI–伊卡洛实验室罗马萨皮恩扎大学)

专题命中 其他安全 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY

AI总结 本文提出代理安全研究的新方法,强调交互层面机制对集体风险的影响,通过生成安全方法识别足够机制和设计干预措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03897 2026-04-17 cs.RO cs.AI cs.CL cs.HC cs.LG 67%

IROSA: Interactive Robot Skill Adaptation using Natural Language

IROSA: 基于自然语言的交互机器人技能适应

Markus Knauer, Samuel Bustamante, Thomas Eiband, Alin Albu-Schäffer, Freek Stulp, João Silvério

机构 * German Aerospace Center (DLR), Institute of Robotics and Mechatronics (RMC)(德国航空航天中心(DLR)机器人与机电研究所) School of Computation, Information and Technology (CIT), Technical University of Munich (TUM)(计算、信息与技术学院(CIT),慕尼黑技术大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出IROSA框架,利用预训练大语言模型实现开放词汇技能适应,通过工具架构在语言模型与机器人硬件间保持抽象层,无需微调即可通过自然语言指令调整机器人技能。

Comments Accepted IEEE Robotics and Automation Letters (RA-L) journal, 8 pages, 5 figures, 3 tables, 1 listing. Code available: https://github.com/DLR-RM/IROSA

Journal ref IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14631 2026-04-17 cs.CL cs.AI 62%

StoryCoder: Narrative Reformulation for Structured Reasoning in LLM Code Generation

StoryCoder: 为LLM代码生成中的结构化推理提供叙述改写

Geonhui Jang, Dongyoon Han, YoungJoon Yoo

机构 * Dept. of Artificial Intelligence, Chung-Ang University(Chung-Ang 大学人工智能系) NAVER AI Lab(NAVER AI 实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 StoryCoder通过将代码生成问题转化为连贯的自然语言叙述,提升模型推理和规划能力,实验显示在多个数据集上平均提升18.7%的零样本准确率,且改进了算法策略和代码结构。

Comments 21 pages, 12 figures. ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14171 2026-04-17 cs.CL cs.AI 62%

Benchmarking Linguistic Adaptation in Comparable-Sized LLMs: A Study of Llama-3.1-8B, Mistral-7B-v0.1, and Qwen3-8B on Romanized Nepali

在可比规模的LLM中评估语言适应性:对Llama-3.1-8B、Mistral-7B-v0.1和Qwen3-8B在罗马化尼泊尔语上的研究

Ananda Rimal, Adarsha Rimal

机构 * Dept. of Computer Science & Engineering(计算机科学与工程系) Nepal Engineering College(尼泊尔工程学院) Central Dept. of CS and IT(计算机科学与信息科技中央系) Tribhuvan University(特里布文大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了三种可比规模的LLM在罗马化尼泊尔语上的语言适应性,通过零样本和微调设置,发现Qwen3-8B在语义相关性和结构对齐指标上表现最佳,验证了适应性假设。

Comments 31 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11496 2026-04-17 cs.CV cs.CL cs.LG 62%

Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference

重新审视双编码视觉-语言模型中的组合性:推断的作用

Imanol Miranda, Ander Salaberria, Eneko Agirre, Gorka Azkune

机构 * HiTZ Center – Ixa, University of the Basque Country (UPV/EHU)(希茨中心–Ixa,巴斯克国家大学(UPV/EHU))

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了双编码视觉-语言模型中组合性问题的根源,提出通过改进推断协议提升组合性能,引入轻量级变压器学习局部对齐,优于全微调和端到端训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14808 2026-04-17 cs.CL 57%

Modeling LLM Unlearning as an Asymmetric Two-Task Learning Problem

将LLM去学习视为一个非对称的双任务学习问题

Zeguan Xiao, Siqing Li, Yong Wang, Xuetao Wei, Jian Yang, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海金融学院) Alibaba Group(阿里巴巴集团) Southern University of Science and Technology(南方科技大学) Beihang University(北航) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济交叉学科研究教育部重点实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文将LLM去学习视为非对称双任务问题,提出优先保留的梯度合成框架,通过分离任务特定梯度提取与冲突感知组合,改进梯度冲突解决方法,实验证明通过重塑梯度几何而非重新平衡损失,有效缓解去学习-保留的权衡。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14723 2026-04-17 cs.SE cs.AI 57%

Bounded Autonomy for Enterprise AI: Typed Action Contracts and Consumer-Side Execution

企业AI的有界自主性:带类型动作合同的消费者端执行

Sarmad Sohail, Ghufran Haider

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出一种有界自主性架构,通过类型动作合同和消费者端执行限制大型语言模型的自主性,确保企业系统安全可靠。

Comments 37 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14477 2026-04-17 cs.AI 57%

Seeing Through Circuits: Faithful Mechanistic Interpretability for Vision Transformers

通过电路看见:面向视觉变换器的忠实机制可解释性

Nina Żukowska, Wolfgang Stammer, Bernt Schiele, Jonas Fischer

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文研究了通过计算图在视觉变换器中识别有用机制电路的可能性,提出自动视觉电路发现方法,发现分类特定电路、CLIP中的文字攻击电路以及可引导纠正有害行为的电路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14459 2026-04-17 cs.CL 57%

Filling in the Mechanisms: How do LMs Learn Filler-Gap Dependencies under Developmental Constraints?

填补机制:语言模型如何在发育约束下学习填充-缺口依赖?

Atrey Desai, Sathvik Nair

机构 * University of Maryland(马里兰大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究通过DAS分析语言模型在不同数据量下的填充-缺口依赖表示,发现有限数据下存在共享但敏感的机制,但语言模型仍需更多数据才能达到人类水平,凸显语言特异性偏见的重要性。

Comments To be published in the 64th Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14223 2026-04-17 cs.IR cs.AI 57%

TRACE: A Conversational Framework for Sustainable Tourism Recommendation with Agentic Counterfactual Explanations

TRACE:一种用于可持续旅游推荐的对话框架,配备代理反事实解释

Ashmi Banerjee, Adithi Satish, Wolfgang Wörndl, Yashar Deldjoo

机构 * Technical University of Munich(慕尼黑技术大学) Polytechnic University of Bari(巴里理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 TRACE通过多代理架构促进可持续旅游,利用反事实解释和LLM生成问题,提升用户环保意识,实验证明其在推荐质量与交互响应上的有效性。

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17512 2026-04-17 cs.CL 57%

Language on Demand, Knowledge at Core: Composing LLMs with Encoder-Decoder Translation Models for Extensible Multilinguality

按需语言,知识为核心:通过编码器-解码器翻译模型组成LLM以实现可扩展的多语言性

Mengyu Bu, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences(智能信息处理重点实验室,计算技术研究所,中国科学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出XBridge架构,利用预训练翻译模型实现多语言理解和生成,同时保留LLM作为英语核心处理通用知识,通过轻量级跨模型映射层和最优传输对齐目标,提升多语言生成性能。

Comments ACL 2026 Main Conference. Code: https://github.com/ictnlp/XBridge | Models: https://huggingface.co/collections/ICTNLP/xbridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23853 2026-04-17 cs.CL 57%

Your LLM Agents are Temporally Blind: The Misalignment Between Tool Use Decisions and Human Time Perception

你的LLM代理是时间盲的:工具使用决策与人类时间感知之间的不一致

Yize Cheng, Arshia Soltani Moakhar, Chenrui Fan, Parsa Hosseini, Kazem Faghih, Zahra Sodagar, Wenxiao Wang, Soheil Feizi

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究揭示LLM代理在动态环境中因时间感知不足导致的工具调用偏差,通过TicToc数据集分析发现现有模型与人类时间感知对齐率低,提出通过后训练对齐提升多轮对话中工具使用与人类时间感知的一致性。

Comments ACL 2026 (findings), Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15225 2026-04-17 cs.HC 50%

UrbanClipAtlas: A Visual Analytics Framework for Event and Scene Retrieval in Urban Videos

UrbanClipAtlas:面向城市视频中事件和场景检索的视觉分析框架

Joel Perca, Luis Sante, Juanpablo Heredia, Joao Rulff, Claudio Silva, Jorge Poco

专题命中 其他安全 :safety(abstract)

AI总结 本文提出UrbanClipAtlas框架,结合RAG、实体提取和视频定位技术,实现城市视频中事件和场景的高效检索与解释,通过知识图谱和增强聊天界面提升分析效率。

Comments 12 pages and 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14629 2026-04-17 cs.CV 50%

Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models

Switch-KD:视觉切换知识蒸馏用于视觉-语言模型

Haoyi Sun, Xiaoxiao Wang, Ning Mao, Qian Wang, Lifu Mu, Wen Zheng, Tao Wei, Wei Chen

机构 * Li Auto Inc(利-auto公司)

专题命中 其他安全 :alignment(abstract)

AI总结 Switch-KD通过统一视觉-语言知识转移,解决多模态对齐问题,使小模型高效蒸馏大模型的多模态知识。

Comments 11 pages, 3 figures

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14737 2026-04-17 physics.chem-ph 50%

Reproducible Orchestration of Best Practices for Reaction Path Optimization with the Nudged Elastic Band

可重复的最优实践 orchestration 用于反应路径优化的 nudged elastic band

Rohit Goswami

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一个自动化流程,结合机器学习势能和 eOn 软件,实现反应路径优化的可重复性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏