arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-01 至 2026-04-01 共收录 19 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 19 篇

2603.22779 2026-04-01 cs.IR cs.AI cs.LG 81%

KARMA: Knowledge-Action Regularized Multimodal Alignment for Personalized Search at Taobao

KARMA:面向淘宝个性化搜索的知识-行动正则化多模态对齐

Zhi Sun, Wenming Zhang, Yi Wei, Liren Yu, Zhixuan Zhang, Dan Ou, Haihong Tang

机构 * Taobao \& Tmall Group of Alibaba Hangzhou China Taobao \& Tmall Group of Alibaba

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 KARMA通过知识-行动正则化多模态对齐框架,解决个性化搜索中知识与行动冲突问题,提升语义可解性与行动指标,实现GMV增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29560 2026-04-01 eess.SY cs.RO cs.SY math.OC 78%

Distributed Predictive Control Barrier Functions: Towards Scalable Safety Certification in Modular Multi-Agent Systems

分布式预测性控制屏障函数:迈向模块化多智能体系统中的可扩展安全性认证

Jonas Ohnemus, Alexandre Didier, Ahmed Aboudonia, Andrea Carron, Melanie N. Zeilinger

机构 * Institute for Dynamic Systems and Control, ETH Zurich(苏黎世联邦理工学院动态系统与控制研究所) University of California Berkeley(加州大学伯克利分校)

专题命中 其他安全 :safety(title,abstract)

AI总结 本文提出分布式预测性控制屏障函数(D-PCBF)作为多智能体系统的安全框架,通过模型预测确保在动态网络拓扑变化下的可恢复安全性,并通过仿真和实验证明其有效性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18887 2026-04-01 cs.CV 78%

SafeDrive: Fine-Grained Safety Reasoning for End-to-End Driving in a Sparse World

SafeDrive: 为稀疏世界中的端到端驾驶进行细粒度安全推理

Jungho Kim, Jiyong Oh, Seunghoon Yu, Hongjae Shin, Donghyuk Kwak, Jun Won Choi

机构 * Seoul National University(首尔大学)

专题命中 其他安全 :safety(title,abstract)

AI总结 SafeDrive提出了一种端到端规划框架,通过轨迹条件化的稀疏世界模型进行显式且可解释的安全推理,实现了在开放循环和闭合循环基准上的最佳性能,有效降低了碰撞率。

Comments Accepted to CVPR 2026, 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28952 2026-04-01 cs.RO 78%

World2Rules: A Neuro-Symbolic Framework for Learning World-Governing Safety Rules for Aviation

World2Rules: 一种用于航空领域学习世界治理安全规则的神经符号框架

Haichuan Wang, Jay Patrikar, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :safety(title,abstract)

AI总结 World2Rules通过结合神经网络和符号方法,从航空多模态数据中学习安全规则,提升规则的准确性和可解释性,实验显示其在F1得分上优于纯神经和单步神经符号基线。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29108 2026-04-01 cs.LG 70%

Efficient Bilevel Optimization with KFAC-Based Hypergradients

基于KFAC的高效双层优化

Disen Liao, Felix Dangel, Yaoliang Yu

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 本文提出基于KFAC的双层优化方法,通过引入隐函数定理算法,提升了超梯度计算的效率与性能,优于CG和Neumann方法,在元学习和AI安全问题中表现优异。

Comments 25 pages, AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29593 2026-04-01 physics.soc-ph q-fin.CP 67%

Be Water: An Evolutionary Proof for Trend-Following

顺势而为:一种进化证明的跟风策略

Yijia Chen

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 本文通过构建大规模基于代理的模型,探讨了金融市场中跟风策略的进化可行性,发现顺应市场趋势的策略比逆势策略更具生存优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29661 2026-04-01 cs.CL cs.AI cs.IR 62%

Agenda-based Narrative Extraction: Steering Pathfinding Algorithms with Large Language Models

基于议程的叙述提取:用大语言模型引导路径查找算法

Brian Felipe Keith-Norambuena, Carolina Inés Rojas-Córdova, Claudio Juvenal Meneses-Villegas, Elizabeth Johanna Lam-Esquenazi, Angélica María Flores-Bustos, Ignacio Alejandro Molina-Villablanca, Joshua Emanuel Leyton-Vallejos

机构 * Department of Computing and Systems Engineering, Universidad Católica del Norte, Antofagasta, Chile(智利天主教大学北部校区计算与系统工程系,安托法加斯塔,智利) Department of Industrial Engineering, Universidad Católica del Norte, Antofagasta, Chile(智利天主教大学北部校区工业工程系,安托法加斯塔,智利) Department of Chemical and Environmental Engineering, Universidad Católica del Norte, Antofagasta, Chile(智利天主教大学北部校区化学与环境工程系,安托法加斯塔,智利)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于议程的叙述提取方法,通过整合大语言模型到路径查找过程中,引导叙述构建朝向用户指定视角,提升了叙述的连贯性和多视角支持。

Comments Text2Story Workshop 2026 at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28925 2026-04-01 cs.CL cs.AI 62%

Theory of Mind and Self-Attributions of Mentality are Dissociable in LLMs

语言模型中理论思维与自我归因的意识能力是可分离的

Junsol Kim, Winnie Street, Roberta Rocca, Daine M. Korngiebel, Adam Waytz, James Evans, Geoff Keeling

机构 * Google, Paradigms of Intelligence Team(Google,智能范式团队) Knowledge Lab, University of Chicago(芝加哥大学知识实验室) Institute of Philosophy, School of Advanced Study, University of London(伦敦大学高等研究院哲学研究所) Department of Biomedical Informatics and Medical Education and Department of Bioethics and Humanities, School of Medicine, University of Washington(华盛顿大学医学院生物医学信息学与医学教育系及生物伦理学与人文学系) Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) Santa Fe Institute(圣塔菲研究所)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,抑制语言模型的意识归因倾向不会影响其理论思维能力,但会降低其对非人类动物的归因和精神信念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13358 2026-04-01 cs.AI cs.LG 62%

The Geometry of Thought: How Scale Restructures Reasoning In Large Language Models

思维的几何学:大规模语言模型中规模如何重构推理

Samuel Cyrenius Anderson

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示大规模语言模型中推理能力的几何重构特性,通过分析不同领域和规模的推理轨迹,发现神经规模定律触发领域特定的相变而非均匀能力提升,提出神经推理算子并识别出跨领域和规模的振荡特征。

Comments The theoretical framework has been shown to be wrong and should not be followed for future research direction

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23095 2026-04-01 cs.HC cs.CY 57%

Exploring Sidewalk Sheds in New York City through Chatbot Surveys and Human Computer Interaction

通过聊天机器人调查和人机交互探索纽约市人行道遮蔽物

Junyi Li, Zhaoxi Zhang, Tamir Mendel, Takahiro Yabe

专题命中 其他安全 :safety(abstract);分类 cs.CY

AI总结 本文通过聊天机器人调查和人机交互研究纽约市人行道遮蔽物对行人可见性和通行的影响,利用AI模型分析遮蔽物设计特征,提供实证数据支持改进遮蔽物规范。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00241 2026-04-01 cs.HC cs.AI 57%

Balancing Efficiency and Empathy: Healthcare Providers' Perspectives on AI-Supported Workflows for Serious Illness Conversations in the Emergency Department

平衡效率与同理心:急诊部门医护人员对AI支持的严重疾病对话工作流的视角

Menglin Zhao, Zhuorui Yong, Ruijia Guan, Kai-Wei Chang, Adrian Haimovich, Kei Ouchi, Timothy Bickmore, Zhan Zhang, Bingsheng Yao, Dakuo Wang, Smit Desai

机构 * Northeastern University(东北大学) University of California, Los Angeles(加州大学洛杉矶分校) Beth Israel Deaconess Medical Center(贝斯以色列女执事医疗中心) Harvard Medical School, Dana-Farber Cancer Institute, Brigham and Women’s Hospital(哈佛医学院、丹娜-法伯癌症研究所、布里格姆妇女医院) Pace University(佩斯大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究探讨急诊医护人员在严重疾病对话中使用AI技术的挑战与机遇,提出四阶段工作流及设计指南,强调效率与人文关怀的平衡。

Comments To appear at ACM CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29432 2026-04-01 cs.LG eess.SP 57%

mtslearn: Machine Learning in Python for Medical Time Series

mtslearn:用于医疗时间序列的Python机器学习

Zhongheng Jiang, Yuechao Zhao, Donglin Xie, Chenxi Sun, Rongchen Lu, Silu Luo, Zisheng Liang, Shenda Hong

机构 * Nanjing University of Information Science and Technology(南京信息工程大学) National Institute of Health Data Science, Peking University(北京大学健康医疗大数据国家研究院) School of Health Humanities, Peking University Health Science Center(北京大学医学人文学院) Institute of Medical Technology, Peking University Health Science Center(北京大学医学技术研究院) Harvard Medical School(哈佛医学院) Beth Israel Deaconess Medical Center(贝斯以色列女执事医疗中心) School of Business English, Sichuan International Studies University(四川外国语大学商务英语学院) School of Clinical Medicine, Chengdu Medical College(成都医学院临床医学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) State Key Laboratory of Vascular Homeostasis and Remodeling, NHC Key Laboratory of Cardiovascular Molecular Biology and Regulatory Peptides, Peking University(北京大学血管稳态与重构全国重点实验室、国家卫生健康委员会心血管分子生物学与调节肽重点实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出mtslearn,一个专为医疗时间序列设计的端到端工具包,通过统一数据接口和模块化设计,简化数据处理流程,降低临床人员使用门槛,促进先进算法在临床实践中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21223 2026-04-01 cs.CV cs.CL 57%

Sigma: Semantically Informative Pre-training for Skeleton-based Sign Language Understanding

Sigma:基于骨骼的语义信息预训练用于手语理解

Muxin Pu, Mei Kuan Lim, Chun Yong Chong, Chen Change Loy

机构 * School of Information Technology, Monash University(莫纳什大学信息技术学院) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 Sigma提出一种统一的骨骼手语理解框架,通过语义对齐学习和预训练策略提升手语识别与翻译性能,展现语义信息预训练在多语言手语任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29698 2026-04-01 cs.SE 50%

Machine Learning in the Wild: Early Evidence of Non-Compliant ML-Automation in Open-Source Software

机器学习在野:开源软件中非合规ML自动化早期证据

Zohaib Arshid, Daniele Bifolco, Fiorella Zampetti, Massimiliano Di Penta

专题命中 其他安全 :safety(abstract)

AI总结 本文研究173个开源项目中机器学习模型的使用情况,分析其决策范围及合规性,为开发指南和监管工具提供基础。

Journal ref 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering July 05--09, 2026 Montreal, QC, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29692 2026-04-01 cs.CV 50%

SkeletonContext: Skeleton-side Context Prompt Learning for Zero-Shot Skeleton-based Action Recognition

SkeletonContext:基于骨架的零样本动作识别中的骨架侧上下文提示学习

Ning Wang, Tieyue Wu, Naeha Sharif, Farid Boussaid, Guangming Zhu, Lin Mei, Mohammed Bennamoun, zhang liang

机构 * Xidian University(西安电子科技大学) University of Western Australia(西澳大利亚大学) Donghai Lab(东海实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出SkeletonContext框架,通过引入跨模态上下文提示模块和关键部位解耦模块,提升骨架动作识别中上下文信息的利用,实现零样本场景下的高精度动作区分。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29664 2026-04-01 cs.CV 50%

CutClaw: Agentic Hours-Long Video Editing via Music Synchronization

CutClaw:通过音乐同步实现代理长时间视频编辑

Shifang Zhao, Yihan Hu, Ying Shan, Yunchao Wei, Xiaodong Cun

机构 * Beijing Jiaotong University(北京交通大学) GVC Lab, Great Bay University(大湾区大学GVC实验室) ARC Lab, Tencent(腾讯ARC实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出CutClaw,一种多代理框架,利用多模态语言模型自动编辑长时间原始素材为有意义的短视频,通过音乐同步和视觉优化提升视频质量。

Comments Project Code: https://github.com/GVCLab/CutClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29631 2026-04-01 cs.CV cs.DC cs.IR 50%

Storing Less, Finding More: How Novelty Filtering Improves Cross-Modal Retrieval on Edge Cameras

存储更少,查找更多:新颖性过滤如何改进边缘摄像头上的跨模态检索

Sherif Abdelwahab

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种流式检索架构,通过边缘设备的epsilon-net过滤器保留语义新颖帧,构建去噪嵌入索引,并结合跨模态适配器和云重排序器,提升边缘摄像头跨模态检索性能。

Comments 6 pages, 3 figures, 5 tables; supplementary video included as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03639 2026-04-01 cs.RO 50%

Context-Triggered Contingency Games for Strategic Multi-Agent Interaction

基于情境触发的应急游戏用于战略多智能体交互

Kilian Schweppe, Anne-Kathrin Schmuck

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出基于时序逻辑规范的战略游戏与实时动态应急游戏结合的新型框架,通过双层架构和因子图求解器实现多智能体在不确定环境中的安全与进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00524 2026-04-01 cs.CV 50%

Text-guided Fine-Grained Video Anomaly Understanding

基于文本引导的细粒度视频异常理解

Jihao Gu, Kun Li, He Wang, Kaan Akşit

机构 * University College London(伦敦大学学院) CVLab, College of Information Technology, United Arab Emirates University(阿联酋大学信息技术学院计算机视觉实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出T-VAU框架,通过多模态推理提取细粒度视频异常证据,结合Anomaly Heatmap Decoder和Region-aware Anomaly Encoder提升异常检测与解释能力。

Comments Accepted by CVPR 2026 SVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏