arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-24 至 2026-03-24 共收录 116 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 27 篇

2603.21341 2026-03-24 cs.AI 79%

RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models

RoboAlign:学习测试时推理以改进视觉-语言-动作模型中的语言-动作对齐

Dongyoung Kim, Sumin Park, Woomin Song, Seungku Kim, Taeyoung Kim, Huiwon Jang, Jinwoo Shin, Jaehyung Kim, Younggyo Seo

机构 * Yonsei University(延世大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出RoboAlign框架,通过零样本自然语言推理生成动作标记并结合强化学习提升动作准确性,从而在视觉-语言-动作模型中实现语言与低级动作之间的对齐,提升模型性能。

Comments 15 pages, 7 figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17655 2026-03-24 cs.CV cs.AI 79%

Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignment

可解释的跨领域少样本学习与修正的目标域局部对齐

Yaze Zhao, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出CC-CDFSL方法,通过循环一致性解决CLIP-based CDFSL中的局部对齐问题,提升局部视觉语言对齐和可解释性,实现SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00431 2026-03-24 cs.CV cs.AI 79%

Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models

面向层次视觉识别的分类意识表示对齐

Hulingxiao He, Zhi Tan, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机系王轩研究所)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出TARA方法,通过生物基础模型的层次对比学习将分类知识注入大模态模型,提升层次视觉识别中对已知和新类别的识别性能。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20985 2026-03-24 cs.CV 78%

Consistent but Dangerous: Per-Sample Safety Classification Reveals False Reliability in Medical Vision-Language Models

一致却危险:每样本安全分类揭示医疗视觉-语言模型中的虚假可靠性

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven(SAIL实验室,新罕布什尔大学)

专题命中 其他安全 :safety(title,abstract)

AI总结 研究揭示医疗VLMs中一致性指标的缺陷,通过四象限分类发现危险样本高准确率且低熵,建议部署评估需结合文本基线以识别虚假可靠性。

Comments CVPR 2026 Workshop on Medical Reasoning with Vision Language Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21319 2026-03-24 cs.LG 70%

Active Inference Agency Formalization, Metrics, and Convergence Assessments

主动推断代理的正式化、指标与收敛性评估

Eduard Kapelko

机构 * Eduard Kapelko

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 本文通过定义代理并建立分析框架,探讨了AI安全中 mesa-优化的关键挑战,提出代理的连续表示及其在稀疏环境中的收敛性,提供了一种衡量代理程度的指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20406 2026-03-24 cs.LG cs.AI 62%

Thinking in Different Spaces: Domain-Specific Latent Geometry Survives Cross-Architecture Translation

在不同空间中思考:领域特定的潜在几何在跨架构翻译中得以保持

Marcus Armstrong, Navid Ayoobi, Arjun Mukherjee

机构 * Department of Computer Science(计算机科学系) University of Houston(休斯顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了独立训练的语言模型是否收敛到几何兼容的潜在表示,并探讨如何利用这种兼容性在推理时纠正模型行为。通过线性投影矩阵将大教师模型的激活向量映射到小学生模型的坐标系中,通过替换学生内部状态实现干预,结果显示方法在不同推理领域具有泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20311 2026-03-24 cs.SE cs.AI cs.CL 62%

kRAIG: A Natural Language-Driven Agent for Automated DataOps Pipeline Generation

kRAIG:一种基于自然语言的自动化数据Ops流水线生成代理

Rohan Siva, Kai Cheung, Lichi Li, Ganesh Sundaram

机构 * Cisco(思科公司)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 kRAIG通过ReQuesAct框架明确用户意图,利用检索增强的工具合成过程生成KFP流水线,提升数据提取和加载的成功率及转换准确性。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06767 2026-03-24 cs.LG cs.AI 62%

Failure Detection in Chemical Processes Using Symbolic Machine Learning: A Case Study on Ethylene Oxidation

利用符号机器学习进行化学过程故障检测:乙烯氧化的案例研究

Julien Amblard, Niklas Groll, Matthew Tait, Mark Law, Gürkan Sin, Alessandra Russo

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文利用符号机器学习预测化学过程故障,通过乙烯氧化案例展示其在解释性与预测性能上的优势。

Comments Accepted at AAAI-MAKE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21854 2026-03-24 cs.AI 57%

Reasoning or Rhetoric? An Empirical Analysis of Moral Reasoning Explanations in Large Language Models

推理还是修辞?对大型语言模型中道德推理解释的实证分析

Aryan Kasat, Smriti Singh, Aman Chadha, Vinija Jain

机构 * TCS AI Practice(TCS人工智能实践) UT Austin(德克萨斯大学奥斯汀分校) Amazon GenAI(亚马逊生成人工智能) Google GenAI(谷歌生成人工智能)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究通过分析LSTM对道德困境的回应,探讨其是否具备道德发展阶段的真正进展,发现其表现出后常规推理,且存在道德解耦现象,揭示了对成熟道德推理的修辞模仿。

Comments 32 pages, 34 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21708 2026-03-24 cs.AI cs.CV 57%

Compensating Visual Insufficiency with Stratified Language Guidance for Long-Tail Class Incremental Learning

通过分层语言指导补偿视觉不足以实现长尾类增量学习

Xi Wang, Xu Yang, Donghao Sun, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出分层语言指导方法,通过构建语义层次结构缓解长尾类增量学习中的样本稀缺和灾难性遗忘问题,实验表明方法在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21571 2026-03-24 cs.CL 57%

DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing

DATASHI:一个平行的英语-塔希利耶特语语料库用于正字法规范化和低资源语言处理

Nasser-Eddine Monir, Zakaria Baou

机构 * Université de Lorraine, CNRS, Inria, LORIA(洛林大学、法国国家科学研究中心、法国国家信息与自动化技术研究院、LORIA实验室) ISIMA, Université Clermont Auvergne(克莱蒙特奥弗涅大学ISIMA)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 DATASHI提供了一个包含5000对句子的平行语料库,包含1500个经过专家标准化和非标准用户生成的句子,用于研究正字法多样性及规范化,支持NLP任务并为多模态对齐提供基础。

Comments This paper has been accepted for presentation at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21567 2026-03-24 cs.LG 57%

Kolmogorov Complexity Bounds for LLM Steganography and a Perplexity-Based Detection Proxy

LLM隐写术的柯尔莫哥洛夫复杂度界限及基于困惑度的检测代理

Andrii Shportko

机构 * Northwestern University(西北大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文研究了LLM隐写术的信息理论成本,证明了隐写方案必须满足复杂度增加的界限,并提出基于困惑度的检测代理,通过实验验证了理论预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03235 2026-03-24 cs.AI 57%

From Five Dimensions to Many: Large Language Models as Precise and Interpretable Psychological Profilers

从五维到更多:大型语言模型作为精确且可解释的心理档案师

Yi-Fei Liu, Yi-Long Lu, Di He, Hang Zhang

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文研究了大型语言模型能否通过少量量化输入建模人类心理特质的相关结构,发现其在零样本情况下能准确预测心理特质,揭示了LLM通过抽象和推理实现精确预测的机制。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21105 2026-03-24 cs.LG 57%

ResPrune: Text-Conditioned Subspace Reconstruction for Visual Token Pruning in Large Vision-Language Models

ResPrune:基于文本的子空间重建用于大视觉-语言模型中的视觉令牌修剪

Xu Li, Yi Zheng, Yuxuan Liang, Zhe Liu, Xiaolei Chen, Haotian Chen, Rui Zhu, Xiangyang Xue

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 ResPrune通过子空间重建方法实现视觉令牌修剪,结合文本相关性选择信息量大的令牌,提升大视觉-语言模型推理效率,减少计算和内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01869 2026-03-24 q-fin.CP cs.LG 57%

BondBERT: What we learn when assigning sentiment in the bond market

BondBERT: 在债券市场中进行情感分析时我们学到了什么

Toby Barter, Zheng Gao, Eva Christodoulaki, Jing Chen, John Cartlidge

机构 * School of Engineering Mathematics and Technology, University of Bristol, Bristol, UK(工程数学与技术学院,布里斯托尔大学,布里斯托尔,英国) School of Mathematics, Cardiff University, Cardiff, UK(数学学院,卡迪夫大学,卡迪夫,英国)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出BondBERT,一种针对债券市场新闻微调的Transformer模型,用于提供与预测模型集成的情感信号,通过对比实验显示其在预测准确性上优于现有模型。

Comments 8 pages, 3 figures, author manuscript accepted for ICAART 2026: 18th International Conference on Agents and Artificial Intelligence, Mar. 2026, Marbella, Spain

Journal ref 18th International Conference on Agents and Artificial Intelligence (ICAART), Volume 5, Mar. 2026, pp. 4056-4063

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20300 2026-03-24 cs.SE cs.AI 57%

From Human Interfaces to Agent Interfaces: Rethinking Software Design in the Age of AI-Native Systems

从人机界面到代理界面:在AI原生系统时代重新思考软件设计

Shaolin Wang, Yi Mei, Haoyang Che, He Jiang, Shui Yu, Ying Gu

机构 * Victoria University of Wellington, New Zealand(维多利亚大学惠灵顿分校) Independent Researcher(独立研究员) Dalian University of Technology, China(大连理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文探讨了软件设计从以人为中心的界面转向以代理为中心的调用系统,提出了代理接口的概念和设计原则,为AI原生软件设计提供理论基础。

Comments 4 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22115 2026-03-24 cs.HC 50%

Designing Medical Chatbots where Accuracy and Acceptability are in Conflict: An Exploratory, Vignette-based Study in Urban India

在准确性和可接受性冲突下设计医疗聊天机器人:一项针对印度城市居民的探索性、情境化研究

Ananditha Raghunath, William Thies, Mohit Jain

专题命中 其他安全 :alignment(abstract)

AI总结 研究探讨了医疗聊天机器人中准确性与可接受性冲突的问题,通过200名印度城市成年人的调查,发现用户倾向于拒绝与指南不一致的建议,并通过设计情境感知的提示来调整期望,以提升指南一致性的建议接受度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21913 2026-03-24 cs.RO cs.SY eess.SY math.OC 50%

Collision-Free Velocity Scheduling for Multi-Agent Systems on Predefined Routes via Inexact-Projection ADMM

多智能体系统在预定义路线上的无碰撞速度调度:基于不精确投影ADMM

Seungyeop Lee, Jong-Han Kim

机构 * Department of Aerospace Engineering and the Program in Aerospace Systems Convergence(航空航天工程系和航空航天系统融合项目)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一种基于不精确投影ADMM的方法,用于在预定义路线中协调多智能体系统,通过优化航点通过时间并保持航点顺序和名义路线分配,实现无碰撞的速度调度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21504 2026-03-24 cs.CV 50%

Parameter-efficient Prompt Tuning and Hierarchical Textual Guidance for Few-shot Whole Slide Image Classification

高效参数提示调优与层次文本引导在少样本整张滑片图像分类中的应用

Jayanie Bogahawatte, Sachith Seneviratne, Saman Halgamuge

机构 * AI, Optimization and Pattern Recognition Research Group(人工智能、优化与模式识别研究组) Dept. of Mechanical Eng., University of Melbourne, Australia(墨尔本大学机械工程系,澳大利亚)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出高效参数提示调优和层次文本引导方法,以解决少样本整张滑片图像分类中的计算成本和信息损失问题,实验显示在乳腺、肺癌和卵巢癌数据集上均取得显著提升。

Comments Accepted for publication at CVPR 2026 Workshop on Medical Reasoning with Vision Language Foundation Models (Med-Reasoner)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04559 2026-03-24 cs.CV 50%

Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning

面向可扩展多模态推理的推理对齐感知解耦

Yunhao Gou, Kai Chen, Zhili Liu, Lanqing Hong, Xin Jin, Zhenguo Li, James T. Kwok, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huawei Cloud Project(华为云项目)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出RAPID方法,通过解耦多模态模型的感知与推理模块,利用强化学习优化感知输出,使模型能与任意强大文本推理模型配合,实现无需重新训练的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21069 2026-03-24 cs.CV 50%

NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detection

NoOVD:开放词汇物体检测中的新类别发现与嵌入

Yupeng Zhang, Ruize Han, Zhiwei Chen, Wei Feng, Liang Wan

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院) Key Research Center for Surface Monitoring and Analysis of Relics, State Administration of Cultural Heritage(文物表面监测与分析国家重点研究中心) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳先进技术大学计算机科学与人工智能学院) School of Artificial Intelligence, Nanchang University(南昌大学人工智能学院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出NoOVD框架,通过自蒸馏机制和K-FPN模块提升开放词汇物体检测中新类别的识别与嵌入效果,同时引入R-RPN提升召回率,实验表明在多个数据集上表现优异。

Comments CVPR 2026 Accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20626 2026-03-24 cs.SI 50%

The Art of Midwifery in LLMs: Optimizing Role Personas for Large Language Models as Moral Assistants

LLM中的产科艺术:为大型语言模型作为道德助手优化角色人格

Yangyi Wu, Tianqi Wang, Xilin Liu

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出将AI作为道德助手,通过'产科艺术'促进用户道德成长,而非替代人类判断。通过六个道德场景对话,发现不同人格类型在不同情境下表现各异,引入'建设性分歧'概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15093 2026-03-24 eess.SP cs.IT math.IT 50%

Beam Prediction Based on Multimodal Large Language Models

基于多模态大语言模型的波束预测

Tianhao Mao, Le Liang, Jie Yang, Xiao Li, Shi Jin, Geoffrey Ye Li

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出基于多模态大语言模型的波束预测框架,通过融合RGB图像和LiDAR点云等异构数据,提升动态环境下波束预测精度与通信性能,实验表明其在波束准确性和通信性能上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21460 2026-03-24 cs.HC 50%

Tell Me What I Missed: Interacting with GPT during Recalling of One-Time Witnessed Events

告诉我我错过了什么:在回忆一次目睹事件时与GPT互动

Suifang Zhou, Qi Gong, Ximing Shen, Ray LC

专题命中 其他安全 :alignment(abstract)

AI总结 研究探讨了在回忆一次性目睹事件时,用户如何与GPT交互,发现默认模式下用户更信任GPT输出,而引导模式下用户回忆与主观清晰度更一致,且不同条件下对事件中人物的合法性评价也不同。

Comments 19 pages, 9 figures, CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21284 2026-03-24 cs.CV 50%

Toward Real-Time Surgical Scene Segmentation via a Spike-Driven Video Transformer with Spike-Informed Pretraining

迈向实时手术场景分割的脉冲驱动视频变换器及其基于脉冲的预训练

Shihao Zou, Jingjing Li, Wei Ji, Jincai Huang, Kai Wang, Guo Dan, Weixin Si, Yi Pan

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Alberta(阿尔伯塔大学) School of Medicine, Yale University(耶鲁大学医学院) Southern University of Science and Technology(南方科技大学) Nanfang Hospital Southern Medical University(南方医科大学南华医院) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院) Faculty of Computer Science and Control Engineering, Shenzhen University of Advanced Technology(深圳先进技术研究院计算机科学与控制工程学院)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出SpikeSurgSeg,一种基于脉冲驱动的视频变换器,用于手术场景分割。通过引入基于MAE的脉冲感知预训练策略和多谱知识蒸馏,提升模型在数据稀缺场景下的性能,同时减少推理延迟并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20575 2026-03-24 cs.RO physics.space-ph 50%

Current state of the multi-agent multi-view experimental and digital twin rendezvous (MMEDR-Autonomous) framework

多智能体多视角实验与数字孪生会合(MMEDR-自主)框架的当前状态

Logan Banker, Michael Wozniak, Mohanad Alameer, Smriti Nandan Paul, David Meisinger, Grant Baer, Trevor Hunting, Ryan Dunham, Jay Kamdar

机构 * Department of Mechanical and Aerospace Engineering(机械与航空航天工程系) Missouri University of Science and Technology(密苏里科技大学) Purdue University(普渡大学)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出MMEDR-自主框架,结合学习型光学导航网络、强化学习引导方法和硬件在环测试台,旨在提升空间任务的自主性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏