arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-26 至 2026-03-26 共收录 57 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 22 篇

2403.16501 2026-03-26 cs.AI 57%

Learning To Guide Human Decision Makers With Vision-Language Models

通过视觉-语言模型引导人类决策者

Debodeep Banerjee, Stefano Teso, Burcu Sayin, Andrea Passerini

机构 * DI, University of Pisa(比萨大学DI) DISI, University of Trento(特伦托大学DISI) CIMEC, University of Trento(特伦托大学CIMEC) Rajib Pal Bankura Sammilani Medical College(拉吉布·帕尔班克尔医学学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出LTG框架,通过视觉-语言模型生成可解释的决策指导,使人类负责最终决策,提升高风险场景下的决策质量与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24073 2026-03-26 cs.CL 57%

ConceptKT: A Benchmark for Concept-Level Deficiency Prediction in Knowledge Tracing

ConceptKT:一种用于知识追踪中概念层面缺陷预测的基准

Yu-Chen Kang, Yu-Chien Tang, An-Zi Yen

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出ConceptKT基准,通过标注问题所需概念和错误响应下的缺失概念,评估大语言模型和推理模型在概念层面缺陷预测中的性能。

Comments Accepted by LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23527 2026-03-26 cs.CL 57%

Compression Method Matters: Benchmark-Dependent Output Dynamics in LLM Prompt Compression

压缩方法至关重要:在LLM提示压缩中的基准依赖性输出动态

Warren Johnson

机构 * Plexor Labs(Plexor实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 研究探讨了提示压缩对输出长度和推理成本的影响,提出指令生存概率指标,并揭示了不同基准下的压缩效果差异,强调提示结构对压缩安全性和效率的重要性。

Comments 19 pages. Includes figures and tables. Companion code/data repository and direct NVML calibration dataset are cited in manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23479 2026-03-26 cs.CL 57%

FHIRPath-QA: Executable Question Answering over FHIR Electronic Health Records

FHIRPath-QA:基于FHIR电子健康记录的可执行问答

Michael Frew, Nishit Bheda, Bryan Tripp

机构 * University of British Columbia(不列颠哥伦比亚大学) University of Waterloo(滑铁卢大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出FHIRPath-QA,首个支持患者特定问题的开放数据集和基准,通过将推理转向FHIRPath查询合成,提升问答效率与准确性,验证了其在临床应用中的潜力。

Comments Accepted to LREC 2026 CL4Health Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11733 2026-03-26 cs.MA cs.AI 57%

SafeSieve: From Heuristics to Experience in Progressive Pruning for LLM-based Multi-Agent Communication

SafeSieve: 从启发式到经验在基于大语言模型的多智能体通信中的渐进剪枝

Ruijia Zhang, Xinyan Zhao, Ruixiang Wang, Sigen Chen, Guibin Zhang, An Zhang, Kun Wang, Qingsong Wen

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出SafeSieve,一种渐进适应的多智能体剪枝算法,通过双重机制动态优化智能体间通信。实验显示其在多个基准上实现了高准确率并显著降低token使用量,同时在异构环境下保持性能。

Comments AAAI-2026 poster; 7 pages for main content, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24484 2026-03-26 cs.CV 50%

Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models

视频-only ToM:增强多模态大语言模型的理论思维

Siqi Liu, Xinyang Li, Bochao Zou, Junbao Zhuo, Huimin Ma, Jiansheng Chen

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出VisionToM框架,通过视觉干预增强多模态大语言模型的理论思维能力,改进模型在多模态任务中的推理和问答性能。

Comments 20 pages, 7 figures, accepted at CVPR 2026, project page: see https://founce.github.io/VisionToM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24204 2026-03-26 cs.IR 50%

SumRank: Aligning Summarization Models for Long-Document Listwise Reranking

SumRank:对长文档列表级重排序进行总结化对齐

Jincheng Feng, Wenhan Liu, Zhicheng Dou

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出SumRank模型,通过压缩长文档为简洁的排序对齐摘要,提升列表级重排序的效率与效果,实验显示其在多个基准数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05629 2026-03-26 cs.SE cs.CV 50%

ROMAN: Reward-Orchestrated Multi-Head Attention Network for Autonomous Driving System Testing

ROMAN:基于奖励协调的多头注意力网络用于自动驾驶系统测试

Jianlei Chi, Yuzhen Wu, Jiaxuan Hou, Xiaodong Zhang, Ming Fan, Suhui Sun, Weijun Dai, Bo Li, Jianguo Sun, Jun Sun

机构 * IEEE Publication Technology Group(IEEE出版技术组) Hangzhou Institute of Technology, Xidian University(杭州科技学院,西安电子科技大学) Qingdao Port International Co., Ltd.(青岛港口国际有限公司) Shandong Port Qingdao Port Group Co., Ltd.(山东港口青岛港集团有限公司) University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) Singapore Management University(新加坡管理大学)

专题命中 安全评测 :safety(abstract)

AI总结 ROMAN通过结合多头注意力网络与交通法规加权机制,生成高风险违规场景,提升自动驾驶系统测试的全面性与针对性。

Comments The manuscript includes 13 pages, 8 tables, and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23925 2026-03-26 cs.CV 50%

DP^2-VL: Private Photo Dataset Protection by Data Poisoning for Vision-Language Models

DP^2-VL: 通过数据污染保护隐私照片的视觉语言模型隐私威胁模型

Hongyi Miao, Jun Jia, Xincheng Wang, Qianli Ma, Wei Sun, Wangqiu Zhou, Dandan Zhu, Yewen Cao, Zhi Liu, Guangtao Zhai

机构 * Shandong University(山东大学) Shanghai Jiao Tong University(上海交通大学) Donghua University(东华大学) Shanghai Normal University(上海师范大学) East China Normal University(华东师范大学) Hefei University of Technology(合肥工业大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出DP2-VL框架,通过数据污染保护隐私照片,分析视觉语言模型在身份关联泄露中的脆弱性,并展示其在不同保护比例下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23801 2026-03-26 cs.CR 50%

AgentRFC: Security Design Principles and Conformance Testing for Agent Protocols

AgentRFC:关于智能体协议的安全设计原则与合规性测试

Shenghan Zheng, Qifan Zhang

专题命中 安全评测 :safety(abstract)

AI总结 本文提出AgentProtocolStack、Agent-AgnosticSecurityModel和AgentConform,旨在为智能体协议提供系统性的安全框架,解决协议合规性测试问题,并揭示协议组合时的安全隐患。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19775 2026-03-26 cs.CV 50%

Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach

基于大语言模型的图像编辑评估:一个全面的基准和中间层探针方法

Shiqi Gao, Zitong Xu, Kang Fu, Huiyu Duan, Xiongkuo Min, Jia wang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出TIEdit基准和EditProbe方法,通过5120张编辑图像和专家评分,评估文本引导图像编辑方法的感知质量、对齐性和内容保真度,同时利用大语言模型中间层探针提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19507 2026-03-26 physics.acc-ph 50%

AI-Ready Control System for the Fermilab Accelerator Complex

面向 Fermilab 加速器复杂系统的 AI 准备控制系统

Tia Miceli, Erik Gottschalk, Donovan Tooke, Evan Milton, Robert Santucci, Hayden Hoschouer, Michael Balcewicz, Jennifer Case, Abhishek Deshpande, Kit Fieldhouse, Sudeshna Ganguly, Beau Harrison, Aisha Ibrahim, Thomas Kobilarcik, Michael Olander, Abhishek Pathak, Jason St. John, Aaron Sauers

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出面向 Fermilab 加速器复杂系统的 AI 准备控制系统,涵盖 MLOps 框架、数据质量框架及大语言模型整合,以支持高强度可靠运行。

Comments 43 pages, 31 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 2 篇

2603.24528 2026-03-26 cs.CV 78%

Cross-Modal Prototype Alignment and Mixing for Training-Free Few-Shot Classification

跨模态原型对齐与混合用于无训练少样本分类

Dipam Goswami, Simone Magistri, Gido M. van de Ven, Bartłomiej Twardowski, Andrew D. Bagdanov, Tinne Tuytelaars, Joost van de Weijer

机构 * Department of Computer Science, Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学计算机科学系) Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心) Media Integration and Communication Center, University of Florence, Italy(佛罗伦萨大学媒体整合与传播中心) Bernoulli Institute, University of Groningen, the Netherlands(格罗宁根大学伯努利学院) IDEAS Research Institute, Poland(波兰IDEAS研究所) ESAT-PSI, KU Leuven, Belgium(比利时KU莱顿大学ESAT-PSI)

专题命中 AI治理与伦理 :alignment(title,abstract)

AI总结 本文研究了直接混合图像与文本原型对少样本分类的影响,提出通过投影获取语义对齐的图像子空间,结合文本嵌入和图像特定LDA分类器提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24580 2026-03-26 cs.CL cs.AI cs.CY cs.IR cs.LG 70%

Retrieval Improvements Do Not Guarantee Better Answers: A Study of RAG for AI Policy QA

检索改进并不保证更好的答案:RAG在人工智能政策问答中的研究

Saahil Mathur, Ryan David Rittner, Vedant Ajit Thakur, Daniel Stuart Schiff, Tunazzina Islam

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学) Department of Political Science, Purdue University(政治学系,普渡大学)

专题命中 AI治理与伦理 :DPO(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文研究了RAG在人工智能治理中的应用,发现领域特定微调虽提升检索指标,但未必改善问答性能,尤其在相关文档缺失时可能导致更自信的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 13 篇

2603.24030 2026-03-26 cs.CV cs.MM 78%

Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection

分解与迁移:基于CoT提示的对齐增强开放词汇时序动作检测

Sa Zhu, Wanqian Zhang, Lin Wang, Xiaohua Chen, Chenxu Cui, Jinchao Zhang, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) Hangzhou Dianzi University(杭州电子科技大学) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出PDA框架,通过CoT提示语义分解和适应性相位对齐,提升开放词汇时序动作检测的跨类别迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24535 2026-03-26 cs.CL cs.CY 62%

Representation Learning to Study Temporal Dynamics in Tutorial Scaffolding

基于表示学习研究教程支架的动态过程

Conrad Borchers, Jiayi Zhang, Ashish Gurung

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文通过对话语义对齐分析,揭示了教程支架中任务对齐和时间模式的系统差异,证明角色特定语义对齐能预测教学进展。

Comments Accepted as short paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23714 2026-03-26 cs.AI cs.CL 62%

LLMs Do Not Grade Essays Like Humans

大型语言模型并不像人类那样评分作文

Jerin George Mathew, Sumayya Taher, Anindita Kundu, Denilson Barbosa

机构 * University of Alberta(阿尔伯塔大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了LLM生成的评分与人类评分的一致性,发现LLM在评分时存在偏差,倾向于给短或不充分的作文高分,而给较长但有小错误的作文低分,表明LLM的评分机制与人类不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09195 2026-03-26 cs.CL cs.AI 62%

ProFit: Leveraging High-Value Signals in SFT via Probability-Guided Token Selection

ProFit:通过概率引导的标记选择利用SFT中的高价值信号

Tao Liu, Taiqiang Wu, Runming Yang, Shaoning Sun, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ProFit通过概率引导的标记选择策略,有效缓解SFT中单参考答案导致的过拟合问题,提升模型在通用推理和数学任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24539 2026-03-26 cs.CV cs.AI 57%

CliPPER: Contextual Video-Language Pretraining on Long-form Intraoperative Surgical Procedures for Event Recognition

CliPPER:基于长形式术中手术程序的上下文视频-语言预训练用于事件识别

Florian Stilz, Vinkle Srivastav, Nassir Navab, Nicolas Padoy

机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, France(斯特拉斯堡大学,法国国家科学研究中心,法国国家医学研究院,ICube,UMR7357,法国) IHU Strasbourg, France(斯特拉斯堡IHU,法国) Technical University of Munich, Germany(慕尼黑技术大学,德国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出CliPPER框架,通过手术讲座视频预训练,提升长形式手术视频的细粒度时间视频-文本识别,引入VTC_CTX和COP等预训练策略,改进多模态对齐,实现多个公开手术基准的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24262 2026-03-26 cs.LG 57%

Forecasting with Guidance: Representation-Level Supervision for Time Series Forecasting

基于指导的预测:用于时间序列预测的表示级监督

Jiacheng Wang, Liang Fan, Baihua Li, Luyan Zhang

机构 * Xijing University(西安电子科技大学) Northeastern University(东北大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出ReGuider方法,通过预训练时间序列基础模型进行表示级监督,提升时间序列预测的准确性与表现力。

Comments 6 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07047 2026-03-26 cs.CV cs.LG 57%

ShapBPT: Image Feature Attributions Using Data-Aware Binary Partition Trees

ShapBPT:基于数据感知二进制划分树的图像特征归因

Muhammad Rashid, Elvio G. Amparore, Enrico Ferrari, Damiano Verda

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出ShapBPT,一种基于层次Shapley公式的数据感知图像可视化方法,通过多尺度二进制划分树结构提升图像特征归因的效率与语义意义。

Comments Presented at AAAI-26 conference and published in Proceedings of the The Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24454 2026-03-26 cs.CV 50%

Unleashing Vision-Language Semantics for Deepfake Video Detection

释放视觉-语言语义以进行深度伪造视频检测

Jiawen Zhu, Yunqi Miao, Xueyi Zhang, Jiankang Deng, Guansong Pang

机构 * Singapore Management University(新加坡管理学院) The University of Warwick(沃里克大学) Nanyang Technological University(南洋理工大学) Imperial College London(伦敦帝国理工学院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出VLAForge框架,通过ForgePerceiver增强视觉感知并引入身份感知VLA评分,利用跨模态语义提升深度伪造检测的判别能力。

Comments 14 pages, 7 figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24383 2026-03-26 cs.CV 50%

ViHOI: Human-Object Interaction Synthesis with Visual Priors

ViHOI:基于视觉先验的人-物交互合成

Songjin Cai, Linjie Zhong, Ling Guo, Changxing Ding

机构 * South China University of Technology(华南理工大学)

专题命中 其他安全 :alignment(abstract)

AI总结 ViHOI通过从2D图像中提取丰富的交互先验,利用扩散模型提升生成质量,实现人-物交互的高质量合成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24381 2026-03-26 physics.soc-ph cs.SY eess.SY 50%

On a Co-evolving Opinion-Leadership Model in Social Networks

社会网络中共演的意见领袖模型研究

Martina Alutto, Lorenzo Zino, Karl H. Johansson, Angela Fontan

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种动态系统,探讨意见与领导力在社会网络中的共演机制,扩展了Friedkin-Johnsen框架,分析了领导力与说服力的平衡关系及收敛条件。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23733 2026-03-26 cs.HC 50%

Exploring Self-Tracking Practices of Older Adults with CVD to Inform the Design of LLM-Enabled Health Data Sensemaking

探索心血管疾病老年人的自我追踪实践以指导LLM赋能的健康数据解读设计

Duosi Dai, Pavithren V S Pakianathan, Gunnar Treff, Mahdi Sareban, Jan David Smeddinck, Sanna Kuoppamäki

专题命中 其他安全 :safety(abstract)

AI总结 研究探讨老年人如何解读自我追踪数据,并提出基于LLM的健康数据解读设计方向,强调情感参与、患者自主性及对话促进。

Comments 23 pages,4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13528 2026-03-26 cs.RO cs.CV 50%

Learning Actionable Manipulation Recovery via Counterfactual Failure Synthesis

通过反事实失败合成学习可操作的操纵恢复

Dayou Li, Jiuzhou Lei, Hao Wang, Lulin Liu, Yunhao Yang, Zihan Wang, Bangya Liu, Minghui Zheng, Zhiwen Fan

机构 * Texas A&M University(德克萨斯A&M大学) University of Minnesota(明尼苏达大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Abaka AI(Abaka人工智能) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出Dream2Fix框架,通过生成反事实失败场景数据提升机器人故障恢复能力,实现高精度的故障诊断与轨迹修正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10779 2026-03-26 eess.SY cs.SY 50%

A Control-Theoretic Foundation for Agentic Systems

代理系统控制论基础

Ali Eslami, Jiangbo Yu

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一种控制论框架,用于分析嵌入反馈控制回路中的代理系统,探讨代理在运行时调整控制器参数、选择控制策略等能力,并通过五级代理层次结构展示其动态机制。

详情

展开后加载摘要…

URL PDF HTML 收藏