arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-26 至 2026-03-26 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 13 篇

2603.24030 2026-03-26 cs.CV cs.MM 78%

Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection

分解与迁移:基于CoT提示的对齐增强开放词汇时序动作检测

Sa Zhu, Wanqian Zhang, Lin Wang, Xiaohua Chen, Chenxu Cui, Jinchao Zhang, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) Hangzhou Dianzi University(杭州电子科技大学) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出PDA框架,通过CoT提示语义分解和适应性相位对齐,提升开放词汇时序动作检测的跨类别迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24535 2026-03-26 cs.CL cs.CY 62%

Representation Learning to Study Temporal Dynamics in Tutorial Scaffolding

基于表示学习研究教程支架的动态过程

Conrad Borchers, Jiayi Zhang, Ashish Gurung

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文通过对话语义对齐分析,揭示了教程支架中任务对齐和时间模式的系统差异,证明角色特定语义对齐能预测教学进展。

Comments Accepted as short paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23714 2026-03-26 cs.AI cs.CL 62%

LLMs Do Not Grade Essays Like Humans

大型语言模型并不像人类那样评分作文

Jerin George Mathew, Sumayya Taher, Anindita Kundu, Denilson Barbosa

机构 * University of Alberta(阿尔伯塔大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了LLM生成的评分与人类评分的一致性,发现LLM在评分时存在偏差,倾向于给短或不充分的作文高分,而给较长但有小错误的作文低分,表明LLM的评分机制与人类不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09195 2026-03-26 cs.CL cs.AI 62%

ProFit: Leveraging High-Value Signals in SFT via Probability-Guided Token Selection

ProFit:通过概率引导的标记选择利用SFT中的高价值信号

Tao Liu, Taiqiang Wu, Runming Yang, Shaoning Sun, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ProFit通过概率引导的标记选择策略,有效缓解SFT中单参考答案导致的过拟合问题,提升模型在通用推理和数学任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24539 2026-03-26 cs.CV cs.AI 57%

CliPPER: Contextual Video-Language Pretraining on Long-form Intraoperative Surgical Procedures for Event Recognition

CliPPER:基于长形式术中手术程序的上下文视频-语言预训练用于事件识别

Florian Stilz, Vinkle Srivastav, Nassir Navab, Nicolas Padoy

机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, France(斯特拉斯堡大学,法国国家科学研究中心,法国国家医学研究院,ICube,UMR7357,法国) IHU Strasbourg, France(斯特拉斯堡IHU,法国) Technical University of Munich, Germany(慕尼黑技术大学,德国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出CliPPER框架,通过手术讲座视频预训练,提升长形式手术视频的细粒度时间视频-文本识别,引入VTC_CTX和COP等预训练策略,改进多模态对齐,实现多个公开手术基准的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24262 2026-03-26 cs.LG 57%

Forecasting with Guidance: Representation-Level Supervision for Time Series Forecasting

基于指导的预测:用于时间序列预测的表示级监督

Jiacheng Wang, Liang Fan, Baihua Li, Luyan Zhang

机构 * Xijing University(西安电子科技大学) Northeastern University(东北大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出ReGuider方法,通过预训练时间序列基础模型进行表示级监督,提升时间序列预测的准确性与表现力。

Comments 6 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07047 2026-03-26 cs.CV cs.LG 57%

ShapBPT: Image Feature Attributions Using Data-Aware Binary Partition Trees

ShapBPT:基于数据感知二进制划分树的图像特征归因

Muhammad Rashid, Elvio G. Amparore, Enrico Ferrari, Damiano Verda

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出ShapBPT,一种基于层次Shapley公式的数据感知图像可视化方法,通过多尺度二进制划分树结构提升图像特征归因的效率与语义意义。

Comments Presented at AAAI-26 conference and published in Proceedings of the The Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24454 2026-03-26 cs.CV 50%

Unleashing Vision-Language Semantics for Deepfake Video Detection

释放视觉-语言语义以进行深度伪造视频检测

Jiawen Zhu, Yunqi Miao, Xueyi Zhang, Jiankang Deng, Guansong Pang

机构 * Singapore Management University(新加坡管理学院) The University of Warwick(沃里克大学) Nanyang Technological University(南洋理工大学) Imperial College London(伦敦帝国理工学院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出VLAForge框架,通过ForgePerceiver增强视觉感知并引入身份感知VLA评分,利用跨模态语义提升深度伪造检测的判别能力。

Comments 14 pages, 7 figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24383 2026-03-26 cs.CV 50%

ViHOI: Human-Object Interaction Synthesis with Visual Priors

ViHOI:基于视觉先验的人-物交互合成

Songjin Cai, Linjie Zhong, Ling Guo, Changxing Ding

机构 * South China University of Technology(华南理工大学)

专题命中 其他安全 :alignment(abstract)

AI总结 ViHOI通过从2D图像中提取丰富的交互先验,利用扩散模型提升生成质量,实现人-物交互的高质量合成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24381 2026-03-26 physics.soc-ph cs.SY eess.SY 50%

On a Co-evolving Opinion-Leadership Model in Social Networks

社会网络中共演的意见领袖模型研究

Martina Alutto, Lorenzo Zino, Karl H. Johansson, Angela Fontan

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种动态系统,探讨意见与领导力在社会网络中的共演机制,扩展了Friedkin-Johnsen框架,分析了领导力与说服力的平衡关系及收敛条件。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23733 2026-03-26 cs.HC 50%

Exploring Self-Tracking Practices of Older Adults with CVD to Inform the Design of LLM-Enabled Health Data Sensemaking

探索心血管疾病老年人的自我追踪实践以指导LLM赋能的健康数据解读设计

Duosi Dai, Pavithren V S Pakianathan, Gunnar Treff, Mahdi Sareban, Jan David Smeddinck, Sanna Kuoppamäki

专题命中 其他安全 :safety(abstract)

AI总结 研究探讨老年人如何解读自我追踪数据,并提出基于LLM的健康数据解读设计方向,强调情感参与、患者自主性及对话促进。

Comments 23 pages,4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13528 2026-03-26 cs.RO cs.CV 50%

Learning Actionable Manipulation Recovery via Counterfactual Failure Synthesis

通过反事实失败合成学习可操作的操纵恢复

Dayou Li, Jiuzhou Lei, Hao Wang, Lulin Liu, Yunhao Yang, Zihan Wang, Bangya Liu, Minghui Zheng, Zhiwen Fan

机构 * Texas A&M University(德克萨斯A&M大学) University of Minnesota(明尼苏达大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Abaka AI(Abaka人工智能) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出Dream2Fix框架,通过生成反事实失败场景数据提升机器人故障恢复能力,实现高精度的故障诊断与轨迹修正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10779 2026-03-26 eess.SY cs.SY 50%

A Control-Theoretic Foundation for Agentic Systems

代理系统控制论基础

Ali Eslami, Jiangbo Yu

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一种控制论框架,用于分析嵌入反馈控制回路中的代理系统,探讨代理在运行时调整控制器参数、选择控制策略等能力,并通过五级代理层次结构展示其动态机制。

详情

展开后加载摘要…

URL PDF HTML 收藏