arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-30 至 2026-04-30 共收录 18 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 18 篇

2504.14668 2026-04-30 cs.DC 88%

A Byzantine Fault Tolerance Approach towards AI Safety

面向AI安全的拜占庭容错方法

John deVadoss, Matthias Artzt

专题命中 其他安全 :safety(title,abstract);AI safety(title,abstract)

AI总结 本文借鉴分布式计算中的拜占庭容错机制,提出通过共识机制提升AI系统可靠性与安全性的架构,以应对意外故障和对抗性条件。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09870 2026-04-30 cs.HC cs.AI cs.CL 81%

Vibe Check: Understanding the Effects of LLM-Based Conversational Agents' Personality and Alignment on User Perceptions in Goal-Oriented Tasks

Vibe Check: 探讨基于大语言模型的对话代理的性格和对齐对用户在目标导向任务中的感知影响

Hasibur Rahman, Smit Desai

机构 * Northeastern University(东北大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了对话代理性格表达水平和用户与代理性格对齐如何影响用户在目标导向任务中的感知,发现中等表达水平在多个维度上表现最佳,性格对齐进一步提升了结果,尤其在外向性和情绪稳定性和方面影响显著。

Comments 30 pages, CHI 2026 conference paper (article no. 371)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26370 2026-04-30 cs.CV cs.LG math.AT 79%

Topology-Aware Representation Alignment for Semi-Supervised Vision-Language Learning

面向拓扑的表示对齐用于半监督视觉-语言学习

Junwon You, Mihyun Jang, Sangwoo Mo, Jae-Hun Jung

机构 * KAIST(韩国科学技术院) POSTECH

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出ToMA框架,通过持久同调识别拓扑显著边,利用跨模态对应关系对齐多模态表示,提升视觉-语言学习在遥感和时尚检索中的性能。

Comments 30 pages, 10 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20032 2026-04-30 cs.CV cs.LG cs.RO 74%

ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers

ViTaPEs: 视觉触觉位置编码用于多模态转换器中的跨模态对齐

Fotios Lygerakis, Ozan Özdenizci, Elmar Rückert

机构 * Chair of Cyber-Physical Systems(感知系统教授席位) Institute of Machine Learning and Neural Computation(机器学习与神经计算研究所) Technical University of Leoben(莱比锡技术大学) Graz University of Technology(格拉茨技术大学)

专题命中 其他安全 :alignment(title);分类 cs.LG

AI总结 ViTaPEs通过两阶段位置注入学习任务无关的视觉触觉表示,提升多模态对齐性能,实验证明其在多种任务和领域中的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26880 2026-04-30 cs.CL cs.LG 62%

HealthNLP_Retrievers at ArchEHR-QA 2026: Cascaded LLM Pipeline for Grounded Clinical Question Answering

HealthNLP_Retrievers在ArchEHR-QA 2026中的表现:基于级联LLM管道的 grounded临床问答

Md Biplob Hosen, Md Alomgeer Hussein, Md Akmol Masud, Omar Faruque, Tera L Reynolds, Lujie Karen Chen

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校) Jahangirnagar University(贾旺吉拉大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于Gemini 2.5 Pro的级联管道,通过多阶段模块实现患者问题理解、证据检索与回答生成,提升临床问答的准确性和专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26361 2026-04-30 cs.CL cs.AI 62%

Text Style Transfer with Machine Translation for Graphic Designs

通过机器翻译进行文本风格迁移用于图形设计

Deergh Singh Budhauria, Sanyam Jain, Rishav Agarwal, Tracy King

机构 * Adobe

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了三种新方法用于图形设计文本风格迁移中的词对齐问题,基于商业可用的NMT和LLM翻译技术,通过定制输入输出标签进行文本风格迁移,并与注意力头方法进行比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17698 2026-04-30 cs.LG cs.CL stat.ML 62%

The Geometric Canary: Predicting Steerability and Detecting Drift via Representational Stability

几何渡鸦:通过表征稳定性预测可操控性并检测漂移

Prashant C. Raju

机构 * Prashant C. Raju

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过表征稳定性预测语言模型的可操控性并检测漂移,展示了监督和非监督稳定性在不同任务中的互补作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25967 2026-04-30 cs.CL 57%

Semantic Label Drift in Cross-Cultural Translation

跨文化翻译中的语义标签漂移

Mohsinul Kabir, Tasnim Ahmed, Md Mezbaur Rahman, Polydoros Giannouris, Sophia Ananiadou

机构 * Department of Computer Science, National Center for Text Mining, The University of Manchester(计算机科学系,文本挖掘国家中心,曼彻斯特大学) School of Computing, Queen’s University, Ontario, Canada(计算学院,加拿大皇后大学) Computer Science, University of Illinois Chicago(计算机科学,伊利诺伊大学芝加哥分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文研究了跨文化翻译中因文化差异导致的语义标签漂移问题,发现现代大语言模型在文化敏感领域易引发标签漂移,并揭示文化相似性对标签保真度的关键影响。

Journal ref LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00209 2026-04-30 eess.IV cs.AI cs.CV cs.RO 57%

SurgiSR4K: A High-Resolution Endoscopic Video Dataset for Robotic-Assisted Minimally Invasive Procedures

SurgiSR4K:一种用于机器人辅助微创手术的高分辨率内窥镜视频数据集

Fengyi Jiang, Xiaorui Zhang, Lingbo Jin, Ruixing Liang, Yuxin Chen, Adi Chola Venkatesh, Jason Culman, Tiantian Wu, Lirong Shao, Wenqing Sun, Cong Gao, Hallie McNamara, Jingpei Lu, Omid Mohareri

机构 * Intuitive Surgical, Inc.(Intuitive Surgical公司) Johns Hopkins Medicine Neurosurgery(约翰霍普金斯医学神经外科) Johns Hopkins University Electrical and Computer Engineering(约翰霍普金斯大学电气与计算机工程) University of British Columbia Electrical and Computer Engineering(不列颠哥伦比亚大学电气与计算机工程) Wilford & Kate Bailey Small Animal Teaching Hospital(威尔福德与凯蒂·贝利小动物教学医院)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出SurgiSR4K数据集,用于提升微创手术的视觉清晰度和计算机辅助导航精度,包含4K分辨率的手术视频,涵盖镜面反射、工具遮挡等挑战性场景,支持超分辨率、烟雾去除等多任务研究。

Journal ref Machine Learning for Biomedical Imaging, Vol. 3, 2025, pp. 875-885

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18112 2026-04-30 cs.CL cs.MM 57%

Retrieval-Augmented Multimodal Model for Fake News Detection

增强检索的多模态模型用于虚假新闻检测

Yiheng Li, Weihai Lu, Hanyi Yu, Yue Wang

机构 * University of International Business and Economics(国际商务经济大学) Peking University(北京大学) University of Southern California(南加州大学) Upstart Holdings, Inc.(Upstart Holdings公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出RAMM模型,通过多模态大语言模型和抽象叙述对齐模块,解决虚假新闻检测中跨实例叙述一致性缺失和领域知识不足的问题,实验验证了其有效性。

Comments Accepted to SIGIR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15262 2026-04-30 cs.AI 57%

Probe-then-Plan: Environment-Aware Planning for Industrial E-commerce Search

探测-然后规划:面向工业电商搜索的环境感知规划

Mengxiang Chen, Zhouwei Zhai, Jin Li

机构 * JD.com Beijing China(京东北京中国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出环境感知搜索规划(EASP),通过探测-规划机制解决电商搜索中盲点与延迟的矛盾,通过离线数据合成、规划器训练和在线服务适应性路由提升搜索相关召回率和UCVR、GMV。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03558 2026-04-30 cs.CV cs.AI cs.MM 57%

ELIQ: A Label-Free Framework for Quality Assessment of Evolving AI-Generated Images

ELIQ:一种无需标签的进化AI生成图像质量评估框架

Xinyue Li, Zhiming Xu, Min Tang, Zhaolin Cai, Sijing Wu, Xiongkuo Min, Yitong Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xi'an Jiaotong University(西安交通大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 ELIQ通过自动构建正负样本对,利用预训练多模态模型提升质量评估,实现无需人工标注的高质量评估,优于现有无标签方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26409 2026-04-30 cs.CV 50%

Sparsity as a Key: Unlocking New Insights from Latent Structures for Out-of-Distribution Detection

稀疏性作为关键:从潜在结构中解锁新的见解用于分布外检测

Ahyoung Oh, Wonseok Shin, Songkuk Kim

机构 * School of Integrated Technology, BK21 Graduate Program in Intelligent Semiconductor Technology(整合技术学院,智能半导体技术BK21研究生项目)

专题命中 其他安全 :safety(abstract)

AI总结 本文首次将稀疏自编码器应用于ViT的[CLS]令牌进行分布外检测,通过Top-k SAE解构密集特征,揭示了分布内数据的类激活模式,并提出基于核心能量剖面差异的评分函数,实现了在多个基准上的强性能。

Comments 8 pages, 6 figures, supplementary material included, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26261 2026-04-30 cs.CV 50%

Multiple Consistent 2D-3D Mappings for Robust Zero-Shot 3D Visual Grounding

多一致的2D-3D映射用于鲁棒的零样本3D视觉定位

Yufei Yin, Jie Zheng, Qianke Meng, Zhou Yu, Minghao Chen, Jiajun Ding, Min Tan, Yuling Xi, Zhiwen Chen, Chengfei Lv

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(Inria巴黎-鲁克蒙特研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出MCM-VG框架,通过建立多一致的2D-3D映射实现鲁棒的零样本3D视觉定位,解决开放词汇3D提案质量差的问题,提升目标定位和推理的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26231 2026-04-30 cs.IR 50%

ProMax: Exploring the Potential of LLM-derived Profiles with Distribution Shaping for Recommender Systems

ProMax:探索基于分布塑造的LLM衍生资料在推荐系统中的潜力

Yi Zhang, Yiwen Zhang, Kai Zheng, Tong Chen, Hongzhi Yin

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出ProMax框架,通过分布塑造技术提升推荐系统性能,利用用户和物品资料的协同关系,改进推荐模型对未见物品的偏好学习。

Comments 11 pages, 8 figures, accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26065 2026-04-30 cs.RO 50%

FlowS: One-Step Motion Prediction via Local Transport Conditioning

FlowS: 通过局部传输条件实现一步运动预测

Leandro Di Bella, Adrian Munteanu, Bruno Cornelis

机构 * Department of Electronics and Informatics, Vrije Universiteit Brussel(弗拉芒布鲁塞尔自由大学电子与信息系) IMEC

专题命中 其他安全 :safety(abstract)

AI总结 FlowS通过局部传输条件实现一步运动预测,结合在线场景条件学习先验和步一致位移场,提升预测精度与效率,达到SOTA性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25963 2026-04-30 cs.RO 50%

A Scaled Three-Vehicle Platooning Platform

一个缩放的三车编队平台

Kaiyue Lu, Qiaoxuan Zhang, Yukun Lu

机构 * Dept. of Mechanical Engineering, University of New Brunswick(新不伦瑞克大学机械工程系)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一个缩放的三车编队平台,用于研究协同控制与人机协同自主性,通过控制和可重复的实验提升编队稳定性与路径跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09925 2026-04-30 cs.CV 50%

FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding

FLARE:完全整合视觉-语言表示以实现深度跨模态理解

Zheng Liu, Mengjie Liu, Jingzhou Chen, Jingwei Xu, Bin Cui, Conghui He, Wentao Zhang

机构 * Peking University Shanghai AI Laboratory(北京大学上海人工智能实验室) Nanjing University(南京大学) Peking University(北京大学) Shanghai AI Laboratory(上海人工智能实验室) Zhongguancun Academy Beijing Key Laboratory of Data Intelligence and Security(中关村北京数据智能与安全重点实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 FLARE通过全视觉-语言对齐与整合范式实现深度跨模态理解,提出文本引导视觉编码、上下文感知对齐解码、双语义映射损失和文本驱动VQA合成等核心方法,展现优于现有方法的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏