arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-17 至 2026-06-17 共收录 86 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 33 篇

2606.17458 2026-06-17 cs.CE 新提交 50%

ICBCBench: An Industry Consortium Benchmark for Financial Deep Research

ICBCBench:面向金融深度研究的行业联盟基准

Weiya Li, Zhiwei Tang, Yizhou He, Chenghao Wang, Liang Feng, Xiao Sun, Dongrui Liu, Zichen Wen, Hu Wei, Jinghang Wang, Yi Luo, Li Guo, Linfeng Zhang

专题命中 安全评测 :alignment(abstract)

AI总结 针对金融领域深度研究代理评估标准缺失的问题,提出ICBCBench基准,采用客观任务与主观报告评估双轨范式,揭示当前模型在复杂推理、事实依据和报告质量上的显著差距。

Comments 33 pages, 14 figures. Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14383 2026-06-17 cs.CV 新提交 50%

IndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial Products

IndustryBench-MIPU:面向工业产品的多图像属性值提取基准

Haonan Qi, Jin Cao, Yongqi Zhang, Xintong Wang, Weidong Tang, Bin Chen, Chengfu Huo, Haojun Pan, Hengyu You, Jing Li, Yingde Wang, Liang Ding

机构 * Multimodal and Industrial AI Team(多模态与工业AI团队) Taobao&Tmall, Alibaba Group(淘宝&天猫,阿里巴巴集团)

专题命中 安全评测 :safety(abstract)

AI总结 提出首个多图像工业产品理解基准IndustryBench-MIPU,通过结构化属性提取任务评估多模态大模型在规格表、铭牌、技术图纸上的文本识别、视觉推理、领域知识和跨图像证据整合能力,发现多图像完整性是核心瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01762 2026-06-17 cs.RO cs.CV 版本更新 50%

AlignDrive: Aligned Lateral-Longitudinal Planning for End-to-End Autonomous Driving

AlignDrive: 用于端到端自动驾驶的对齐横向-纵向规划

Yanhao Wu, Haoyang Zhang, Fei He, Rui Wu, Yanhu Shan, Congpei Qiu, Liang Gao, Wei Ke, Tong Zhang

机构 * School of Software Engineering, XJTU(软件工程学院,西安交通大学) Horizon Robotics Shenzhen Loop Area Institute(深圳河套学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出一种 cascaded 框架,通过将纵向规划转化为路径条件推理过程,提升自动驾驶的协调性和安全性。方法引入锚点回归设计和规划导向的数据增强策略,实现在 Bench2Drive 上达到 SOTA 性能。

Comments underreview

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 4 篇

2606.17678 2026-06-17 cs.CV cs.AI 新提交 79%

See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

先看后答:基于充分性驱动的强化学习实现视觉证据预对齐

Yilian Liu, Sicong Leng, Guoshun Nan, Junyi Zhu, Jiayu Huang, Minghao Sun, Xuancheng Zhu, Yisong Chen, Zexian Wei, Xiaofeng Tao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) China Telecom(中国电信)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 提出视觉证据预对齐(VEPA)方法,在预训练与后训练之间引入充分性驱动的GRPO优化,以增强多模态大模型对细粒度视觉证据的利用,显著提升视觉密集型任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03211 2026-06-17 cs.CY cs.AI 版本更新 62%

Retrofitters, pragmatists and activists: Public interest litigation for accountable automated decision-making

改造者、实用主义者和活动家:为可问责的自动化决策而进行的公益诉讼

Henry Fraser, Zahra Stardust

机构 * Queensland University of Technology, School of Law(昆士兰理工大学法学院) Centre for Automated Decision-Making and Society(自动化决策与社会研究中心) Queensland University of Technology, School of Communication(昆士兰理工大学传播学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨公益诉讼在澳大利亚促进AI和自动化决策问责中的作用,基于访谈分析策略与局限,强调制度安排对有效诉讼的关键性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17506 2026-06-17 cs.CL 新提交 57%

Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement

通过认知权利评估大语言模型的二阶偏见

Ramaravind Kommiya Mothilal, Terry Jingchen Zhang, Raiyan Ahmed, Zhijing Jin, Shion Guha, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) EuroSafeAI Max Planck Institute for Intelligent Systems, Tübingen, Germany(马克斯·普朗克智能系统研究所(德国图宾根))

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 提出基于认知权利理论的逻辑推理任务,评估LLM在判断偏见内容时表现出的二阶偏见,发现模型判断存在系统性偏差且能规避安全护栏。

Comments 20 pages, 13 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12227 2026-06-17 cs.CL 版本更新 57%

A Recipe for Long-Context Reasoning in Large Language Models via On-Policy Optimization and Distillation

结合在线优化与蒸馏以提升大语言模型的长上下文推理能力

Miguel Moura Ramos, Duarte M. Alves, André F. T. Martins

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) Instituto de Telecomunicações(电信研究所) TransPerfect(TransPerfect公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出dGRPO方法,结合在线优化与蒸馏,通过强教师模型提供密集指导,提升长上下文推理能力,同时保持短上下文能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 19 篇

2605.12646 2026-06-17 cs.LG cs.AI cs.HC 版本更新 81%

Learning to Decide with AI Assistance under Human-Alignment

在人工智能协助下的人类对齐决策学习

Nina Corvelo Benz, Eleni Straitouri, Manuel Gomez-Rodriguez

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在高风险领域中,人工智能如何通过预测结果帮助决策者,并探讨了AI预测信心与决策者自身信心的对齐程度对决策学习复杂性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19937 2026-06-17 cs.CL cs.SD eess.AS 版本更新 79%

ALAS: An Automatic Latent Alignment Score for Audio Language Models

ALAS:音频语言模型的自动潜在对齐分数

Pooneh Mousavi, Yingzhi Wang, Mirco Ravanelli, Cem Subakan

机构 * Concordia University(Concordia 大学) Mila-Quebec AI Institute(Mila-Quebec 人工智能研究所) Centrale Supelec(Centrale Supelec 研究院) Laval University(Laval 大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出ALAS指标,通过计算音频与文本表示的跨模态余弦相似度,无需训练即可评估语音-LLM的音频-文本对齐质量,揭示模型对齐深度与任务需求的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17410 2026-06-17 cs.CV 新提交 78%

Attention Alignment Between Humans and Vision-Language Models

人类与视觉语言模型之间的注意力对齐

Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld, Declan Campbell, Samuel Nastase, Taylor Webb, Michael Graziano

机构 * Princeton Neuroscience Institute, Princeton University(普林斯顿大学普林斯顿神经科学研究所) Department of Psychology, Princeton University(普林斯顿大学心理学系) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) Department of Psychology and Center for Computational Language Sciences, University of Southern California(南加州大学心理学系与计算语言科学中心) Department of Psychology, Université de Montréal(蒙特利尔大学心理学系)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本研究比较了六种视觉语言模型的空间注意力图与人类注视热图,发现解码器架构(LSTM vs Transformer)主导对齐程度,LSTM解码器对齐度更高但空间分散且任务区分度低,而Transformer解码器注意力更集中且任务区分度强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17830 2026-06-17 cs.LG cs.AI 新提交 62%

Functional Equivalence in Attention: A Comprehensive Study with Applications to Linear Mode Connectivity

注意力中的功能等价性:一项综合研究及其在线性模式连通性中的应用

Viet-Hoang Tran, Vinh Khanh Bui, Van-Hoan Trinh, Tan Lai Ngoc, Tan M. Nguyen

机构 * National University of Singapore(新加坡国立大学) Center for AI Research, VinUniversity(Vin大学人工智能研究中心) Independent Researcher(独立研究者) Technical University of Munich(慕尼黑技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文形式化研究了Transformer中位置编码对功能等价性的影响,发现正弦编码保持原始注意力的对称性,而旋转编码显著减少对称群从而增强表达力,并通过对齐算法实证了位置编码对线性模式连通性的关键作用。

Comments Published at the International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30036 2026-06-17 cs.AI cs.CL 版本更新 62%

Teaching Values to Machines: Simulating Human-Like Behavior in LLMs

向机器传授价值观:在LLMs中模拟类人行为

Asaf Yehudai, Naama Rozen, Ariel Gera

机构 * The Hebrew University of Jerusalem(海法大学) IBM Research(IBM研究院) Tel-Aviv University(特拉维夫大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究基于心理学价值理论,通过大规模实验(超过500万个问题)评估价值提示的LLMs在价值结构和价值-行为关系上与人类的一致性,并证明引入人类价值分布可增强群体模拟。

Comments We had some disagreement regarding proper attribution; we hope to resolve it soon and upload the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18222 2026-06-17 cs.CL cs.DL 新提交 57%

Darshana Graph: A Parallel Commentary Corpus for Comparative Indian Philosophy, with Stylometric and Exploratory Graph Analyses

Darshana Graph:用于比较印度哲学的平行注释语料库,附文体计量与探索性图分析

Joy Bose

机构 * Independent Researcher(独立研究者) Bangalore, India(印度班加罗尔)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 构建包含超12.5万条记录的印度哲学平行注释语料库,其中约8500条记录实现跨18位注释者的根颂对齐,通过文体计量和约束大语言模型管道分析论证风格与概念关系,揭示学派间分歧模式。

Comments 12 pages, 1 figure. Open Source Code available at https://github.com/joyboseroy/darshana-graph and dataset at https://huggingface.co/datasets/joyboseroy/darshana-graph

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18098 2026-06-17 cs.AI 新提交 57%

IsabeLLM: Automated Theorem Proving Applied to Formally Verifying Consensus

IsabeLLM: 自动化定理证明应用于共识的形式化验证

Elliot Jones, William Knottenbelt

机构 * Imperial College London(伦敦帝国学院)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文改进IsabeLLM自动化定理证明工具,通过检索增强生成、错误追踪和反例生成提升大语言模型上下文,并兼容最新Isabelle和Sledgehammer,用于验证比特币工作量证明共识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17340 2026-06-17 cs.CV cs.AI 新提交 57%

Geometry-Consistent Endoscopic Representations for Image-Guided Navigation via Structured Foundation Model Adaptation

几何一致的内窥镜表示用于图像引导导航:基于结构化基础模型适配

Hongchao Shu, Roger D. Soberanis-Mukul, Hao Ding, Morgan Ringel, Mali Shen, Saif Iftekar Sayed, Hedyeh Rafii-Tari, Mathias Unberath

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Semaphor Surgical Johnson & Johnson MedTech(强生医疗科技)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出统一框架,结合合成数据管道与层级感知几何语义适配,学习几何一致且领域鲁棒的图像表示,提升单目内窥镜中的位姿估计与深度预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17162 2026-06-17 cs.CL cs.HC cs.MA 新提交 57%

MemSlides: A Hierarchical Memory Driven Agent Framework for Personalized Slide Generation with Multi-turn Local Revision

MemSlides:一种用于个性化幻灯片生成与多轮局部修订的层次化记忆驱动智能体框架

Ye Jin, Yangyang Xu, Jun Zhu, Yibo Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出MemSlides层次化记忆框架,通过分离长期记忆(用户画像和工具记忆)与工作记忆,结合局部修订机制,实现个性化幻灯片生成中的用户偏好保持、多轮修订和可靠局部编辑。

Comments Code, website, project page, and video are linked in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11616 2026-06-17 cs.LG cs.IR 新提交 57%

DeMix: Debugging Training Data with Mixed Data Error Types by Investigating Influence Vectors

DeMix: 通过影响向量调试包含混合错误类型的训练数据

Jiale Deng, Yanyan Shen, Xiaogang Shi, Junjun Chai

机构 * Shanghai Jiao Tong University(上海交通大学) ByteDance Inc.(字节跳动) Tiktok

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出DeMix框架,利用影响向量捕捉不同错误类型对模型行为的独特模式,将数据调试转化为多标签分类问题,并引入基于干预的学习策略,在11个任务上显著提升调试F1分数和修复后模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03872 2026-06-17 cs.CL 版本更新 57%

Atlas: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Reasoning

Atlas: 编排异构模型与工具实现多领域复杂推理

Jinyang Wu, Guocheng Zhai, Ruihan Jin, Jiahao Yuan, Yuhao Shen, Shuai Zhang, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出ATLAS双路径框架,通过无监督聚类路由和强化学习多步路由动态选择最优模型-工具组合,在15个基准上超越GPT-4o,分布内外任务分别提升10.1%和13.1%。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18180 2026-06-17 cs.CV 新提交 50%

EgoCS-400K: An Egocentric Gameplay Dataset for World Models

EgoCS-400K:面向世界模型的自我中心游戏数据集

Rongjin Guo, Dong Liang, Yuhao Liu, Fang Liu, Tianyu Huang, Gerhard P. Hancke, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学)

专题命中 其他安全 :alignment(abstract)

AI总结 为支持世界模型研究,构建大规模自我中心游戏数据集EgoCS-400K,包含40万第一人称视频和1万小时游戏轨迹,支持动作条件未来预测、状态事件场景展开等交互式视觉建模任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17669 2026-06-17 cs.SD 新提交 50%

DeSRPA: Decoupled Speech Role-Playing Agent via Inference-Time Intervention

DeSRPA: 通过推理时干预的解耦语音角色扮演智能体

Wenqiu Tang, Zhen Wan, Takahiro Komamizu, Ichiro Ide

机构 * Nagoya University(名古屋大学) National Institute of Informatics(国立情报学研究所)

专题命中 其他安全 :alignment(abstract)

AI总结 提出DeSRPA框架,通过推理时干预冻结骨干模型,利用双层控制向量机制解耦认知推理与副语言表达,在语音角色扮演中实现个性与情感一致性,超越端到端微调方法。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17468 2026-06-17 cs.IR 新提交 50%

RSRank: Learning Relevance from Representational Shifts

RSRank: 从表示偏移中学习相关性

Archit Gupta, Sai Sundaresan, Debabrata Mahapatra

专题命中 其他安全 :alignment(abstract)

AI总结 针对RAG系统中重排序依赖启发式阈值和语言模型logit信号的问题,提出基于表示偏移(RS)的相关性信号,通过轻量级训练框架学习映射,在零阈值下过滤无关内容,超越现有重排序器。

Comments Under Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17436 2026-06-17 cs.CV 新提交 50%

UoU: A Universal Fingerprint Foundation Model Based on Large-Scale Unsupervised Learning

UoU:基于大规模无监督学习的通用指纹基础模型

Xiongjun Guan, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 其他安全 :alignment(abstract)

AI总结 提出UoU指纹基础模型,通过多级表示层次和结合监督、弱监督与无监督的训练策略,实现跨传感器、质量和应用的通用特征提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17431 2026-06-17 cs.CV 新提交 50%

Visual Retrieval-Augmented Generation for Silhouette-Guided Animal Art

视觉检索增强生成:基于轮廓引导的动物艺术创作

Quoc-Duy Tran, Anh-Tuan Vo, Trung-Nghia Le

机构 * University of Science, VNU-HCM(胡志明市国立大学理科大学) Vietnam National University, Ho Chi Minh(胡志明市国立大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出视觉检索增强生成(Visual-RAG)框架,通过检索与自然轮廓结构相似的动物形状,结合ControlNet和IP-Adapter引导扩散模型生成动物艺术,实现计算空想性视错觉。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18151 2026-06-17 eess.SP cs.IT math.IT 新提交 50%

Channel Charting for Position and Orientation

面向位置和朝向的信道图表

Daniel Richner, Reinhard Wiesmayr, Frederik Zumegen, Christoph Studer

专题命中 其他安全 :alignment(abstract)

AI总结 提出一种自监督方法,利用信道状态信息同时估计用户设备位置和朝向,通过新颖的朝向三元组损失和对齐损失实现,在5G NR实测中接近监督学习精度。

Comments This work has been submitted to the IEEE Conference on Integrated Sensing and Communications 2026 (ISAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16884 2026-06-17 cond-mat.soft cond-mat.stat-mech cond-mat.supr-con nlin.AO quant-ph 50%

Polar chiral active matter as a motile, disordered Josephson array: Information supercurrents and Goldstone spin waves

极性手性活性物质作为一种移动、无序的约瑟夫森阵列:信息超电流和戈尔登斯pin波

Magnus F Ivarsen

专题命中 其他安全 :alignment(abstract)

AI总结 本文研究极性手性活性物质的动力学,揭示信息超电流维持同步及spin波传输机制,提出其与约瑟夫森阵列的等价性。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26272 2026-06-17 stat.ME 版本更新 50%

TWICEBEE: A Two-stage Intra-patient Curve-free Bayesian Decision-Theoretic Dose Escalation Design

TWICEBEE: 一种两阶段患者内无曲线贝叶斯决策理论剂量递增设计

Dehua Bi, Katherine Ryan, Sabine Heitzeneder, Zina Good, John S. Tamaresis, Robert Lowsky, Michelle Monje, Crystal Mackall, Ying Lu

专题命中 其他安全 :safety(abstract)

AI总结 针对多周期免疫治疗中毒性随周期递减的特点,提出两阶段患者内剂量递增设计,结合加速滴定与改进的无曲线贝叶斯决策理论框架,实现安全高效的剂量探索。

详情

展开后加载摘要…

URL PDF HTML 收藏