arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-04 至 2026-08-04 共收录 56 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2604.10727 2026-08-04 stat.ML cs.AI cs.LG math.PR math.ST stat.TH 版本更新 89%

Tail-Aware Information-Theoretic Bounds for LLM Alignment under Heavy-Tailed Rewards

尾感知信息论泛化用于RLHF和SGLD

Huiming Zhang, Binghan Li, Wan Tian, Qiang Sun

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算高精尖创新中心) Advanced Institute of Information Technology, Peking University(北京大学信息技术高等研究院) Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) Computer and Mathematical Sciences, Computer Science, and Statistics, University of Toronto(多伦多大学计算机与数学科学、计算机科学和统计学系) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 偏好对齐 :RLHF(title_cn,abstract);alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种尾依赖信息论框架,用于处理亚韦尔bull数据,通过移位对数f_θ-分歧来界定制换测度期望,从而在重尾数据下获得更精确的泛化界限。

Comments 47 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18295 2026-08-04 cs.LG 版本更新 83%

On the Limits of Support-Preserving Alignment and Bounded Filtering

关于支持保持对齐和有界过滤的局限性

Aryan Dutt, Rui Mao, Anupam Chattopadhyay

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.LG

AI总结 研究在大语言模型中,重塑基础模型输出分布的对齐方案与有界安全过滤器结合能否消除有害行为。通过形式化设置并分析,发现有界过滤可能无法消除所有有害输出,实证评估显示有害输出率始终高于零。

Comments Withdrawn to allow a complete rewrite and substantial revision of the theoretical analysis and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06133 2026-08-04 cs.SE cs.AI cs.LG cs.LO 版本更新 79%

TLA-Prover: Verifiable TLA+ Specification Synthesis via Preference-Optimized Low-Rank Adaptation

TLA-Prover: 通过偏好优化低秩适配实现可验证的 TLA+ 规范合成

Eric Spencer, Arslan Bisharat, Brian Ortiz, Khushboo Bhadauria, Mujtaba Nazari, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer, Mohammed Abuhamad

机构 * Department of Computer Science, Loyola University Chicago(洛约拉芝加哥大学计算机科学系)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出 TLA-Prover 模型,结合监督微调和基于修复的组相对策略优化,在 TLC 模型检查器上实现 TLA+ 规范合成,Gold/Diamond 级别通过率达 30%,约为未调优基线的 3.5 倍。

Comments 12 pages, 5 tables, 3 figures. In Proceedings at the 21st International Conference on Software Technologies (ICSOFT 2026)

Journal ref ICSOFT 2026, pp. 627-636, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00025 2026-08-04 cs.CL 版本更新 77%

TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation

TAB-PO:面向Token关键结构化生成的具有Token级自适应障碍的偏好优化

Samah Fodeh, Linhai Ma, Ganesh Puthiaraju, Srivani Talakokkul, Afshan Khan, Sreeraj Ramachandran, Elyas Irankhah, Aimee Kendall Roundtree

机构 * Yale University(耶鲁大学) Texas State University(德克萨斯州立大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL

AI总结 针对结构化预测中偏好与拒绝对象仅少数token不同导致的梯度稀释和token侵蚀问题,提出基于混淆感知偏好构建和Token级自适应障碍的TAB-PO方法,在SciERC任务上显著提升关键指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23671 2026-08-04 cs.CL 版本更新 70%

Can LLMs Reliably Self-Report Adversarial Prefills, and How?

LLM 能否可靠地自我报告对抗性预填充,以及如何实现?

Quang Minh Nguyen, Uzair Ahmed, Taegyoon Kim

机构 * KAIST(韩国科学技术院)

专题命中 偏好对齐 :DPO(abstract_cn);safety(abstract);分类 cs.CL

AI总结 研究LLM在安全场景中识别自身输出是否受对抗性预填充攻击的能力,发现模型平均27.3%声称预填充输出有意图,且内省信号主要来自安全/拒绝推理,LoRA微调方法扩大了意图-篡改探针差距并提高了攻击成功率。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25702 2026-08-04 cs.CL 版本更新 70%

Backtranslation Augmented Direct Preference Optimization for Neural Machine Translation

反向翻译增强的直接偏好优化用于神经机器翻译

Mehrdad Ghassabi, Spehr Rajabi, Hamidreza Baradaran Kashani, Sadra Hakim, Mahshid Keivandarian, Amirhossein Jahani Bahnamiri

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 提出基于直接偏好优化的强化学习后训练框架,利用通用文本语料和专家反馈纠正神经机器翻译错误,在英德翻译任务上将COMET分数从0.703提升至0.747。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09842 2026-08-04 cs.LG cs.CL 版本更新 62%

From Direction to Magnitude: How Multimodal Instruction-Tuning Reorganizes the Geometric Encoding of Identity-Specifying Prompts in Transformer Hidden States

从方向到大小:多模态指令微调如何在Transformer隐藏状态中重新组织身份指定提示的几何编码

Jorge A. Castillo, Marco Torres Yévenes, Juan Carlos Lanas

机构 * Axis Dynamics SpA(轴动力公司)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 研究四种训练后模式的Transformer语言模型,通过五个几何指标比较三种提示条件,发现多模态指令微调会使身份编码从方向重组为大小,此重组特定于该模式,还定位了W_1作为方法贡献。

Comments 16 pages, 8 tables. Working draft v0.3. Uses Ollivier-Ricci curvature and edge-wise Wasserstein-1 as primary geometric statistic; four models (Gemma-4-E4B, Gemma-4-E4B-it, DeepSeek-R1-Distill-Qwen-7B, Qwen2.5-7B-Instruct)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01715 2026-08-04 cs.AI 版本更新 57%

Distributionally Robust Listwise Preference Optimization

分布鲁棒列表偏好优化

Xudong Wu, Jian Qian, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen

机构 * The University of Hong Kong(香港大学) Yale University(耶鲁大学) Purdue University(普渡大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 针对列表偏好排序标签不确定性,提出点态全变差鲁棒Plackett-Luce目标,将内层最大化简化为排序,在离线和在线设置中均具有理论保证,实验表明能保持干净标签性能并提升噪声鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01350 2026-08-04 cs.CL 版本更新 57%

LLM Output Detectability and Task Performance Can be Jointly Optimized

大语言模型输出可检测性与任务性能可以联合优化

Koshiro Saito, Ryuto Koike, Masahiro Kaneko, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) MBZUAI National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) NII LLMC(日本信息基础设施中心LLMC)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 本文提出PUPPET框架,通过强化学习优化大语言模型,使其输出更易检测且在下游任务中表现更优,实验表明其在长文问答、摘要和作文写作中均优于传统水印方法。

Comments 15 pages, 9 figures, 20 tables. Code: https://github.com/pakapaka333/PUPPET

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2606.21337 2026-08-04 cs.LG cs.AI 版本更新 62%

DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams

DataClaw0: 从原始流中智能定制多模态数据

Cong Wan, Zeyu Guo, Zijian Cai, Jiangyang Li, SongLin Dong, Lin Peng, Xiangyang Luo, Zhiheng Ma, Yihong Gong

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳理工大学) Tsinghua University(清华大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出DataClaw0模型,通过两阶段流水线将生成语义合成锚定于确定性事实锚点,结合SFT与GRPO实现复杂数据精炼意图的对齐,首个数据精炼基准验证其高效性。

Comments add base model: Qwen3.5-27B

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20449 2026-08-04 cs.CL 版本更新 57%

LM-mixup: Text Data Augmentation via Language Model based Mixup

LM-mixup:基于语言模型的混合文本数据增强方法

Zhijie Deng, Zhouan Shen, Ling Li, Yao Zhou, Zhaowei Zhu, Yanji He, Wei Wang, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) BIAI, ZJUT & D5Data.ai(BIAI、ZJUT及D5Data.ai)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本文提出LM-Mixup方法,通过构建MIXTURE数据集并结合监督微调与GRPO强化学习,仅用3%的蒸馏数据即可高效增强低质量指令跟随数据,提升LLMs的指令微调效率与性能。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29239 2026-08-04 cs.CR 版本更新 50%

Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors

打破舍入陷阱:保护LLM免受量化条件后门攻击

Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen

专题命中 安全训练 :alignment(abstract)

AI总结 提出QuantGuard方法,通过可微舍入控制变量和误差引导的舍入反转约束等机制,在仅使用少量校准数据且不修改量化算法的情况下,阻断后门激活路径,有效降低攻击成功率至接近干净模型水平。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2605.20266 2026-08-04 cs.SD 版本更新 80%

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

大型音频语言模型综述:通用性、可信度与展望

Kaiwen Luo, Zhenhong Zhou, Leyan Wang, Liang Lin, Tianyu Shao, Yuanhe Zhang, Yang Xiao, Yuxuan Li, Miao Yu, Kailin Lyu, Jiaming Zhang, Li Sun, Songze Li, Yueming Wu, Ting Dang, Xiaojun Jia, Dongrui Liu, Kai Li, Rohan Kumar Das, Siyuan Liang, Xinfeng Li, Qiankun Li, Jing Chen, Xingjun Ma, Kun Wang, Junhao Dong, Deqing Zou, Yu Cheng, Xia Hu, Zhigang Zeng, Sen Su, Yang Liu, Yu-Gang Jiang, Philip S. Yu, Yew-Soon Ong

机构 * Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究者) The University of Melbourne(墨尔本大学) North China Electric Power University(华北电力大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Fortemedia Singapore(富媒体新加坡) Tencent(腾讯) Fudan University(复旦大学) Wuhan University(武汉大学) Chinese University of Hong Kong(香港中文大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 越狱攻击 :trustworthy(abstract,abstract_cn);alignment(abstract);safety(abstract)

AI总结 本文综述了大型音频语言模型的通用性、可信度及未来发展方向,探讨了其架构创新、对齐算法及安全风险,并提出了防御深入、因果音频世界建模等策略以提升音频智能的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06519 2026-08-04 cs.CR cs.AI 版本更新 79%

Can Small Language Models Reliably Resist Jailbreak Attacks? A Comprehensive Evaluation

小型语言模型能否可靠抵御越狱攻击?一项综合评估

Zhibo Wang, Wenhui Zhang, Huiyu Xu, Zeqing He, Ziqi Zhu, Kui Ren

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文通过评估59个SLMs对12种越狱方法的抵御能力,发现多数SLMs存在高ASR,漏洞与训练细节相关,且现有防御效果有限,凸显SLM需采用设计即安全的方法。

Comments Accepted by ACM CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07107 2026-08-04 cs.AI cs.CL 版本更新 79%

MENTOR: A Metacognition-Driven Self-Evolution Framework for Uncovering and Mitigating Implicit Domain Risks in LLMs

MENTOR: 一种元认知驱动的自我进化框架,用于发现和缓解大语言模型中的隐式领域风险

Liang Shan, Kaicheng Shen, Wen Wu, Zhenyu Ying, Chaochao Lu, Yan Teng, Jingqi Huang, Qingshan Liu, Guangze Ye, Guoqing Wang, Jie Zhou, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Lab, Shanghai Innovation Institute(上海人工智能实验室,上海创新研究院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在特定领域(如教育、金融、管理)中存在的隐式安全风险,提出基于元认知自我评估和动态规则知识图谱的MENTOR框架,通过激活级引导信号有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10933 2026-08-04 cs.CR cs.AI cs.CV cs.LG quant-ph 版本更新 62%

QShield: Securing Neural Networks Against Adversarial Attacks using Quantum Circuits

QShield: 通过量子电路安全神经网络对抗对抗性攻击

Navid Azimi, Aditya Prakash, Yao Wang, Li Xiong

机构 * Emory University(埃默里大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 QShield通过结合传统CNN和量子处理模块,提升经典深度学习模型的对抗鲁棒性,实验表明其在多种数据集上有效降低攻击成功率并提高预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 2 篇

2605.08876 2026-08-04 cs.LG 版本更新 74%

OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents

OTora:一种用于LLM代理推理层面拒绝服务攻击的统一红队框架

Xinyu Li, Ronghui Mu, Lin Li, Tianjin Huang, Gaojie Jin

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 红队测试 :red teaming(title);分类 cs.LG

AI总结 OTora是首个统一的两阶段红队框架,用于实现推理层面拒绝服务攻击,通过优化对抗触发器和生成代理感知的推理负载,提升推理token数量和延迟,同时保持任务准确性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07121 2026-08-04 cs.LG cs.AI cs.NE 版本更新 62%

Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models

质量-多样性红队测试:针对大语言模型的高质量多样化攻击者自动生成

Ren-Jian Wang, Ke Xue, Zeyu Qin, Ziniu Li, Sheng Tang, Hao-Tian Li, Shengcai Liu, Zhi Yu, Yuanpeng Tan, Chao Qian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港大学深圳校区) Southern University of Science and Technology(南方科技大学)

专题命中 红队测试 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出QDRT框架,通过训练多专用攻击者生成高质量多样化攻击,提升LLM安全评估的多样性与有效性,支持LLM负责任部署。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2512.06716 2026-08-04 cs.AI cs.CL cs.CR 版本更新 81%

SIEVE: Selective Integrity Verification and Escalation for Defending LLM Agents against Indirect Prompt Injection

认知控制架构(CCA):一种用于鲁棒对齐AI代理的生命周期监督框架

Zhibo Liang, Tianze Hu, Zaiye Chen, Mingjie Tang

机构 * Sichuan University(四川大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出认知控制架构(CCA),通过全生命周期认知监督框架,有效应对复杂IPI攻击,实现安全、功能与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19396 2026-08-04 cs.AI 版本更新 79%

CrackedPDFs: A Controlled Benchmark for Hidden Prompt Injection in PDFs

CrackedPDFs:用于PDF中隐藏提示注入的受控基准测试

Pukaphol Thienpreecha, Karthik Subramanian

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究针对PDF中隐藏提示注入问题,引入CrackedPDFs基准测试,评估多种检测方法,如PromptGuard、结构学习模型等,结果显示文档感知混合检测在受控配对评估下有效,但缺乏现实世界鲁棒性和跨家族泛化能力。

Comments Revised author metadata to include Karthik Subramanian; corrected paired-metric terminology; added code, dataset, reproduction, and archival information. Code: https://github.com/volkthienpreecha/crackedpdfs/releases/tag/v1.0.0-paper ; Dataset: https://huggingface.co/datasets/volkthienpreecha/crackedpdfs ; Archive: https://doi.org/10.5281/zenodo.21735803

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 3 篇

2606.15782 2026-08-04 cs.AI cs.CV 版本更新 70%

Mitigating Visual Hallucinations in Multimodal Systems through Retrieval-Augmented Reliability-Aware Inference

通过检索增强的可靠性感知推理缓解多模态系统中的视觉幻觉

Pratheswaran Hariharan, Haiping Xu, Donghui Yan

机构 * University of Massachusetts, Dartmouth(马萨诸塞大学达特茅斯分校)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出一种检索增强的可靠性感知推理框架,利用外部视觉证据库和多个可靠性指标进行决策门控,在不重训练模型的情况下减少视觉幻觉,将接受预测准确率从85.84%提升至88.88%。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22775 2026-08-04 cs.LG cs.AI cs.HC 版本更新 62%

MambaGaze: Bidirectional Mamba with Explicit Missing Data Modeling for Cognitive Load Assessment from Eye-Gaze Tracking Data

MambaGaze: 通过显式缺失数据建模的双向Mamba用于从眼动追踪数据中评估认知负荷

Amir Mousavi, Mohammad Sadegh Sirjani, Erfan Nourbakhsh, Mimi Xie, Rocky Slavin, Leslie Neely, John Davis, John Quarles

机构 * Department of Computer Science, College of AI, Cyber and Computing, The University of Texas at San Antonio(计算机科学系,人工智能、网络与计算学院,德克萨斯大学圣安东尼奥分校) Department of Educational Psychology, College of Education and Human Development, The University of Texas at San Antonio(教育心理学系,教育与人类发展学院,德克萨斯大学圣安东尼奥分校) Department of Neuroscience, Developmental and Regenerative Biology, College of Sciences, The University of Texas at San Antonio(神经科学系,发育与再生生物学系,科学学院,德克萨斯大学圣安东尼奥分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MambaGaze,通过XMD编码和双向Mamba-2框架,解决眼动追踪数据中频繁缺失和长时序依赖建模的问题,实验证明其在认知负荷评估中的优越性能和边缘部署可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08575 2026-08-04 cs.RO 版本更新 50%

FabriVLA: A Lightweight Vision-Language-Action Model with Conformal Action Chunk Uncertainty

FabriVLA:用于精确多任务操作的轻量级视觉-语言-动作模型

Shiyuan Yang, Borong Zhang, Jizheng Zhang, Zhijia Tao, Junfei Guo, Donglai Ran, Xu Bian, Qingbiao Li

专题命中 幻觉与事实性 :safety(abstract)

AI总结 研究提出FabriVLA模型,结合视觉-语言主干与流匹配动作头,经单阶段联合优化训练。在Meta-World MT50基准测试中,该模型基于1B规模VLM,不依赖数十亿参数主干,实现90.0%平均成功率,展现强大性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 1 篇

2601.21369 2026-08-04 cs.LG 版本更新 79%

Rethinking Federated Graph Foundation Models: A Graph-Language Alignment-based Approach

重新思考联邦图基础模型:基于图-语言对齐的方法

Yinlin Zhu, Di Wu, Xianzhi Zhang, Yuming Ai, Xunkai Li, Miao Hu, Guocong Quan

机构 * Sun Yat-sen University, Guangzhou, China(中山大学) Beijing Institute of Technology, Beijing, China(北京理工大学)

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.LG

AI总结 FedGALA通过图-语言对齐解决联邦图基础模型中的语义-结构正交性问题,提升多任务适应性与效率

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 安全评测 15 篇

2606.26529 2026-08-04 cs.CL cs.AI cs.CV 版本更新 81%

The inattentional gap in task conditioned AI models that omit otherwise reportable safety critical signals

注意间隙:任务条件化的语言和视觉模型忽略它们本可报告的安全关键信号

Kwan Soo Shin

机构 * PolymathMinds Lab(PolymathMinds 实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示任务条件化会导致语言和视觉模型抑制对共存安全关键信号的报告,形成“注意间隙”,且该现象在多种模型和任务中普遍存在,不随规模增大而减弱,使基准安全与实际安全脱钩。

Comments 62 pages (31-page article and 31-page supplementary information), 8 figures, 4 tables. v3: corrects the author metadata to the sole author, Kwan Soo Shin; revised title and abstract; adds cross-vendor and flagship validation, signal-detection and specified-task controls, and dual-process probes. Reproducibility deposit: doi:10.5281/zenodo.20826823

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28067 2026-08-04 cs.LG 版本更新 79%

From Vessel Trajectories to Safety-Critical Encounter Scenarios: A Generative AI Framework for Autonomous Ship Digital Testing

从船舶轨迹到安全关键性遭遇场景:一种生成式AI框架用于自主船舶数字测试

Sijin Sun, Liangbin Zhao, Xiuju Fu

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出一种数据驱动框架,将大规模AIS轨迹转化为结构化安全关键性遭遇场景,结合生成轨迹建模与自动化遭遇配对,提升场景生成的可扩展性与真实性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00500 2026-08-04 cs.AI cs.SE 版本更新 79%

ProbGuard: Proactive Runtime Monitoring for LLM Agent Safety via Probabilistic Prediction

ProbGuard:基于概率的运行时监控用于LLM代理安全

Haoyu Wang, Christopher M. Poskitt, Jiali Wei, Jun Sun

机构 * Singapore Management University(新加坡管理大学) Xi'an Jiaotong University(西安交通大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 ProbGuard通过概率风险预测主动监控LLM代理安全,利用离散时间马尔可夫链建模行为动态,提前预警潜在危险,提升安全性和任务完成率。

Comments Accepted by the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00107 2026-08-04 cs.SE 版本更新 78%

The Illusion of Safety: Multi-Tier Verification of AI vs. Human C++ Code

安全的假象:AI与人类C++代码的多层验证

Saif Mahmud, Fadul Sikder, Yuede Ji, Haotian Zhang, Yu Lei

专题命中 安全评测 :safety(title,abstract)

AI总结 提出VULBENCH-CPP基准,通过四层验证发现AI生成C++代码的运行时违规率约为人类代码的两倍,静态分析会因代码长度产生安全假象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25806 2026-08-04 cs.CV 版本更新 78%

An Analysis Focused on Womens Safety: Can VAD Models Be Enhanced by a Multi-modal Dataset?

聚焦女性安全分析:多模态数据集能否增强VAD模型?

Sangeeta ., Maddikuntla Sai Prajwal, Debi Prosad Dogra, Kamalakar Vijay Thakare, Hyungjoo Jung, Ig-Jae Kim, Heeseung Choi

机构 * Indian Institute of Technology Bhubaneswar(印度理工学院巴特那分校) Artificial Intelligence and Robotics Institute, Korea Institute of Science and Technology(人工智能与机器人研究所,韩国科学技术院) Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学KIST融合研究中心)

专题命中 安全评测 :safety(title,abstract)

AI总结 针对现有视频异常检测数据集缺乏女性中心异常样本的问题,提出包含1001个视频及文本描述的多模态基准ExtrAnom,覆盖5种犯罪类型,并验证了多模态方法在检测女性中心异常上的有效性。

Comments 15 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08262 2026-08-04 cs.AI 版本更新 70%

FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use

FinToolBench:评估LLM代理在真实金融工具使用中的表现

Jiaxuan Lu, Kong Wang, Yemin Wang, Qingmei Tang, Hongwei Zeng, Xiang Chen, Jiahao Pi, Shujian Deng, Lingzhi Chen, Yi Fu, Kehua Yang, Xiao Sun

机构 * Shanghai AI Laboratory(上海人工智能实验室) Hunan University(湖南大学) Xiamen University(厦门大学) Tencent(腾讯) UCAS(中国科学技术大学) Tongji University(同济大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 FinToolBench是首个评估金融工具学习代理真实世界表现的基准,通过760个可执行金融工具和295个严格查询,评估时效性、意图类型和合规性等关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏