arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-01 至 2026-07-01 共收录 21 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 21 篇

2606.31524 2026-07-01 cs.LG cs.AI stat.ML 新提交 81%

On the Convergence of Self-Improving Online LLM Alignment

关于自改进在线大语言模型对齐的收敛性

Xudong Wu, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen

机构 * The University of Hong Kong(香港大学) Yale University(耶鲁大学) Purdue University(普渡大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 针对SAIL算法收敛性分析缺失的问题,提出SAIL-RevKL正则化目标,证明其满足PL条件并实现近线性样本复杂度,在MuJoCo和LLM对齐任务上优于原始SAIL。

Comments Accepted at UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31310 2026-07-01 cs.CL cs.MM 新提交 79%

LOPA: Enhancing Spoken Language Assessment via Latent Ordinal Prototype Alignment

LOPA:通过潜在序数原型对齐增强口语评估

Hong-Yun Lin, Fu-An Chao, Bi-Cheng Yan, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出LOPA正则化器,在潜在空间施加序数几何先验,结合SALR自适应提取Whisper编码器多层表示,以0.361 RMSE媲美十亿参数系统,无需LLM微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31517 2026-07-01 cs.IR cs.CV 新提交 78%

Unsupervised Data-Efficient Cross-Modal Retrieval with Global-Neighborhood Alignment Hashing

基于全局邻域对齐哈希的无监督数据高效跨模态检索

Runhao Li, Xiaoxu Ma, Zhenyu Weng, Yue Zhang, Guibo Luo, Huiping Zhuang, Zhiping Lin, Yap-Peng Tan

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) College of Computer and Information Engineering, Henan Normal University(河南师范大学计算机与信息工程学院) VinUniversity(Vin大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出全局邻域对齐哈希(GNAH),通过原型锚定全局对齐和对比随机邻域对齐,在少量图像-文本对下学习紧凑二进制码,实现数据高效的无监督跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31614 2026-07-01 eess.SY cs.AI cs.SY 新提交 70%

Automating Cause-Effect Specification with Knowledge Graphs and Large Language Models

利用知识图谱和大语言模型自动化因果规范生成

Javal Vyas, Milapji Singh Gill, Mehmet Mercangöz

机构 * Autonomous Industrial Systems Lab, Imperial College London(帝国理工学院自主工业系统实验室)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出一种语义AI框架,结合知识图谱与约束大语言模型,自动生成因果逻辑和操作安全叙述,减少手动工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31591 2026-07-01 cs.LG cs.AI 新提交 62%

Evil Spectra: How Optimisers can Amplify or Suppress Emergent Misalignment

邪恶光谱:优化器如何放大或抑制涌现性失调

Jason R. Brown, Patrick Leask, Lev McKinney

机构 * Astra Fellows Program(Astra Fellows 项目) University of Cambridge(剑桥大学) Durham University(杜伦大学) University of Toronto(多伦多大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究优化器选择对LLM涌现性失调的影响,发现优化器导致7倍失调率差异,Muon通过隐式正则化奇异值分布保持对齐,谱正则化可缓解失调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02124 2026-07-01 cs.CV cs.AI cs.LG 版本更新 62%

Toxicity Assessment in Preclinical Histopathology via Class-Aware Mahalanobis Distance for Known and Novel Anomalies

临床前组织病理学中的毒性评估:基于类别感知马氏距离的已知和新型异常检测

Olga Graf, Dhrupal Patel, Peter Groß, Charlotte Lempp, Matthias Hein, Fabian Heinemann

机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) Boehringer Ingelheim Pharma GmbH and Co.(勃林格殷格翰制药有限公司) Boehringer Ingelheim GmbH(勃林格殷格翰公司)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出基于AI的异常检测框架,利用类别感知马氏距离和LoRA微调DINOv2,在啮齿动物肝脏全切片图像中识别健康组织、已知病理和分布外异常,实现像素级检测,降低假阴性和假阳性率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29793 2026-07-01 cs.CL q-fin.GN 版本更新 57%

Fund2Persona: A Framework for Building and Refining Financial Advisor Personas from Fund Disclosure Data

Fund2Persona:基于基金披露数据构建与精炼金融顾问角色的框架

Suhwan Park, Hoyoung Lee, Zhangyang Wang, Alejandro Lopez-Lira, Young Cha, Chanyeol Choi, Jaewon Choi, Yongjae Lee

机构 * UNIST(蔚山科学技术院) LinqAlpha University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Florida(佛罗里达大学) Blackstone(黑石集团) Hanwha Life(韩华生命)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出Fund2Persona框架,利用基金披露、持仓变动、市场背景和管理人评论构建金融顾问角色,并通过智能体循环精炼,在持仓重建和管理人评论对齐任务上优于通用基线,生成更具体有用的建议。

Comments 17 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31085 2026-07-01 cs.AI 新提交 57%

DDIAgents: Mechanism-Conditioned Context Flow for Drug-Drug Interaction Prediction

DDIAgents: 机制条件上下文流用于药物相互作用预测

Zhenqian Shen, Yu Liu, Xiaoyi Fu, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Institute of Biomedical Engineering, University of Oxford(牛津大学生物医学工程研究所) Division of Emerging Interdisciplinary Areas, Hong Kong University of Science and Technology(香港科技大学新兴跨学科领域学部)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 提出DDIAgents多智能体框架,通过动态知识编排预测药物相互作用,减少无关信息并生成可解释推理,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30942 2026-07-01 cs.HC cs.CY 新提交 57%

Anthropomorphism in AI Companion Communities: Age, Gender, and Emotional Correlates

AI伴侣社区中的拟人化:年龄、性别与情感相关性

Afia Mubashir, Boden Moraski, Stephanie Choi, Rose E. Guingrich

专题命中 其他安全 :safety(abstract);分类 cs.CY

AI总结 本研究利用Reddit数据,分析AI伴侣社区中用户年龄、性别与拟人化倾向及情感表达的关系,发现成年人和女性更易拟人化,积极情感与拟人化正相关,且这些关系在成年人中更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30899 2026-07-01 cs.CR cs.AI 新提交 57%

Curvature-Guided Module Localization for Low-Rank Detoxification of Backdoored Large Language Models

曲率引导的模块定位用于后门大语言模型的低秩解毒

Arash Raftari, Mehrdad Mahdavi, Nathan Blackthorn, Andrew Arash Mahyari

机构 * AIVault Inc.(AIVault公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出一种基于激活修补和Fisher/K-FAC曲率分析的机制引导权重空间修复框架,定位并低秩修复后门大语言模型中最有影响力的模块,有效抑制触发条件恶意行为同时保持良性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31725 2026-07-01 cs.SE 新提交 50%

Do Machines Struggle Where Humans Do? LLM and Human Comprehension of Obfuscated Code

机器会在人类感到困难的地方也遇到困难吗?大语言模型与人类对混淆代码的理解

Jack Le, Anh H. N. Nguyen, Tien N. Nguyen

专题命中 其他安全 :alignment(abstract)

AI总结 基于人类对混淆代码理解的研究,评估大语言模型是否共享人类在混淆代码下的失败模式,发现推理调优模型与人类困难模式显著对齐,而指令调优模型相关性接近零。

Comments 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31467 2026-07-01 cs.CV 新提交 50%

AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience

AeroVerse-SatAgent: 受认知神经科学双视觉通路理论启发的无人机-卫星协同空间推理

Wenyi Zhang, Fanglong Yao, Youzhi Liu, Peng Hu, Zhengqiu Zhu, Chen Gao, Xian Sun, Kun Fu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院目标认知与应用技术重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机学院)

专题命中 其他安全 :alignment(abstract)

AI总结 针对单视角感知易受遮挡和视角变化影响的问题,提出受人类视觉双通路机制启发的无人机-卫星协同空间推理模型SatAgent,通过几何感知3D重建编码器、多视角拓扑语义对齐模块和一致性损失,在复杂城市环境中实现鲁棒推理,构建首个大规模协同数据集,性能超越现有模型。

Comments 21 pages, 10 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31372 2026-07-01 cs.SE 新提交 50%

Failure-Based Testing for Deep Reinforcement Learning Agents

基于失败的深度强化学习智能体测试方法

Weibin Lin, Jiangtao Meng, Zheng Zheng

专题命中 其他安全 :safety(abstract)

AI总结 针对深度强化学习智能体测试中奖励信号失效的问题,提出一种基于任务失败洞察的黑盒测试方法PRT,通过优先测试高难度任务来提升故障检测效率,在四个基准上测试成本降低超50%。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31204 2026-07-01 cs.CV 新提交 50%

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

AC3S: 面向3D感知合成数据生成的自适应条件控制

Eric Ji, Qiran Hu, Wufei Ma, Sarthak Jain, Yingying Li, Minh N. Do, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学) College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)

专题命中 其他安全 :alignment(abstract)

AI总结 提出AC3S框架,通过自适应条件控制模块调节ControlNet强度,结合多智能体视觉语言模型生成3D感知提示,实现高质量、结构对齐的合成图像生成。

Comments Accepted by ECCV 2026. Project page: https://ac3s.cvmlgroup.web.illinois.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31086 2026-07-01 cs.CV 新提交 50%

CasaMaestro: Multi-View Panoramas for House-Scale 3D Reconstruction

CasaMaestro:用于房屋级3D重建的多视角全景图

Yuzhou Ji, Xiaotian Yang, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab)

专题命中 其他安全 :alignment(abstract)

AI总结 提出CasaMaestro模型,仅需20-50张稀疏多视角室内全景图,即可直接预测度量深度和相机位姿,实现全屋快速点云重建,是首个支持房屋级重建的多视角全景模型。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24330 2026-07-01 cs.CV 新提交 50%

REDI-Match: Rotation-Equivariant Distillation for Efficient and Robust Dense Matching

REDI-Match: 旋转等变蒸馏实现高效鲁棒密集匹配

Yinji Ge, Guixu Zheng, Wulong Guo, Qian Feng, Xu Wu, Kai Zhou, Xinyuan Liu, Fei Xing

机构 * Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Beihang University(北京航空航天大学) Zhejiang University(浙江大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出REDI-Match框架,通过旋转等变蒸馏将视觉基础模型的语义知识注入轻量等变编码器,结合熵驱动空间对齐模块,在密集匹配中实现高效鲁棒的旋转不变性,在SatAst数据集上提升13.89%姿态精度且速度提升1.9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22158 2026-07-01 cs.CV 新提交 50%

Improving Reasoning in Vision-Language Models via Perception Verified Self-Training

通过感知验证自训练提升视觉-语言模型的推理能力

Sourabh Sharma, Sonam Gupta, Sadbhawna

机构 * Malaviya National Institute of Technology Jaipur(马拉维亚国家理工学院斋浦尔分校) IBM Research(IBM研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 提出感知验证自训练框架,通过解耦感知与推理的CoT模板和无监督评估方法PerceptEval,结合两阶段课程学习,提升视觉-语言模型在视觉推理中的准确性并减少幻觉。

Comments Accepted at The European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09919 2026-07-01 cs.CV 版本更新 50%

MetricHMSR:Metric Human Mesh and Scene Recovery from Monocular Images

MetricHMSR:基于单目图像的度量人体网格与场景恢复框架

Chentao Song, He Zhang, Haolei Yuan, Haozhe Lin, Jianhua Tao, Hongwen Zhang, Tao Yu

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学) Beihang University(北京航空航天大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出MetricHMSR框架,通过引入bounding camera ray map和HumanMoE模型,实现人体网格和场景的度量恢复,提升单目深度估计的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09930 2026-07-01 cs.CV cs.IR 版本更新 50%

Fine-grained Motion Retrieval via Joint-Angle Motion Images and Token-Patch Late Interaction

基于关节角度运动图像与令牌-补丁后期交互的细粒度运动检索

Yao Zhang, Zhuchenyang Liu, Yanlan He, Thomas Ploetz, Yu Xiao

机构 * Aalto University(阿尔托大学) Fudan University(复旦大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他安全 :alignment(abstract)

AI总结 提出一种可解释的关节角度运动表示,结合预训练视觉Transformer和令牌级后期交互机制,实现文本与3D运动之间的细粒度对齐,在HumanML3D和KIT-ML上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06845 2026-07-01 cs.CV 版本更新 50%

PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates

PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新

Satoshi Hashimoto, Yanan Wang, Hitoshi Nishimura, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究所)

专题命中 其他安全 :alignment(abstract)

AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20653 2026-07-01 cs.SE cs.SY eess.SY 版本更新 50%

SysVCoder: An LLM-Driven Framework for Systematic Generation of System-Level Design

SysVCoder: 一种LLM驱动的系统级设计系统性生成框架

Jian Zuo, Junzhe Liu, Xianyong Wang, Chen Liang, Navya Goli, Umamaheswara Rao Tida, Zhenge Jia, Zhaoyan Shen, Mengying Zhao

专题命中 其他安全 :alignment(abstract)

AI总结 提出SysVCoder框架,通过两阶段生成流水线、规则对齐机制和领域特定检索增强生成策略,提升Verilog系统级设计的生成质量与效率,在功能正确性上优于现有方法。

Comments This paper is accepted at APPT'26

详情

展开后加载摘要…

URL PDF HTML 收藏