arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-10 至 2026-07-10 共收录 18 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 18 篇

2607.07859 2026-07-10 cs.AI cs.HC cs.LG 新提交 84%

Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning

反馈操纵正则化:实现用于模仿学习的离线智能体对齐

Benjamin Poole, Minwoo Lee

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究聚焦强化学习智能体行为与人类价值观对齐。提出反馈操纵正则化算法,利用评估反馈校正模仿学习策略。通过改编安全体育馆环境测试,该方法能提升适应性、减少对齐错误,在有限数据下也保持稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08374 2026-07-10 cs.CL cs.AI cs.HC cs.RO cs.SI 新提交 81%

Large-Language-Models-as-a-Judge in Theory-Agnostic Adaptive Metric-Alignment for Prototypical Networks in Personality Recognition

大语言模型作为人格识别中原型网络的理论无关自适应度量对齐的评判器

Jing Jie Tan, Ban-Hoe Kwan, Danny Wee-Kiat Ng, Yan-Chai Hum, Shih-Yu Lo, Po-An Chen, Noriyuki Kawarazaki, Kosuke Takano, Anissa Mokraoui

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对人格识别受理论依赖公式限制的问题,提出理论无关的JAM框架,通过注意力池化图原型网络和跨理论协调方法学习结构化表示并统一数据集,还用大语言模型作为评判器机制,提升了跨框架泛化能力和性能。

Journal ref IEEE Transactions on Affective Computing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08038 2026-07-10 cs.AI 新提交 79%

A safety-oriented hypothetico-deductive framework for AI-assisted differential diagnosis

一种用于人工智能辅助鉴别诊断的面向安全的假设-演绎框架

Fan Ma, Mauro Giuffrè, Donald Wright, Kent McCann, Mark Iscoe, Lingfei Qian, Mingyang Jiang, Chi Wing Ng, Na Hong, Huan He, Cathy Shyr, Qingyu Chen, Lee Schwamm, Lucila Ohno-Machado, Hua Xu

机构 * Yale School of Medicine, Yale University(耶鲁大学医学院,耶鲁大学) Università degli Studi di Trieste(的里雅斯特大学) Vanderbilt University(范德堡大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究针对诊断错误威胁,提出AegisDx框架,通过协调LLM组件进行鉴别诊断、筛查危险情况、验证推理等。经多层面评估,该框架在诊断准确率及安全评分等方面表现优于独立LLM,为急性护理提供更优床边决策支持

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07758 2026-07-10 cs.LG 新提交 79%

Scalable and Trustworthy Earth Observation Foundation Models

可扩展且可信的地球观测基础模型

Syed Usama Imtiaz, Mitra Nasr Azadani, Nasrin Alamdari

机构 * Department of Civil and Environmental Engineering, Florida State University(土木与环境工程系,佛罗里达州立大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 研究地球观测基础模型,指出其因数据特性需特定领域适配。回顾相关设计原则,综合模型格局等内容,纳入基准证据说明评估问题,通过案例展示实践原则,提出应从多方面评估下一代遥感基础模型。

Comments (Preprint, in review) Elsevier Book Chapter: Next-Generation Remote Sensing Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07762 2026-07-10 cs.LG math.OC 新提交 79%

Trustworthy Machine Learning through the Lens of Combinatorial Optimization: Survey and Research Perspectives

从组合优化视角看可信机器学习:综述与研究展望

Thibaut Vidal, Julien Ferry

机构 * CIRRELT & SCALE-AI Chair in Data-Driven Supply Chains, Department of Mathematics and Industrial Engineering, Polytechnique Montreal(CIRRELT与数据驱动供应链的SCALE-AI主席、数学与工业工程系,蒙特利尔大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 探讨如何从组合优化视角实现可信机器学习,回顾并综合其与组合优化交叉领域进展,涵盖训练及训练后多任务,指出组合优化公式比纯启发式方法更具优势,虽有挑战,但在可信机器学习系统设计和部署中作用将增大。

Comments 67 pages, 16 mathematical highlights

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07881 2026-07-10 cs.SE cs.CR cs.LG 新提交 77%

Functional and Secure Code Generation with Task Vectors

使用任务向量进行功能和安全代码生成

Felix Wang, Anudeep Das, Mei Nagappan, N. Asokan

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 安全评测 :alignment(abstract);harmlessness(abstract);trustworthy(abstract);分类 cs.LG

AI总结 研究旨在解决大语言模型生成安全功能代码的问题,提出SecVecCoder方法,利用任务向量生成可信代码,在CodeGuard+基准测试中提升了可信代码完成率,且解码延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08215 2026-07-10 cs.DC 新提交 67%

On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend

论非 GPU 人工智能加速器在大模型推理中的局限性:基于华为昇腾的 MoE 和多模态服务的实地研究

Zheng Yu

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 研究非 GPU 人工智能加速器在大模型推理中的局限性,通过在华为昇腾系统上部署两个大型推理工作负载进行实地研究,总结平台八类限制及原因,量化相关指标,为评估或操作此类加速器的团队提供可重复参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26962 2026-07-10 cs.CY cs.AI cs.CL 版本更新 67%

DeepTutor: Towards Agentic Personalized Tutoring

DeepTutor:迈向代理式个性化辅导

Bingxi Zhao, Jiahao Zhang, Xubin Ren, Zirui Guo, Tianzhe Chu, Yi Ma, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 DeepTutor通过结合引用基础问题辅导与难度校准的问题生成,提出一个统一的开放源码框架,利用静态知识和动态学习者记忆实现个性化适应,并在五个领域大学课程中评估个性化教学效果。

Comments Tech Report, work in progress. Code available at https://github.com/HKUDS/DeepTutor

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08651 2026-07-10 cs.LG cs.DC 新提交 57%

Secure Decentralized Federated Learning via Gossip and Virtual Voting

通过八卦和虚拟投票实现安全的去中心化联邦学习

Amirhossein Taherpour, Xiaodong Wang

机构 * Columbia University(哥伦比亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究如何实现安全的去中心化联邦学习,提出gspDAG-FL框架,通过八卦历史达成共识,结合多种验证方法提高弹性,经实验验证其在减少协调瓶颈、提高吞吐量及检测无效起源等方面效果良好,学习质量接近基于验证的账本FL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08602 2026-07-10 cs.AI 新提交 57%

Towards Precision Therapy in Hepatocellular Carcinoma: A Clinical-Reasoning LLM for Risk Stratification and Treatment Guidance

迈向肝细胞癌的精准治疗:用于风险分层和治疗指导的临床推理大语言模型

Peng Cui, Jitao Wang, Siyan Xue, Yao Huang, Haoming Xia, Dong Li, Dengxiang Liu, Weilin Wang, Liping Liu, Leida Zhang, Yunfu Cui, Tao Peng, Daolin Ji, Haitao Zhao, Wei Zhang, Xiaojuan Wang, Weijie Ma, Zongren Ding, Jinlong Li, Yuan Ding, Jiajing Zhao, Zhiyu Chen, Chengkun Yang, Ziyue Huang, Jiaqi Liu, Fusheng Liu, Yang Zhou, Xiaojuan Wang, Zhongquan Sun, Shiyun Bao, Xiaojun Wang, Ming Yang, Guangxin Li, Bin Shu, Yong Liao, Hongxuan Li, Yao Tang, Shizhong Yang, Yongyi Zeng, Yufeng Yuan, Yinpeng Dong, Jihui Hao, Jun Zhu, Jiahong Dong

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究针对肝细胞癌治疗问题,提出HCC-STAR临床推理大语言模型。通过处理电子病历叙述输出风险分层、治疗方案等。经多中心队列验证,性能领先,能助医生决策,是可靠的肝细胞癌风险分层和精准治疗决策支持系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08029 2026-07-10 cs.LG 新提交 57%

Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment

重新思考小型视觉语言模型量化:从组件级分析到硬件感知边缘部署

Hyeju Shin, Chorwon Kim, Ryangsoo Kim, Hark Yoo, Jaein Kim

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文针对小型视觉语言模型量化,提出系统评估框架,在特定硬件上验证五个假设,分离相关组件得出结论,包括量化敏感性受结构范式影响、SigLIP编码器延迟情况、大语言模型INT4量化利弊、复合量化误差特点及不同平台每焦耳智能差异。

Comments 14 pages. Accepted at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02615 2026-07-10 cs.CR cs.AI cs.SE 新提交 57%

TAG: A Lightweight Framework for Test-Driven Agentic Artifact Generation

代理创建,我们验证:用于代理工件生成的轻量级框架

Yaniv Melamed, Yoni Zukerman, Michal Shechter, Miri Weissler, Ashwin Patil, Hani Neuvirth-Telem

机构 * Microsoft(微软)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究如何用大语言模型生成结构化工件并使其可靠用于生产部署。核心方法是基于“LLMs生成,我们验证”原则构建轻量级框架,贡献是提出含三关键属性的框架并在安全领域验证,还可用于其他工件生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00329 2026-07-10 eess.SY cs.LG cs.SY stat.ML 版本更新 57%

Benchmarking Recursive-Collapse Warning Claims Under Matched False-Positive Control

在匹配假阳性控制下对递归崩溃警告声明的基准测试

David Mullett

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 提出Loopzero基准框架,通过方向性遥测模式(增益G、递归持久性p、多样性δ)在匹配假阳性预算下评估递归系统崩溃警告声明,并报告标准检测器未达到可接受工作点。

Comments 29 pages, 7 figures, 2 tables; supplementary materials: 9 pages, 1 figure, 4 tables. Code, derived data packets, and Lean artifact: https://github.com/davidmullett/loopzero-paper-public (release tag lean-v1.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13994 2026-07-10 cs.CV cs.AI q-bio.NC 版本更新 57%

Human-like Object Grouping in Self-supervised Vision Transformers

自监督视觉Transformer中的类人物体分组

Hossein Adeli, Seoyoung Ahn, Andrew Luo, Mengmi Zhang, Nikolaus Kriegeskorte, Gregory Zelinsky

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文通过行为基准测试,探讨自监督视觉模型在物体感知上的类人特性,发现基于DINO目标的Transformer模型在预测人类反应时间方面表现最佳,且Gram矩阵结构对感知对齐有驱动作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08397 2026-07-10 cs.CV 新提交 50%

Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation

用于开放词汇量内镜组合式指称分割的属性检索

Shun Liu, Nan Xi, Yang Liu, Tianyu Luan, Xuan Gong, David Doermann

机构 * Virginia Commonwealth University(弗吉尼亚联邦大学) King’s College London(伦敦国王学院) University at Buffalo(纽约州立大学布法罗分校) Harvard Medical School(哈佛医学院)

专题命中 安全评测 :alignment(abstract)

AI总结 该研究针对内镜图像指称分割面临的挑战,引入ReferEndoscopy基准,提出AR-ERIS框架,利用属性检索进行开放词汇量内镜组合式指称分割,在模拟和真实内镜数据上实现最优性能且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08274 2026-07-10 cs.HC cs.SE 新提交 50%

How Analysts Use AI in High-Stakes Crime Linkage: An Industrial Study

分析师如何在高风险犯罪关联中使用人工智能:一项行业研究

Jessica Woodhams, Amy Burrell, Wanyin Li, Fahim Ahmed, Matthew Tonkin, Jan Lemeire, Arkady Konovalov, Steven Frisson, Mark Webb, Sarah Galambos, Vesna Nowack, Dalal Alrajeh

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究探讨分析师在高风险犯罪关联中如何用AI,通过与英国执法机构合作开发工具并进行混合方法可用性研究,发现分析师有选择地用AI预测且常验证,还关注模型特征,强调AI决策支持工具要整合解释与传统方法及现场评估的重要性。

Comments 12 pages, 6 figures, FSE Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08267 2026-07-10 cs.CV 新提交 50%

UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

UniRef-UAV:无人机图像通用指称的多模态基准测试

Haibin Tian, Huichao Xie, Xuelin Qian, Ruitao Lu, Junwei Han, Dingwen Zhang

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) College of Missile Engineering, Rocket Force University of Engineering(导弹工程学院,火箭兵工程大学) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(人工智能学院,重庆邮电大学)

专题命中 安全评测 :alignment(abstract)

AI总结 该研究针对无人机视觉定位面临的问题,引入通用指称任务,构建UniRef-UAV多模态基准测试,提出UAV-URNet检测式基线方法。实验表明该基线稳定可重复,多模态查询能减少模糊性,相关资源将公开助力可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19032 2026-07-10 cs.CV 版本更新 50%

Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models

诊断视觉语言模型中由损坏引起的可靠性故障

Xiangjie Sui, Songyang Li, Hanwei Zhu, Baoliang Chen, Yuming Fang, Xin Sun

机构 * City University of Macau(澳门城市大学) Nanyang Technological University(南洋理工大学) Jiangxi University of Finance and Economics(江西财经大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究视觉损坏对视觉语言模型行为的影响,引入Bench-C测试平台及稳健对齐分数(RAS),通过对13个VLM实验发现轻度损坏会提高top-1准确率却降低预测结构,支持超越最终答案的稳健性评估。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏