arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-09 至 2026-07-09 共收录 57 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 1 篇

2511.01043 2026-07-09 cs.SE 版本更新 90%

DPO-F+: Aligning Code Repair Feedback with Developers' Preferences

DPO-F+:使代码修复反馈与开发者偏好对齐

Zihan Fang, Yifan Zhang, Yueke Zhang, Kevin Leach, Yu Huang

专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract)

AI总结 研究针对大语言模型在代码修复中开发者难解读输出的问题,提出DPO-f+框架,通过定义指标、构建数据集、微调模型及评估反馈质量,提升反馈准确性与对齐度,增强了代码理解和人机协作。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2607.00572 2026-07-09 cs.AI cs.CR 新提交 88%

HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment

HARC:耦合有害性与拒绝方向以实现鲁棒的安全对齐

Shei Pern Chua, Hao Wu, Qianli Ma, Fangzhao Wu

机构 * Tsinghua University(清华大学) Southeast University(东南大学) Microsoft(微软公司)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 提出HARC微调方法,通过耦合提示和响应位置的有害性与拒绝方向,在不损害通用能力的情况下提升LLM安全对齐的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07397 2026-07-09 cs.AI cs.DB 新提交 57%

Agentic Data Environments

智能体数据环境

Elaine Ang, Chenxi Huang, Georgios Liargkovas, Jerry Liu, Jinhui Liu, Nikos Pagonas, Charlie Summers, Haonan Wang, Jiakai Xu, Tianle Zhou, Yusen Zhang, Zhou Yu, Zhuo Zhang, Tianyi Peng, Kostis Kaffes, Eugene Wu

机构 * Columbia University(哥伦比亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 探讨智能体数据环境,其作为智能体运行的执行基础,既能增强智能体能力又保障安全。该环境拓宽了智能体运行的数据范围,改变了对数据系统的传统认知,有望在提升智能体效能同时控制故障成本。

Journal ref IEEE Data Bulletin Vol. 50 No. 1 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07252 2026-07-09 cs.LG cs.RO 新提交 57%

Safe Reinforcement Learning using Ideas from Model Predictive Control

利用模型预测控制思想的安全强化学习

Georg Schäfer, Jakob Rehrl, Stefan Huber, Simon Hirlaender

机构 * Salzburg University of Applied Sciences(萨尔茨堡应用科学大学) Paris Lodron University of Salzburg(萨尔茨堡巴黎洛德伦大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 针对强化学习在安全约束方面的挑战,提出结合深度强化学习与模型预测控制的通用框架,利用系统动力学模型定义可行状态 - 动作空间,经安全过滤器投影动作,在实验室试验台验证该方法可成功探索并稳定收敛。

Comments Accepted at Eurocast 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2607.07696 2026-07-09 cs.DB cs.AI 新提交 81%

Breaking Database Lock-in: Agentic Regeneration of High Performance Storage Readers for Database Bypass

打破数据库锁定:用于数据库绕过的高性能存储读取器的智能再生

Victor Giannakouris, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 越狱攻击 :jailbreak(summary_cn,abstract);分类 cs.AI

AI总结 研究分析工作负载面临的数据访问瓶颈问题,提出Jailbreak方法,利用大语言模型辅助代码合成绕过数据库引擎直接读取存储文件,在PostgreSQL和MySQL上评估,性能显著提升,证明该方法可打破数据库系统数据锁定。

Comments To be presented at AIDB 2026 (co-located with VLDB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02999 2026-07-09 cs.CR cs.AI 版本更新 70%

NonTextual Target Attack

非文本目标攻击

Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone, Binjiang Institute of Blockchain and Data Security, Hangzhou(杭州高新技术区,滨江区块链与数据安全研究院) School of Cyberspace Security, Nanjing University of Science and Technology(网络安全学院,南京理工大学) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,新加坡国立大学) King Abdullah University of Science and Technology (KAUST)(卡布斯科学与技术大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 针对现有大语言模型越狱攻击的局限,提出非文本目标攻击NTA,通过非文本约束目标最大化不安全概率,分解目标便于优化,扩展攻击空间,在AdvBench上对安全对齐的大语言模型仅100次迭代,平均成功率达96.8%,性能远超现有攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07368 2026-07-09 cs.LG cs.AI cs.MA 新提交 62%

Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors

多智能体人工智能控制:分布式攻击阻碍实例级监测

Oliver Makins, Orazio Angelini, Zohreh Shams, Mary Phuong

机构 * MATS Research(MATS研究所)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究多智能体人工智能控制中的分布式攻击,开发FakeLab代码库,评估单智能体监测应对分布式攻击的效果,发现碎片化效应,指出其与代码比例无关,受模型能力影响,还揭示显式规划器及不同强度监测的作用。

Comments Submitted to NeurIPS; 81 pages; 32 figures and 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06807 2026-07-09 cs.CR cs.AI 新提交 57%

When Agents Go Rogue: Activation-Based Detection of Malicious Behaviors in Multi-Agent Systems

当智能体行为异常时:基于激活的多智能体系统恶意行为检测

Haowen Xu, Xue Tan, Lei Ma, Zhihao Zhang, Chao Wang, Qingze Wang, Ping Chen, Jun Dai, Xiaoyan Sun

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 针对多智能体系统面临的安全挑战,提出基于激活的框架AcMAS,通过分析智能体激活空间中的推理状态检测隐蔽攻击,不依赖交互图,还能恢复受损智能体功能,在检测隐蔽攻击上显著优于基线方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06643 2026-07-09 cs.CR cs.LG 新提交 57%

The Power of Backdoor Absorption in Community Training

社区训练中后门吸收的力量

Issam Seddik, Sami Souihi, Mohamed Tamaazousti, Sara Tucci Piergiovanni

机构 * Université Paris-Saclay, CEA LIST(巴黎萨克雷大学,CEA LIST)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 研究在分散训练中后门攻击问题,通过量化最小审计开销,将注入-吸收动态形式化为离散时间马尔可夫链,证明结合自然吸收等策略可使对手成功概率降为零,实证显示能有效抑制后门且效用无退化,为安全关键型AI提供高效防御。

Comments Technical Report, CEA-LIST. 15 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 2 篇

2607.07695 2026-07-09 cs.AI cs.GT cs.MA 新提交 86%

Institutional Red-Teaming: Deployment Rules, Not Just Models, Causally Shape Multi-Agent AI Safety

机构红队测试:部署规则而非模型,因果性地塑造多智能体人工智能安全

Yujiao Chen

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 红队测试 :safety(title,abstract);AI safety(title);分类 cs.AI

AI总结 研究多智能体人工智能安全中部署规则的影响,提出机构红队测试方法,通过IABench-CA实例化,发现规则改变集体安全、无安全默认规则、身份显著性是机制,还打包成安全案例工作流程认证规则区域并明确风险义务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07474 2026-07-09 cs.CR cs.AI cs.CL 新提交 62%

Beyond Attack-Success Rate: Action-Graded Severity Scale for Tool-Using AI Agents

超越攻击成功率:工具使用型人工智能代理的行动分级严重程度量表

Harry Owiredu-Ashley

专题命中 红队测试 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究指出代理红队测试基准的二元攻击成功率不能体现行动危害。为此引入行动分级伤害准则,通过预言机和评判小组计算量表。在AgentDojo工作区测试发现该准则能揭示新情况,虽与预言机一致性高但有盲点,贡献了可用于红队日志实际行动的严重程度工具。

Comments 8 pages, 6 figures. Code and artifacts: https://github.com/Harry-Ashley/action-graded-severity

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2604.07831 2026-07-09 cs.CR cs.CL cs.CV 版本更新 77%

Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection

GUI代理是否足够专注?通过语义层面的UI元素注入实现自动化干扰

Wenkui Yang, Chao Jin, Haisu Zhu, Weilin Luo, Derek Yuen, Kun Shao, Junxian Duan, Huaibo Huang, Jie Cao, Ran He

机构 * SAIS, UCAS(中国科学院大学人工智能学院) SIST, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 提示注入 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL

AI总结 本文提出语义层面UI元素注入方法,通过在截图上叠加安全对齐且无害的UI元素来误导代理的视觉基础。实验显示,该方法在五个受害者模型上提升了攻击成功率,并证明注入元素可作为持久吸引器。

Comments Accepted by ECCV 2026, public code at https://github.com/HashTAG00002/UI-Injection

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07433 2026-07-09 cs.CR 新提交 50%

Beware of Agentic Botnets: Scalable Untargeted Promptware Attacks via Universal and Transferable Adversarial HalluSquatting

警惕智能体僵尸网络:通过通用且可转移的对抗性幻觉蹲点进行可扩展的无目标提示软件攻击

Aya Spira, Stav Cohen, Elad Feldman, Ron Bitton, Avishai Wool, Ben Nassi

专题命中 提示注入 :prompt injection(abstract)

AI总结 研究针对实际威胁模型中无直接渠道时攻击者能否利用LLM应用的问题,提出对抗性幻觉蹲点技术,通过识别热门资源计算幻觉分布抢先注册对抗性提示,利用幻觉特性扩大无目标提示软件攻击范围并建立僵尸网络,实验证明该技术可行性及幻觉可转移性。

Comments Website: https://sites.google.com/view/agentic-botnets/home

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 2 篇

2510.17476 2026-07-09 cs.CL 版本更新 57%

Zoom In Disparities in Healthcare LLM Q&A

放大医疗保健语言模型问答中的差异

Ipek Baris Schlicht, Burcu Sayin, Zhixue Zhao, Frederik M. Labonté, Cesare Barbera, Marco Viviani, Paolo Rosso, Lucie Flek

机构 * Universitat Politècnica de València(瓦伦西亚理工大学) University of Trento(特伦托大学) University of Sheffield(谢菲尔德大学) Bonn-Aachen International Center for Information Technology, University of Bonn(波恩-亚琛信息科技国际中心,波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) University of Pisa(比萨大学) University of Milano-Bicocca(米兰-比可卡大学) ValgrAI Valencian Graduate School and Research Network of Artificial Intelligence(瓦伦西亚人工智能研究生学校和研究网络)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 研究多语言医疗保健问答中LLM的跨语言差异,构建多语言数据集,分析覆盖范围与响应对齐,通过案例研究发现差异显著,非英语维基百科上下文摘录可改善事实对齐,为构建公平多语言医疗AI系统提供途径。

Comments It is accepted to NLDB 2026: The paper can be accessed at https://link.springer.com/chapter/10.1007/978-3-032-29532-3_12

Journal ref NLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26306 2026-07-09 physics.optics cs.SY eess.SY 新提交 50%

Fiber Bragg grating-based acoustic sensing system enabled by ML-trained, sub-picometer-tunable hybrid III-V/SiN lasers

基于光纤布拉格光栅的声学传感系统:采用机器学习训练、亚皮米可调谐混合III-V/SiN激光器

Prabhav Gaur, Premanand Chandramani, Yossef Ehrlichman, Mohammed Alshamari, Yufei Chu, Abu Mitul, John Simons, Ibrahim G. Yayla, Ming Han, Ashok V. Krishnamoorthy

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 提出一种机器学习训练的混合III-V/SiN可调谐激光器,实现亚皮米级波长控制,用于光纤布拉格光栅声学传感系统,实现高灵敏度、多通道分布式声发射检测与自适应空间定位。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 3 篇

2607.06963 2026-07-09 cs.CR cs.AI cs.CL 新提交 62%

Large Language Models (LLMs) and Generative AI in Cybersecurity and Privacy: A Survey of Dual-Use Risks, AI-Generated Malware, Explainability, and Defensive Strategies

大型语言模型(LLMs)和生成式人工智能在网络安全与隐私中的应用:两用风险、人工智能生成的恶意软件、可解释性及防御策略综述

Kiarash Ahi, Saeed Valizadeh

机构 * Virelya Intelligence Research Labs(Virelya智能研究实验室) Google(谷歌)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 综述大型语言模型和生成式人工智能在网络安全中的应用,涵盖两用风险等多方面。通过回顾众多资料及实际案例研究,给出负责任部署建议与安全路线图,为应对人工智能驱动的网络安全挑战提供关键参考。

Comments Invited survey paper. 10 pages, 5 figures, 2 tables

Journal ref IEEE 6th Silicon Valley Cybersecurity Conference (SVCC), San Francisco, CA, USA, 2025, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28421 2026-07-09 cs.CV cs.AI 版本更新 57%

JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators

JuZhou 1.0 技术报告:首个完全在中国开发的AI加速器上训练的边缘原生文本到图像基础模型

Ce Chen, Congrui Wang, Yonglin Li, Zhenchen Wan, Mingyang Geng, Junhao Xiao, Zhengpeng Xing, Yaqing Hu, Yao Wu, Zhaoyang Qu, Long Lan, Xinwang Liu, Yingqi Peng, Shijia Li, Zufeng Zhang, Chen Ma, Jingjing Zhou, Xingyu Wang, Qilin Lu, Bin Jiang, Qilin Sun, Shanzhi Gu, Yaoguang Jin, Tongliang Liu, Kede Ma, Yifan Peng

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 提出JuZhou 1.0,一个超轻量级文本到图像基础模型,通过紧凑骨干网络、Rectified Flow训练、DMD2蒸馏和中文语义对齐,实现完全离线设备端运行,性能优于SDXL等模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06687 2026-07-09 cs.HC 新提交 50%

Exploring the Interaction of Explanation Styles, Context, and Trust of AI Privacy Redaction in AI-mediated Interactions

探索人工智能隐私编辑的解释风格、上下文和信任在人工智能介导交互中的相互作用

Roshni Kaushik, Maarten Sap, Koichi Onoue

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 研究人工智能介导通信中隐私编辑解释对用户信任的影响,设计场景并开展用户研究,发现提供解释能提升信任,上下文因素有影响,解释偏好因个体差异而异,强调平衡透明度与隐私及适应性解释对设计可信AI系统的重要性。

Comments Originally submitted to UIST, will be resubmitting

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 安全评测 20 篇

2607.07229 2026-07-09 cs.AI 新提交 88%

Reasoning Consistency Scanning: A Framework for Auditing Chain-of-Thought Validity in AI Safety Evaluations

推理一致性扫描:人工智能安全评估中思维链有效性审计的框架

Silvia Santano

机构 * Meridian Labs(子午线实验室) UK AI Safety Institute(英国人工智能安全研究所)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 研究人工智能安全评估中思维链推理的可靠性问题,提出推理一致性扫描方法,将其与可靠性区分并形式化,构建基准、实现扫描器,通过实验表明推理不一致存在且可检测,在模型和任务类型中有系统变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05088 2026-07-09 cs.AI 版本更新 85%

AI Chatbot Suicide Risk Detection and Response: Human Validation Study of the Open-Source VERA-MH Safety Evaluation

人工智能聊天机器人自杀风险检测与应对:开源VERA-MH安全评估的人工验证研究

Kate H. Bentley, Luca Belli, Adam M. Chekroud, Emily J. Ward, Emily R. Dworkin, Emily Van Ark, Kelly M. Johnston, Will Alexander, Millard Brown, Matt Hawrilenko

机构 * Spring Health Harvard Medical School(哈佛医学院) UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究针对人工智能聊天机器人用于心理支持时的安全性评估问题,以VERA-MH为基准,模拟用户与聊天机器人对话,通过持牌临床医生和基于LLM的评估器评级,验证了VERA-MH在检测自杀风险方面的可靠性,为后续研究指明方向。

Journal ref JMIR AI. 2026;5

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07184 2026-07-09 cs.LG cs.AI 新提交 81%

Predicting LLM Safety Before Release by Simulating Deployment

通过模拟部署预测大语言模型发布前的安全性

Marcus Williams, Hannah Sheahan, Cameron Raymond, Tomek Korbak, Deng Pan, Peilin Yang, Leon Maksin, Ningyi Xie, Phillip Guo, Ian Kivlichan, Micah Carroll

机构 * OpenAI(开放人工智能研究公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过模拟部署预测大语言模型发布前安全性的方法,从去识别化对话出发,固定前缀用候选模型生成回复来评估。该方法能估计行为不当率,优于基线,还能克服工具重新采样挑战,为外部研究提供途径,助力预测模型现实行为及评估部署风险。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07097 2026-07-09 cs.AI cs.CR cs.MA 新提交 79%

Operational Reframing and Approval-Framed Delegation in Multi-Agent LLM Safety

多智能体大语言模型安全中的操作重构与批准框架委托

Lifei Liu, Haoran Yu, Xiaochong Jiang, Su Wang, Pin Qian, Yihang Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究多智能体大语言模型安全评估,引入五条件控制对比设计分离有害意图、规划器与执行器行为等因素,发现汇总管道安全非稳定架构属性,操作重构是关键风险信号,还揭示各因素对安全的影响及模型排名与实际行为的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05403 2026-07-09 cs.LG cs.AI 版本更新 73%

Trust, but Don't Verify: Epistemic Blind Spots in LLM Source Evaluation

信任,但不验证:LLM 源评估中的认知盲点

Rohan N. Pradhan, Steve Goley

机构 * Amazon(亚马逊)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型在多源综合中是否评估证据质量,发现模型虽能检测伪造统计但未在综合中启用,而是依赖方法论-语域门控,导致数值有效性被抑制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13817 2026-07-09 cs.LG cs.NI 版本更新 70%

What's on My Network? Using Large Language Models to Identify Real-World IoT Devices at Scale

我的网络上有什么?使用大语言模型大规模识别现实世界中的物联网设备

Rameen Mahmood, Tousif Ahmed, Sai Teja Peddinti, Danny Yuxing Huang

机构 * New York University(纽约大学) Google(谷歌)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 研究共享环境中物联网设备识别难题,引入语义推理管道,用大语言模型构建高保真标签并指令微调模型,在众多供应商中取得高准确率,对多种问题保持稳健,为大规模可信设备识别提供基础。

Comments 18 pages, 3 figures

Journal ref Proc. ACM Netw. 4, CoNEXT2, Article 26 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07669 2026-07-09 cs.CL cs.AI 新提交 62%

DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation

DiaLLM:英语方言适应中稳健性-生成差距的研究

Jordan Painter, Dipankar Srirag, Adarsh Kappiyath, Diptesh Kanojia, Aditya Joshi, Lu Yin

机构 * Institute for People-Centered AI, University of Surrey(萨里大学以人为本人工智能研究所) University of New South Wales(新南威尔士大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究英语方言适应中稳健性与生成的差距,通过DiaLLM持续预训练并结合多种策略对比不同英语变体。发现二者分离,特定变体适应产出受青睐但优化奖励方法未获评估者偏爱,缩小差距需丰富奖励设计和投入方言资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07436 2026-07-09 cs.AI cs.CL cs.CR 新提交 62%

The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents

盲选策展人:有偏见的评判者如何在自我进化的智能体中悄然阻碍技能淘汰

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(亚马逊云科技生成式人工智能创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰科技中心,中国)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究自我进化智能体中,有偏见的评判者对技能淘汰的影响。通过损坏奖励分析等方法发现,“误判通过”偏差会导致技能淘汰机制失效,此为行为安全结果。还提出廉价审计可判断评判者是否越过阈值影响智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07219 2026-07-09 cs.CV cs.AI cs.LG 新提交 62%

Vision Foundation Models in Radiology: A Scoping Review of Data, Methodology, Evaluation and Clinical Translation

放射学中的视觉基础模型:数据、方法、评估和临床转化的范围综述

Alejandro Vergara-Richart, Xavier Rafael-Palou, Almudena Fuster-Matanzo, Ignacio Iborra Roncales, Ángel Alberich-Bayarri, Ana Jiménez-Pastor

机构 * Universitat Politècnica de València(瓦伦西亚理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 对2017年1月至2026年3月关于放射成像数据训练基础模型的研究综述,涵盖数据、架构、评估等方面。Transformer架构和自监督预训练为主,评估集中在分割和分类。虽有可迁移性,但临床转化因多种问题受限。

Comments 33 pages, 8 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01420 2026-07-09 cs.CL cs.AI cs.CV 新提交 62%

MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering

MultAttnAttrib:长文档问答中的无训练多模态归因

Dang Quang Thien Tran, Quang V. Dang, Vinamra Tyagi, Sai Soorya Rao Veeravalli, Trang Nguyen, Ryan A. Rossi, Franck Dernoncourt, Nedim Lipka, Koustava Goswami, Samyadeep Basu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出无训练归因方法MultAttnAttrib,利用模型预填充、选定注意力头和校准阈值定位证据,并构建多模态归因基准MultAttrEval,实验表明其优于多种方法,匹配GPT 5.4且延迟降低至1/7。

Comments 25 pages (8 main, 17 references + appendix), 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19723 2026-07-09 cs.CL cs.AI 版本更新 62%

Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges

大型语言模型中的数学推理:基准测试、架构、评估与开放挑战

Husnain Amjad, Raja Khurram Shahzad, Aamir Shahzad, Mehwish Fatima

机构 * organization= School of Electrical Engineering Computer Science, National University of Science organization= School of Computing, Data Mathematical Sciences, Western Sydney University, Indonesia organization= Department of Communication, Quality Management Information Systems, Mid Sweden University, Östersund Campus, Sweden

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型在数学推理方面的最新进展,通过分析数据集、架构、训练策略和评估协议,探讨了数学推理的基准测试、架构设计、评估方法以及未来的研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23990 2026-07-09 cs.CY cs.AI 62%

From Untamed Black Box to Interpretable Pedagogical Orchestration: The Ensemble of Specialized LLMs Architecture for Adaptive Tutoring

从混沌黑箱到可解释的教育编排:专精LLM集合架构用于自适应辅导

Nizam Kadir

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出ES-LLMS架构,通过分离决策与表达,利用可解释的BKT模型协调专精代理,提升辅导系统的可控性和可靠性,实验显示其在指导与信任方面优于传统模型。

Comments Accepted as a FULL paper at the 27th International Conference on Artificial Intelligence in Education (AIED 2026). 15 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏