arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2719 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 984 篇

2608.05485 2026-08-07 cs.CV 新提交 50%

VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing

VideoArgus:基于智能体评分规则的视频生成与编辑统一评估框架

Ziyun Zeng, Zixuan Wang, Yongsheng Yu, Hang Hua, Jiebo Luo

机构 * University of Rochester(罗切斯特大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对现有视频评估基准的局限,本文提出VideoArgus框架,构建含1026个实例的VideoArgus-Bench,其在与人类判断的相关性上优于基准特定评估器,且模型排名稳定。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05223 2026-08-07 cs.SE cs.CR 新提交 50%

Towards a Risk Assessment of Malicious Skill Files in Coding Agents

面向编码智能体中恶意技能文件的风险评估

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 安全评测 :safety(abstract)

AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。

Comments 29 pages, 6 figures, 6 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05184 2026-08-07 cs.IT cs.MM eess.IV math.IT 新提交 50%

Media Meets Communication in 6G: Fundamentals, Key Technologies, and Applications

6G中的媒体与通信:基础、关键技术及应用

Bingyan Xie, Longyu Zhou, Zihan Chen, Shunpu Tang, Mingyang Shi, Yu Tian, Guo Lu, Yongpeng Wu, Tianhao Liang, Tony Q. S. Quek, Guangtao Zhai, Wenjun Zhang

专题命中 安全评测 :trustworthy(abstract)

AI总结 该文针对6G视觉通信的媒体通信技术开展系统性综述,提出含四大维度的统一框架,涵盖AI驱动媒体技术与感知媒体的无线传输等内容,为6G媒体通信研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04006 2026-08-05 cs.HC 新提交 50%

Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education

校准可信度:为教育领域评估大型语言模型(LLM)协同设计指标与可视化方案

Adam Coscia, Sujata Duwal, Langdon Holmes, Scott Crossley, Alex Endert

专题命中 安全评测 :alignment(abstract)

AI总结 本研究针对教育领域LLM响应的教学适配性评估缺口,通过与学习工程师协同设计可信度指标与可视化工具,提升了评估信度,为相关工具提出设计准则。

Comments Under review. 48 pages, 22 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03392 2026-08-05 cs.SE 新提交 50%

Self-Evolving Coding Agents

自进化编码智能体

Hao Zhou, Haichuan Hu, Ye Shang, Quanjun Zhang

专题命中 安全评测 :safety(abstract)

AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03337 2026-08-05 cs.SE 新提交 50%

Assessing Behavioral Validation in UI Component Test Suites Using Inferred Metamorphic Relations

利用推断的变形关系评估UI组件测试套件中的行为验证

Yu Pei, Cunming Zhang, Jeongju Sohn, Mike Papadakis

专题命中 安全评测 :alignment(abstract)

AI总结 该研究提出基于推断变形关系(MR)的框架,可补充执行类指标,用于评估UI组件测试套件的行为验证,发现现有测试存在行为缺口,且MR覆盖率具备实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03078 2026-08-05 cs.CV 新提交 50%

LDU-Bench: Multimodal LLM Evaluation for Lithography Defect Understanding under Layout-Varying Circuit Backgrounds

LDU-Bench:面向不同布局电路背景下光刻缺陷理解的多模态大语言模型评估基准

Huanglong Ji, Botong Zhao, Shujing Lv, Yue Lv

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出LDU-Bench这一多模态基准,将光刻审查工作流程分解为四项任务,评估发现现有多模态大语言模型的缺陷分类能力无法稳定迁移至下游审查阶段,为工业MLLM评估提供了统一平台。

Comments 12 pages, 3 figures, and 5 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00647 2026-08-04 q-fin.TR q-fin.CP q-fin.RM 新提交 50%

Axient: On-Chain Credit and Loss Allocation for Leveraged Event Markets: A Venue-Agnostic Protocol for Traders, Credit Providers, Market Makers, and Liquidation Backstops

Axient:杠杆事件市场的链上信用与损失分配——面向交易者、信用提供者、做市商及清算后援的场所无关协议

Maksym Nechepurenko

专题命中 安全评测 :safety(abstract)

AI总结 Axient是面向多角色的场所无关链上信用协议,通过形式化架构与内生模型实现损失分配等机制,实验验证其分层保护等特性,为杠杆事件市场提供解决方案。

Comments 90 pages, 17 figures. Formal protocol design and fixed-seed synthetic agent-based validation; no live Axient or venue data

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00279 2026-08-04 eess.IV cs.CV 新提交 50%

Learning to See Locally and Align Clinically with Pathology Semantics for Radiology Report Generation

学习局部感知并与病理学语义临床对齐的放射学报告生成方法

Xuan Cuong Ngo

专题命中 安全评测 :alignment(abstract)

AI总结 针对放射学视觉-语言模型的图像-文本对齐缺陷,提出病理学感知对齐框架PALM,结合共享病理学原型与掩码证据建模,在多数据集上提升报告生成与异常鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02320 2026-08-04 cs.RO cs.CV 新提交 50%

TravKAN: Fast and Interpretable Nonlinear Traversability Analysis with Kolmogorov-Arnold Networks

TravKAN:基于Kolmogorov-Arnold网络的快速可解释非线性可通行性分析

Daniel Fusaro, Simone Mosco, Wanmeng Li, Alberto Pretto

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于Kolmogorov-Arnold网络的TravKAN框架,结合LiDAR反射率手工特征,在公开数据集上性能优于传统深度模型,兼具可解释性与高效性,适用于安全关键的机器人可通行性分析。

Comments This paper has been accepted for publication at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01938 2026-08-04 cs.CR 新提交 50%

D-MUTRA: DLT-based MUTual Remote Attestation for Multi-Agent Systems

D-MUTRA:面向多智能体系统的基于分布式账本(DLT)的相互远程证明

Adam Zahir, Vincent Lefebvre, Mark Angoustures, Milan Groshev, Carlos J. Bernardos

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对多智能体系统传统远程证明的局限,本文提出基于区块链的D-MUTRA框架,实现智能体间的持续相互证明,可检测恶意软件修改,且扩展时开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01759 2026-08-04 cs.CR 新提交 50%

Benign Alone, Harmful Together: Exploiting Experience Composition in Self-Evolving LLM Agents

单独无害,联合有害:在自进化大语言模型智能体中利用经验组合

Bingyu Yan, Xiaoming Zhang, Chaozhuo Li, Ziyi Zhou, Yirui Qi, Litian Zhang

专题命中 安全评测 :safety(abstract)

AI总结 本研究提出EvoBreak攻击,利用自进化LLM智能体的良性经验组合,结合BreakGym生成训练目标,在保持高无害性的同时优于现有攻击,揭示了新的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01592 2026-08-04 cs.SE 新提交 50%

How Well Do LLMs Generate Taxonomies in the SE Domain? A Multi-perspective Evaluation Framework

大型语言模型在软件工程领域生成分类体系的表现如何?一个多视角评估框架

Sota Nakashima, Yuta Ishimoto, Masanari Kondo, Tao Xiao, Yasutaka Kamei

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出首个SE领域自动化分类体系生成的多视角评估框架,对比TnT-LLM与CLIMB两种方法及5种LLM,揭示二者在质量、效率上的权衡,为SE领域应用该技术提供了可操作见解。

Comments 13 pages, Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01451 2026-08-04 cs.SE 新提交 50%

Doc2CI: A Multi-Service Study of CI Configuration Generation Using Large Language Models

Doc2CI:基于大语言模型的CI配置生成多服务研究

Taher A. Ghaleb

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过构建DOC2CI基准评估LLM生成CI配置的能力,发现其结构有效性不足,提出无需训练的模式引导修复方法提升有效性,为相关工具开发提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00692 2026-08-04 cs.SE 新提交 50%

Vul4Py: Benchmarking Automated Vulnerability Repair in Python with Paired Exploit and Functional Oracles

Vul4Py:利用配对漏洞利用与功能预言机对Python自动化漏洞修复进行基准测试

Tan Bui, Ting Zhang, Ferdian Thung, Yunpeng Xiong, Penghao Jiang, Xin Zhou, David Lo

专题命中 安全评测 :trustworthy(abstract)

AI总结 本研究提出Vul4Py基准测试,含100个Python真实漏洞及配对预言机,对比三类AVR方法,发现智能体OpenHands修复漏洞数远超同类方法,配对预言机保障结果可信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00624 2026-08-04 cs.SE 新提交 50%

Can Perplexity Serve as a Cognitive Signal for Code Understandability?

困惑度能否作为代码可理解性的认知信号?

Xiaokai Rong, Mohammadali Sefidi Esfahani, Aashish Yadavally, Rigby Peter, Tien N. Nguyen

专题命中 安全评测 :alignment(abstract)

AI总结 本研究通过实证发现,词元级困惑度的简单片段级聚合与人类代码可理解性相关性不可靠,明确其仅适用于局部代码困惑,需经特定分析才能用于可靠的代码可理解性测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00072 2026-08-04 cs.CV 新提交 50%

Volcanic Clouds Detection through QCNN and Geostationary Satellite Multispectral Imagery

基于QCNN与静止卫星多光谱影像的火山云检测

Federica Torrisi, Claudia Corradino, Alessandro Grilli, Tommaso Catuogno, Mattia Verducci, Elisabetta Paladino, Luigi Giannelli, Alessandro Sebastianelli

机构 * Istituto Nazionale di Geofisica e Vulcanologia (INGV)(国家地球物理与火山学研究所) Thales Alenia Space Italia(泰雷兹阿莱尼亚空间意大利公司) Euro-Mediterranean Center on Climate Change(欧亚地中海气候变化中心) Università di Catania(卡塔尼亚大学) INFN(国家核物理研究所)

专题命中 安全评测 :safety(abstract)

AI总结 本研究探讨混合量子卷积神经网络(QCNN)对含火山云的卫星图像分类的潜力,对比不同量子比特数QCNN与纯经典架构的性能,以解决火山云检测难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27674 2026-07-31 cs.SE 新提交 50%

Can Large Language Models Resolve Real Java Merge Conflicts? An Evaluation with a Calibrated LLM-as-Judge

大语言模型能否解决真实的Java合并冲突?一项使用校准后的LLM作为评判者的评估

Bowen Shen

专题命中 安全评测 :trustworthy(abstract)

AI总结 该研究针对真实Java合并冲突,构建仅用推理信号的LLM求解器,经校准的LLM评判者评估发现,其解决冲突的覆盖和匹配开发者方案的表现优于传统工具AutoMerge,但结构正确性仍需确定性检查保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27294 2026-07-31 cs.SE 新提交 50%

AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents

AgentS4D:基于大语言模型的工作空间智能体执行生命周期内运行时风险基准

Jiajun Zhou, Zhaoxuan Ke, Jihang Ye, Xuanze Chen, Shanqing Yu, Qi Xuan

专题命中 安全评测 :safety(abstract)

AI总结 研究推出AgentS4D基准,评估20种智能体配置在328个风险案例中的表现,发现任务完成不代表安全,需跨风险条件完整评估智能体配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27182 2026-07-30 cs.HC 新提交 50%

GraphQAG: A Knowledge-Graph-Guided Visual Analytics Framework for Question-Answer Pairs Generation

GraphQAG:一种用于问答对生成的知识图谱引导型可视分析框架

Yize Li, Ruiqi Yu, Tianya Pan, Ningxin Li, Songyue Li, Xiangyang Wu, Jinchang Li, Zhiguang Zhou

专题命中 安全评测 :trustworthy(abstract)

AI总结 该研究针对长文档知识碎片化的问题,提出GraphQAG知识图谱引导型可视分析框架,经评估可帮助用户优化问答对集合,提升问答对的全面性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26451 2026-07-30 cs.SE 新提交 50%

ExplainBench: Evaluating Code Explanations from Agents

ExplainBench:评估智能体生成的代码解释

Zhiyuan Pan, Sungmin Kang, Imam Nur Bani Yusuf, Abhik Roychoudhury

专题命中 安全评测 :trustworthy(abstract)

AI总结 该研究针对智能体代码解释缺乏评估基准的问题,提出ExplainBench基准,实验发现其对智能体的排名与SWE-bench Verified不同,还实现了解释审核智能体,可提升智能体解释的可信度。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25823 2026-07-29 cs.IR 新提交 50%

Hypothesis-Driven Shelf Generation for Personalised Recommendation

用于个性化推荐的假设驱动型货架生成

Aleksandr V. Petrov, Tarun Chillara, Matthew D. Moellman, Lucas de Haas, Yabai Song, Alina Susoykina, Melissa Crawford, Gabriel Negash, Erik Franco, Tasnim Rahman, Binal Jhaveri, Shubham Bansal, Hugues Bouchard, Roberto Mirizzi, Mounia Lalmas, Aloïs Gruson

专题命中 安全评测 :alignment(abstract)

AI总结 研究针对个性化推荐中货架生成问题,提出内容假设驱动型系统,含假设生成等四个阶段,解耦货架规划与目录填充,支持独立优化,经生产管道结合多种操作,通过离线和在线评估,该系统能扩展个性化推荐供应,效果有竞争力。

Comments Accepted at ACM RecSys '26 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25640 2026-07-29 cs.IR 新提交 50%

LLM-as-a-Judge for Evaluating System Responses in Conversational Music Recommendation

大语言模型作为评估对话式音乐推荐系统响应的评判器

Seungheon Doh, Bruno Sguerra, Sergio Oramas, Elena V. Epure, Juhan Nam

专题命中 安全评测 :alignment(abstract)

AI总结 研究对话式音乐推荐系统中用大语言模型评估系统响应的可靠性,通过抽取会话、用四个指令微调的大语言模型生成候选响应,收集领域专家评分并分析,发现其与人工评估适度正相关且优于基线,还分析了性能随模型规模等的变化。

Comments Accepted for publication at the 20th ACM Conference on Recommender Systems (ACM-RecSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25489 2026-07-29 cs.CV 新提交 50%

Agentic AI in medicine: architectures, applications, evaluation, and challenges for clinical translation

医学中的智能体人工智能:临床转化的架构、应用、评估及挑战

Zheng Tong, Yang Liu, Wanshu Fan, Jing Qin, Zhongbin Han, Haifan Gong, Congyu Liao, Xiaofeng Liu, Cong Wang

机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) Affiliated Zhongshan Hospital of Dalian University(大连大学附属中山医院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of California, San Francisco(加州大学旧金山分校) Yale University(耶鲁大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :safety(abstract)

AI总结 研究探讨医学中智能体人工智能的架构、应用等,通过范围审查筛选相关研究,指出其范围未定论且评估与临床需求不符,证据基础有限,临床转化需更清晰定义、可重复评估等。

Comments Review article, 6 figures, 2 tables. 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25314 2026-07-29 cs.CV 新提交 50%

Sense it with your eyes: Sensation Generation and Understanding for Advertisements

用眼睛感知:广告的感官生成与理解

Aysan Aghazadeh, Sina Malakouti, Adriana Kovashka

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究广告视觉唤起感官问题,引入感官广告数据集和分类任务,提出SenseScore评估指标,介绍感官广告生成任务及SAGA多智能体框架,为感官感知视觉说服奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25300 2026-07-29 cs.CV 新提交 50%

MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing

MEDit-Bench:一个用于评估消息驱动叙事视频编辑的数据集

Katsuya Ogata, Zongshang Pang, Mayu Otani, Yuta Nakashima

机构 * The University of Osaka(大阪大学) CyberAgent, Inc.(株式会社CyberAgent)

专题命中 安全评测 :alignment(abstract)

AI总结 研究消息驱动的视频编辑问题,提出MEDit-Bench数据集及基准,通过多消息与编辑配对展示消息对编辑的影响,定义评估协议,标注消息属性,实验表明模型虽在宽松阈值下接近人类,但严格标准下仍落后,人类编辑更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25219 2026-07-29 cs.RO 新提交 50%

SONG: A Photorealistic 3D Gaussian Simulation Platform for Benchmarking Social Navigation

SONG:用于基准测试社会导航的逼真3D高斯模拟平台

Weiqi Huang, Dianyi Yang, Jiaxin Li, Shuangyi Dong, Hao Xu, Zan Wang, Wei Liang

机构 * School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 安全评测 :safety(abstract)

AI总结 研究针对社会导航模拟平台不足的问题,介绍了基于3D高斯点云渲染的SONG平台,利用其进行场景和化身表示等,还策划了SONG-Bench及评估套件,通过评估发现相关问题,证明微调数据可提高现实环境成功率,为研究提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25151 2026-07-29 cs.IR 新提交 50%

HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research

HiEviDR-Bench:深度研究中分层证据聚合的基准测试

Yubo Sun, Chunyi Peng, Yukun Yan, Zhenghao Liu, Sen Mei, Bangrui Xu, Xuanhe Zhou, Chi Chen, Maosong Sun

专题命中 安全评测 :alignment(abstract)

AI总结 针对深度研究中证据聚合评估不足问题,HiEviDR-Bench构建基准测试,涵盖多领域多模态设置,用证据图表示实例,开发评估框架及机制。含2000个问题,实验显示多模型虽报告质量好,但在引用准确性等方面欠佳,瓶颈在证据识别和中间主张构建。

Comments Code and data are available at https://ai9stars.github.io/HiEviDR-Bench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24821 2026-07-29 cs.MM cs.CV cs.SD 新提交 50%

AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities

AVE-Compass:迈向音频-视频编辑能力的整体评估

Yuqing Wen, Yukai Huang, Qianqian Xie, Jiangtao Wu, Yibin Lin, Yikai Gu, Jialu Chen, Yuanxing Zhang, Jiaheng Liu

专题命中 安全评测 :alignment(abstract)

AI总结 研究针对现有视频编辑基准未充分考虑视听耦合问题,提出AVE-Compass基准及AVE-Agent框架,通过多种评估方式评估编辑能力,能分解复杂指令迭代改进结果,提升了跨模态编辑等方面表现及感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25780 2026-07-29 cond-mat.stat-mech physics.soc-ph 新提交 50%

Macroscopic wall pressure and microscopic contact load in crowds without egress: social-group cohesion and boundary buffering

无出口人群中的宏观壁面压力和微观接触载荷:社会群体凝聚力和边界缓冲

Bo-Shiun Shen, Son-Hsien Chen

专题命中 安全评测 :safety(abstract)

AI总结 研究无出口人群中机械危险,通过弹性重定向模型和社会力模型及其耦合动力学,用社会群体凝聚力等量化风险,揭示耦合动力学产生的壁面压力/接触载荷权衡及相边界,为高密度场所人群风险缓解和安全规划提供指导。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏