arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2606.12809 2026-06-12 cs.AI cs.LG 新提交 73%

MLUBench: A Benchmark for Lifelong Unlearning Evaluation in MLLMs

MLUBench: 多模态大语言模型终身遗忘评估基准

He Li, Haoang Chi, Qizhou Wang, Yunxin Mao, Zhiheng Zhang, Jie Tan, Tongliang Liu, Wenjing Yang, Bo Han

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MLUBench基准,评估多模态大模型在连续遗忘请求下的性能,发现现有方法存在累积退化,并揭示多模态对齐保持的挑战,提出LUMoE方法缓解退化。

Comments 36 pages, accepted to the ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12616 2026-06-12 cs.AI cs.CL 新提交 73%

PersonaDrive: Human-Style Retrieval-Augmented VLA Agents for Closed-Loop Driving Simulation

PersonaDrive: 面向闭环驾驶模拟的人类风格检索增强VLA智能体

Mahmoud Srewa, Praneetsai Iddamsetty, Mohammad Abdullah Al Faruque, Salma Elmalaki

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出PersonaDrive流水线,通过检索风格指令下的人类驾驶演示来调节视觉-语言-动作(VLA)驾驶智能体,实现闭环模拟中多样化的非自车智能体行为,无需针对每种风格重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11070 2026-06-10 cs.CL cs.AI 新提交 73%

T1-Bench: Benchmarking Multi-Scenario Agents in Real-World Domains

T1-Bench:真实世界领域中的多场景智能体基准测试

Genta Indra Winata, Amartya Chakraborty, Yuzhen Lin, Swasthi P Rao, Shikhhar Siingh, Houhan Lu, Nadia Bathaee, Sriharsha Hatwar, Paresh Dashore, Anmol Jain, Kshitij Tayal, Xiuzhu Lin, Anirban Das, Sambit Sahu, Shi-Xiong Zhang

机构 * Capital One(第一资本)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出T1-Bench,一个高保真、全面的基准,用于评估多领域真实客户场景中的智能体系统,通过交织的多轮交互任务提升复杂性和评估严谨性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10298 2026-06-10 cs.AI cs.CL 新提交 73%

From Context-Aware to Conflict-Aware: Generalizing Contrastive Decoding for Knowledge Conflict in LLMs

从上下文感知到冲突感知:泛化对比解码以应对LLMs中的知识冲突

Runze Jiang, Taiqiang Wu, Yan Wang, Bingyu Zhu, Longtao Huang

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) The University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型生成时外部上下文与参数先验之间的知识冲突,提出冲突感知范式,通过动态分配先验与上下文的权重,并设计自适应机制解决不同冲突状态下的不对称问题。

Comments 27 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09846 2026-06-10 cs.HC cs.AI cs.CL 新提交 73%

CANVAS: Captioning Art with Narrative Visual-Audio AI Systems

CANVAS: 用叙事视觉音频AI系统为艺术配文

Vignesh Nagarajan

机构 * BASIS Phoenix High School(BASIS凤凰高中)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种自动化工作流,利用大语言模型和文本转语音服务生成多感官艺术描述和同步音频解说,在20秒内以低于0.05美元的成本生成文本加音频输出,显著提高词汇多样性和叙事细节。

Comments 22 pages, 16 figures, 3 tables, 21 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10583 2026-06-10 cs.LG cs.AI math.OC 新提交 73%

NOVA: Symbolic Regression Discovery of Interpretable Car-Following and Lane-Change Models with Driver Heterogeneity

NOVA: 可解释的跟驰与换道模型及驾驶员异质性的符号回归发现

Ishak Abassi, Nassim Ali Bouazzouni, Farah Ibelaiden, Nadir Farhi

机构 * National School of Artificial Intelligence (ENSIA)(国家人工智能学院(ENSIA)) Univ Gustave Eiffel(古斯塔夫·埃菲尔大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出NOVA符号回归框架,从原始轨迹数据自动发现可解释的跟驰与换道结构,在NGSIM数据集上优于基线,并揭示主导非线性项与心理物理理论关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08682 2026-06-09 cs.LG cs.AI 新提交 73%

Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation

激活引导引发突现失调:一项更全面的评估

Qi Cao, Jian Lou, Meiting Liu, Wenjie Feng, Dan Li, See-Kiong Ng, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究激活引导是否引发突现失调,通过扩展评估范围,发现激活引导可导致广泛失调,且比微调产生更连贯的有害响应,并分析了关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08200 2026-06-09 cs.AI cs.LG 新提交 73%

Online Agent-as-a-Judge: Situation-Generating Evaluation for Interactive Agents

在线智能体作为裁判:面向交互式智能体的情境生成评估

Hyogon Ryu, Jeonghwan Kim, Yewon Lim, Chaeun Lee, Jeongwook Kim, Donghoon Ham

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出在线智能体作为裁判框架,通过部署环境内评估智能体主动生成相关情境,以评估交互式社交智能体的能力,提高标准覆盖率和与人类标签的一致性。

Comments ICML 2026 Workshop on Trustworthy AI for Good

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06825 2026-06-08 cs.CL cs.AI 新提交 73%

Progress-SQL: Improving Reinforcement Learning for Text-to-SQL via Progressive Rewards

Progress-SQL: 通过渐进式奖励改进文本到SQL的强化学习

Shihao Zhang, Xiaoman Wang, Yuan Liu, Yunshi Lan, Weining Qian

机构 * East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Progress-SQL,一种多轮强化学习框架,通过Oracle引导诊断树(ODT)生成子句级结构反馈,结合渐进式奖励(结构对齐、词汇对齐、延迟奖励和执行状态奖励),提升文本到SQL生成的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06526 2026-06-08 cs.AI cs.LG 新提交 73%

CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions

CrowdMath: 众包数学研究讨论数据集

Sherin Muckatira, Jesse Geneson, Slava Gerovitch, Pavel Etingof, Mikhail Gronas, Anna Rumshisky

机构 * University of Massachusetts Lowell(马萨诸塞大学洛文分校) San Jose State University(圣何塞州立大学) Massachusetts Institute of Technology(麻省理工学院) Dartmouth College(达特茅斯学院) Amazon AGI(亚马逊人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出CrowdMath数据集,包含164条专家标注的进展链,用于评估大语言模型在协作开放问题求解中的能力,发现模型在局部预测上表现良好但在角色分类上存在不足。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11093 2026-08-12 cs.LG cs.CV 新提交 72%

Cross-View Feature Matching: Survey, Benchmarking, and Foundation-Model Perspectives

跨视图特征匹配:综述、基准测试与基础模型视角

Songlin Du, Xiaoyong Lu, Zeyu Wu, Xiaobo Lu, Guobao Xiao, Bin Fan, Jiayi Ma, Takeshi Ikenaga

机构 * School of Automation, Southeast University(东南大学自动化学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Institute of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能研究院) School of Robotics, Wuhan University(武汉大学机器人学院) Graduate School of Information, Production and Systems, Waseda University(早稻田大学信息生产系统研究科)

专题命中 评测与基准 :foundation model(abstract,abstract_cn);分类 cs.LG

AI总结 本综述梳理跨视图特征匹配领域进展,构建结构化分类体系,开展统一基准测试,提炼设计原则,探讨开放挑战,为该领域发展提供全面参考。

Comments This manuscript goes beyond a conventional survey. It proposes a new taxonomy for cross-view feature matching, provides extensive benchmarking under unified datasets and protocols, and offers original analysis from the perspective of vision foundation models. These contributions provide substantive methodological synthesis, empirical findings, and new research insights

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02415 2026-08-04 cs.CL 新提交 72%

Training-Free versus Training-Based Intent Classification in LLMs: Accuracy, Robustness, and Failure Modes

大语言模型中无训练与基于训练的意图分类:准确性、鲁棒性与失败模式

Nan Chen, Zhouhao Yang, Soufiane Hayou

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 评测与基准 :language model(abstract,comments);large language model(abstract);分类 cs.CL

AI总结 本研究系统对比LLMs中无训练与基于训练的意图分类方法,发现两类方法在简单基准上性能饱和,基于训练的方法在难分类任务占优,无训练方法对混合与对抗性提示更鲁棒。

Comments Accepted at the Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08955 2026-08-11 cs.CV 新提交 71%

Damage Classification for 3D Point Cloud Data via 3D Data Analysis and Vision Foundation Model-based 2D Projections

基于三维数据分析与视觉基础模型二维投影的三维点云数据损伤分类

Evan Perez, Kalelo Dukuray, Erika Ardiles-Cruz, Jie Wei

机构 * City College of New York(纽约城市学院) Air Force Research Lab(空军研究实验室)

专题命中 评测与基准 :foundation model(title)

AI总结 本研究针对三维点云损伤分类的挑战,提出3PDA与2PDA两种算法,2PDA准确率略低但计算成本大幅降低且泛化性更强,为相关任务提供了高效替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05505 2026-08-07 cs.CV 新提交 71%

DynaPix: Can Vision-Language Models Identify the Exact Future?

DynaPix:视觉语言模型能否识别准确的未来?

Thong Nguyen, Vinh-Hien Do, Quynh Vo, Cong-Duy Nguyen, See-Kiong Ng

机构 * Centre for AI Research, VinUniversity(VinUniversity人工智能研究中心) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :language model(title)

AI总结 研究构建基准DynaPix,发现视觉语言模型能较好将预测与事件关联,但难以锚定时间,经模拟器真实记录训练可改善多数问题。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00393 2026-08-04 cs.HC 新提交 71%

MolecularCanvas: LLM-assisted Small-Molecule Drug Discovery via Structure-Guided Constraints

MolecularCanvas:基于结构引导约束的大语言模型辅助小分子药物发现

Haoyu Dong, Rui Sheng, Shuhao Zhang, Yushi Sun, Dingyang Wu, Hanxiang Chao, Olexandr Isayev, Huamin Qu, Yuyang Wu, Yanna Lin

专题命中 评测与基准 :LLM(title)

AI总结 该研究针对现有GenAI分子设计工具与专家工作流程适配差的问题,推出交互式系统MolecularCanvas,整合多类约束与工具,经用户验证可有效辅助小分子药物的迭代优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22188 2026-07-27 cs.MA 新提交 71%

Draining the Energy Commons: Self-Defeating Over-Appropriation as a Coordination Failure in Agentic LLM Collectives

耗尽能源共享池:自我挫败的过度占用作为智能体大语言模型集体中的协调失败

Marcantonio Bracale Syrnicov, Federico Pierucci, Matteo Prandi, Marcello Galisai, Piercosma Bisconti, Francesco Giarrusso, Daniele Nardi

专题命中 评测与基准 :LLM(title)

AI总结 研究大语言模型智能体在共享可再生能源储备时的协调失败问题,通过让四个同系列智能体自博弈,改变储备再生率,发现它们在需求超阈值时过度占用致自我挫败,实际消耗类似更不耐烦的开放访问基准,孤立响应评估会忽略此系统层面协调失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22006 2026-07-27 cs.CY econ.GN q-fin.EC stat.AP 新提交 71%

Unfit for stranding assessment: a panel-scale multimodal-LLM audit of building-decarbonisation disclosure (BeDA)

不适用于搁浅评估:建筑脱碳披露(BeDA)的面板规模多模态大语言模型审计

Jingyi Xu, Minghui Cheng, Anchen Sun

专题命中 评测与基准 :LLM(title)

AI总结 研究建筑脱碳披露情况,引入多模态大语言模型工具BeDA审计全球公司面板。发现多数披露不适用,存在报告差距,BeDA分数可靠,可监测该差距,为可执行的建筑搁浅法规提供支持,是筛选工具非预测工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21072 2026-07-24 cs.CV 新提交 71%

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

展示而非讲述:在生成像素而非语言模型文本中评估空间认知

Xu Wang, Kaixiang Yao, Miao Pan, Xiaohe Zhou, Xuanyu Liu, Wenqi Zhang, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title)

AI总结 研究图像生成模型空间认知评估问题,提出ProVisE框架及SpatialGen - Bench基准,通过统一设置评估相关模型,发现图像生成模型在像素空间直接外化答案时有竞争力,文本输出语言模型在组合空间推理中有优势,揭示了两者互补优势并建立测试平台。

Comments 36 pages, 14 figures. Project page: https://zju-omniai.github.io/ProVisE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20695 2026-07-24 cs.CY 新提交 71%

Language Models Embody and Amplify Human Cognitive Distortions: What Is to Be Done?

语言模型体现并放大人类认知扭曲:该怎么办?

Arnau Marin-Llobet, Steven A. Lehr, Mahzarin R. Banaji

专题命中 评测与基准 :language model(title)

AI总结 研究指出语言模型存在社会认知偏见,它不仅体现人类偏见,还会放大、加剧并传递偏见,鉴于其对决策影响巨大,提出了从诊断、监管和操作方面应对语言模型偏见问题的对策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09197 2026-07-13 cs.MA 新提交 71%

When is Routing Meaningful? Diversity and Robustness in Language Model Societies

路由何时有意义?语言模型社会中的多样性和鲁棒性

Fantine Huot, Michael Kaisers, Mirella Lapata

专题命中 评测与基准 :language model(title)

AI总结 研究多模型系统路由策略何时有意义,通过适应分层社会熵并引入基于扰动的度量来诊断失败模式,应用于EmbedLLM和RouterBench,发现HSE收益递减,KNN路由器扰动下鲁棒性差,提示路由稳定,揭示准确性与意义可能背离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08885 2026-07-13 cs.SE 新提交 71%

Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions

程序员是大型语言模型生成断言的糟糕且过度自信的评判者

Zhanna Kaufman, Yuriy Brun, Adithya Murali, Madeline Endres

专题命中 评测与基准 :LLM(title)

AI总结 研究程序员评估大型语言模型生成断言的能力,通过实验发现程序员判断正确断言较准,判断错误断言较差,自然语言解释未带来整体益处,凸显帮助开发者评估机器生成可靠性工件的重要性。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27646 2026-07-09 cs.CV physics.optics 新提交 71%

VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models

面向冻结视觉语言模型的VLM感知元光学前端设计

Chanik Kang, Raphaël Pestourie, Haejun Chung

机构 * Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系) School of Computational Science and Engineering, Georgia Institute of Technology(佐治亚理工学院计算科学与工程学院) Department of Electronic Engineering, Hanyang University(汉阳大学电子工程系)

专题命中 评测与基准 :language model(title)

AI总结 提出CODA框架,通过可微成像和伴随梯度更新优化连续密度元光学前端,直接优化冻结CLIP分类器的交叉熵损失,在ImageNet-100上将零样本准确率从53.75%提升至65.41%,并跨模型和数据集泛化。

Comments 18 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00020 2026-07-02 cs.RO 新提交 71%

EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories

EmbodimentSemantic:面向具身操作轨迹的空间场景图数据集与视觉语言模型基准

Hassan Jaber, Refinath S N, Luca Cagliero, Christopher E. Mower, Haitham Bou-Ammar

机构 * Politecnico di Torino(都灵理工大学) University College London(伦敦大学学院)

专题命中 评测与基准 :language model(title)

AI总结 提出EmbodimentSemantic数据集与基准,通过场景图三元组评估VLM在具身操作中的空间关系理解,发现现有模型在深度感知和视角依赖关系上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27738 2026-06-29 cs.HC 新提交 71%

HandMade: Spatial Prompting for Generative 3D Creation with Part-Labeled VR Sketches

HandMade: 基于部分标注的VR草图的空间提示生成式3D创作

Jialin Huang, Rana Hanocka, Ariel Shamir, Yotam Gingold

专题命中 评测与基准 :prompting(title)

AI总结 提出HandMade工作流,结合VR 3D草图和语言进行开放域3D资产生成,将粗粒度部分标注的3D草图作为空间提示,通过多视图部分引导和结构化提示实现空间布局与语言描述的协同创作。

Comments 15 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07674 2026-06-09 cs.CV q-bio.NC 新提交 71%

Simultaneous hyperkinetic movement disorders phenotyping: a cross-cohort pediatric transfer study using routine videos, markerless pose estimation and a tabular foundation model

同时性多动症表型分析:基于常规视频、无标记姿态估计和表格基础模型的跨队列儿科迁移研究

Laura Cif, Diane Demailly, Zohra Souei, Muhammad Mushhood Ur Rehman, Juan Dario Ortigoza Escobar, Mayté Castro Jiménez, Cécile A. Hubsch, Sophie Huby, Morgan Dornadic, Gun-Marie Hariz, Eduardo M. Moraud, Jocelyne Bloch, Gabriella A. Horvath, Xavier Vasques

机构 * Lausanne University Hospital (CHUV)(洛桑大学医院) University of Lausanne (UNIL)(洛桑大学) Institut du Neurone(神经元研究所) Clinique Beau Soleil(博索莱伊诊所) Institut Mutualiste Montpelliérain(蒙彼利埃互助研究所) Military University Hospital of Sfax(斯法克斯军事大学医院) University of Edinburgh(爱丁堡大学) Hospital Sant Joan de Déu(圣琼德迪乌医院) European Reference Network for Rare Neurological Diseases (ERN-RND)(欧洲罕见神经系统疾病参考网络) Instituto de Salud Carlos III(卡洛斯三世健康研究所) CHU Montpellier(蒙彼利埃大学医院) Umeå University(于默奥大学) University Hospital Lausanne(洛桑大学医院) Ecole Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) British Columbia Children’s Hospital(不列颠哥伦比亚儿童医院)

专题命中 评测与基准 :foundation model(title)

AI总结 提出结合无标记姿态估计、运动学描述符和预训练基础模型的视频框架,在成人数据上训练后迁移至儿科队列,经轻量校准后实现多种多动症现象的同时检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18072 2026-08-19 cs.CL 新提交 70%

Multi-Agent AI System for Radiology Report Structuring and Quality Assurance with Independent Radiologist Evaluation

用于放射科报告结构化与质量保证的多智能体AI系统:独立放射科医师评估

Iryna Hartsock, Cesar Lam, Christopher Otteni, Aliya Qayyum, Robert Gatenby, Cyrillo Araujo, Ghulam Rasool

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究开发了一款本地部署的多智能体AI系统,可实现放射科报告结构化与质量保证,经独立放射科医师评估,该系统表现良好,或有助于放射科报告标准化。

Comments 14 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17836 2026-08-19 cs.LG 新提交 70%

Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs

利用知识编辑中的关联上下文检索构建针对大语言模型(LLMs)的白盒攻击

Roman Maksimov, Vladimir Aletov, Vladimir Solodkin, Dmitry Bylinkin, Daniil Medyakov, Aleksandr Beznosikov

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对LLMs,提出结合关联上下文检索的知识编辑白盒攻击,提升攻击有效性且不严重损害模型整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17809 2026-08-19 cs.CL 新提交 70%

Whether LLMs Can Navigate Beliefs and Facts Depends on How You Phrase It

大型语言模型(LLMs)能否处理信念与事实取决于表述方式

Quang Minh Nguyen, Luis Frentzen Salim

机构 * KAIST(韩国科学技术院) National Taiwan University of Science and Technology(台湾科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对10个LLMs,发现其处理信念与事实的缺陷程度取决于表达信念的动词,源于任务混淆,一条指令可扭转该失败,解码时抑制注意力仅能部分恢复准确率。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17659 2026-08-19 cs.CR cs.AI 新提交 70%

MobileWorldSafety: Benchmarking GUI Agent Safety Against Environmental Injection Attacks in Android Apps

MobileWorldSafety:针对安卓应用中环境注入攻击的GUI智能体安全基准

Sujin Chen, Lijun Li, Tianyi Du, Jing Shao

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究推出MobileWorldSafety基准,基于142个真实安卓应用风险任务评估6种GUI智能体,发现其对环境注入攻击的成功率达40.4%-66.9%,为相关研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17597 2026-08-19 cs.CR cs.AI 新提交 70%

HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety

HarnessRisk:面向生命周期的智能体管控安全基准

Yajing Bai, Jinhao Duan, Jie Peng, Xianfeng Wu, Sijia Liu, Song Wang, Tianlong Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出面向生命周期的智能体管控安全基准HarnessRisk,含128个沙箱案例,评估多模型与管控配置的安全表现,发现管控配置阶段最易受攻击,明确风险识别未必带来安全行动,凸显多维度评估智能体安全的必要性。

Comments Project Page: https://baiyajing.github.io/harness-risk/

详情

展开后加载摘要…

URL PDF HTML 收藏