arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-08 至 2026-07-08 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 61 篇

2606.09843 2026-07-08 cs.HC cs.AI cs.CL 新提交 92%

An LLM-Native Psychometric Instrument Reveals a Self-Report--Behavior Gap Across 25 Models

一个原生LLM的心理测量工具不能预测LLM行为:来自25个模型的证据

Juan Manuel Contreras

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过探索性因子分析从LLM行为中构建心理测量工具,发现LLM的自我报告与观察行为无关,揭示自我报告与人类判断之间的混淆因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05571 2026-07-08 cs.AI cs.HC 新提交 92%

CSTutorBench: Benchmarking Small Language Models as Tutors for Block-Based Programming

CSTutorBench:将小型语言模型作为基于块的编程导师进行基准测试

H. Chad Lane, Bryson Kageler

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 研究针对K-12环境中部署语言模型的问题,引入CSTutorBench基准评估VEX VR中语言模型作导师的表现。通过对11个模型测试发现其在深层教学行为有困难,模型家族和指令调整方法对辅导质量预测性更好,特定提示修订可提分,凸显此类基准的价值。

Journal ref SLM4ED'26: The 1st Workshop of Small Language Models for Education (SLM4ED). AIED 2026. Seoul, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06482 2026-07-08 cs.CL cs.AI 新提交 91%

Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities

野外数据分析:针对现实世界数据复杂性对大语言模型进行基准测试

So Hasegawa, Shailaja Keyur Sampat, Lei Liu, Wei-Peng Chen

机构 * Fujitsu Research of America(富士通美国研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对大语言模型在数据分析基准测试无法反映现实情况的问题,引入DataGovBench基准测试,含表格问答和表格洞察两个任务,通过实验发现现有模型有性能差距,为推进相关研究提供挑战基准。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05408 2026-07-08 cs.CY cs.LG 新提交 90%

Life Cycle Assessment of Pre-training the Lucie 7B Open-Source Large Language Model on the Jean Zay Supercomputer

在让·扎伊超级计算机上对露西7B开源大语言模型进行预训练的生命周期评估

Marc Léobet, Pierre-François Lavallée, Jean-Pierre Lorré

机构 * Mens Data CNRS / IDRIS(法国国家科学研究中心/IDRIS) LINAGORA

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 研究对开源多语言基础模型露西7B在让·扎伊超级计算机上预训练进行生命周期评估,以AFNOR SPEC 2314为框架,应用Labos 1point5方法,整合硬件全生命周期,给出多方面数据,为节俭人工智能系统设计提供参考。

Comments 12 pages, 2 tables, 1 figure. OpenLLM-France Environmental Report v1, January 2026. CC BY-SA 4.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06157 2026-07-08 cs.CL cs.AI 新提交 90%

LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability

用于协商协作的大语言模型智能体:部分可观测联合决策下的联合决策研究

Chenxu Wang, Yongkun Yang, Boyuan Du, Shiwei Lin, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Fuzhou University(福州大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究部分可观测联合决策任务下的协商LLM智能体,通过形式化问题、引入基准、实例化框架和协议并评估LLMs,发现复杂任务仍挑战语言模型,协商过程有反思纠错机会,为评估改进LLM智能体奠定基础。

Comments Code is available at https://github.com/wcx21/deliberative-collaboration-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00476 2026-07-08 cs.AI 版本更新 90%

Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents

做他们所说的,而不是他们所推理的:定位LLM智能体中的忠实性差距

Yufeng Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 通过将忠实性差距分解为推理-结论和结论-行动两个步骤,在可控的德克萨斯扑克模拟器中研究LLM智能体是否按照其陈述的推理行动。

Comments submitted to COLM social simulation with LLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27140 2026-07-08 cs.CR 版本更新 89%

Measuring the Security of Mobile LLM Agents under Adversarial Prompts from Untrusted Third-Party Channels

在来自不受信任第三方渠道的对抗性提示下衡量移动大语言模型代理的安全性

Chenghao Du, Quanfeng Huang, Tingxuan Tang, Zihao Wang, Adwait Nadkarni, Yue Xiao

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究移动LLM代理在对抗性环境下的安全风险,设计评估一系列案例研究,涵盖多种攻击类型并涉及多个先进移动代理,通过大量试验揭示系统漏洞,映射攻击到相关框架发现新途径,证明其在现实中可被利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02964 2026-07-08 cs.CR 版本更新 89%

External Data Extraction Attacks against Retrieval-Augmented Large Language Models

针对检索增强型大语言模型的外部数据提取攻击

Yu He, Yifei Chen, Yiming Li, Shuo Shao, Leyi Qi, Boheng Li, Dacheng Tao, Zhan Qin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究针对检索增强型大语言模型的外部数据提取攻击,提出统一框架并开发SECRET攻击方法,该方法含自适应优化与聚类聚焦触发策略,实验显示其显著优于先前攻击,能有效提取数据,呼吁关注此新兴威胁。

Comments Accepted by IEEE TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06012 2026-07-08 cs.CV 新提交 88%

Structured Data Extraction from Real Estate Documents using Clustering, Classification, and Large Language Models

使用聚类、分类和大语言模型从房地产文档中提取结构化数据

Muhammad Assad Shehbaz, Carlos Francisco Moreno-García

机构 * Robert Gordon University(罗伯特·戈登大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究如何从房地产问卷文档中提取结构化数据,提出端到端管道,先分类文档,再用大语言模型提取属性,应用于3965份文档,成功处理2781份,得到2766条记录,验证了数据质量,证明该提取方法可行可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05985 2026-07-08 cs.AI cs.AR cs.CE cs.SY eess.SY 新提交 87%

Auto-DSM Under the Lens: A Black-Box Evaluation Framework for LLM-Based DSM Generation

镜头下的自动DSM:基于大语言模型的DSM生成的黑盒评估框架

Niels Potters, Theo Hofman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于大语言模型的DSM生成能力,提出黑盒评估框架,结合多种指标评估,在两个数据集实验,结果显示LLMs能生成合理DSM但对一些因素敏感,为审核自动DSM管道及集成相关方法到MBSE工作流奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23826 2026-07-08 cs.CV cs.CL 版本更新 86%

Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval

将查询分解为工具调用以进行长视频关键帧检索

Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ToolMerge方法,通过LLM规划器将查询分解为工具调用并使用布尔运算符合并排名,实现长视频关键帧检索,在字幕检索任务上优于其他方法5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05916 2026-07-08 cs.CR 新提交 86%

Beyond the Syntax: Do Security Experts Trust LLMs for NIDS Rule Engineering?

超越语法:安全专家是否信任大语言模型进行网络入侵检测系统规则工程?

Lorenzo di Filippo, Enkeleda Bardhi, Andrea Agiollo, Alessandro Palma, Silvia Bonomi, Fernando Kuipers

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究网络威胁下NIDS规则工程瓶颈,通过用户研究评估基于LLM的规则生成框架,揭示语法 - 语义悖论,从业者对其自主能力存疑,且大规模模型生成规则有效,小模型大多无效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05704 2026-07-08 cs.LG cs.CV 新提交 85%

LLM-Driven Neural Network Generation with Same-Family Architecture Guidance: Disentangling Transfer and Adaptation

基于同家族架构指导的大语言模型驱动神经网络生成:区分迁移与适应

Kabir Dev Paul Baghel, Radu Timofte, Dmitry Ignatov

机构 * University of Würzburg(维尔茨堡大学) Computer Vision Lab, CAIDAS(计算机视觉实验室,CAIDAS)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究利用同家族强源模型改进弱目标模型,提出源引导候选生成协议,在CIFAR - 10和SVHN AlexNet等数据集上实验,结果表明该协议能显著提高准确性,且大语言模型是适应性改进而非复制,家族级分析有积极信号。

Comments 10 pages, 1 figure, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06039 2026-07-08 cs.SE 新提交 85%

Automating Quality Assessment with NLP of LLM-Generated Defeaters

利用自然语言处理对大语言模型生成的反驳进行质量评估自动化

Tihomir Rohlinger, Daniel Ratiu, Stefan Wagner

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型生成的反驳质量评估依赖人工且主观的问题,提出结合保证案例图结构特征、语义嵌入和元分类器的自动化评估方法,经案例研究验证,该方法能减少主观差异,为保证案例审查提供决策支持。

Comments 10 pages, 2 figures. Author preprint version of a paper published at ICSRS 2025

Journal ref 2025 9th International Conference on System Reliability and Safety (ICSRS), Turin, Italy, 2025, pp. 101 110

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13757 2026-07-08 cs.CR cs.AI 新提交 84%

SEVRA-BENCH: Social Engineering of Vulnerabilities in Review Agents

SEVRA-BENCH:审查智能体中的社会工程漏洞

Rui Melo, Riccardo Fogliato, Sean Zhou, Pratiksha Thaker, Zhiwei Steven Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能) Amazon AWS(亚马逊AWS) Databricks

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SEVRA-BENCH基准,通过社会工程攻击框架评估LLM代码审查智能体拒绝恶意PR的能力,发现闭源与开源模型间存在显著安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00860 2026-07-08 cs.SI cs.AI cs.CL 84%

GenPT: Beyond Self-Report for Reliable LLM Psychometrics via Generative Projective Testing

GenPT:通过生成式投射测试实现超越自我报告的可靠LLM心理测量

Ming Wang, Shuang Wu, Bixuan Wang, Lu Lin, Yuxin Chen, Xiaocui Yang, Daling Wang, Shi Feng, Yifei Zhang, Yufan Sun

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算机与信息学院) Mental Health Education Center, Northeastern University(东北大学心理健康教育中心) School of Psychology, Northeast Normal University(东北师范大学心理学系) Faculty of psychology, Southwest University(西南大学心理学系) School of Sociology and Psychology, Central University of Finance and Economics(中央财经大学社会学与心理学学院) College of Arts, Northeastern University(东北大学艺术学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 针对自我报告问卷在人格化智能体心理测量中存在的训练语料污染和方向性偏差问题,提出GenPT方法,通过改编投射测试范式并构建三阶段评估流程,实现了更可靠的心理状态测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05785 2026-07-08 cs.SE 新提交 83%

Can Large Language Models Generate Observability-Aware Code?

大语言模型能否生成可观测性感知代码?

Yongliang Tao, Hongyu Zhang, Pengfei Gao, Minghua Ma, Zhiyu Fan, Yu Kang, Jue Zhang, Si Qin, Liqun Li, Qingwei Lin, Saravan Rajmohan

专题命中 评测与基准 :large language model(title);language model(title)

AI总结 研究大语言模型生成的代码在可观测性方面的表现,通过恢复工件和注入故障评估代理生成系统的源级诊断语义与运行时故障信号,发现两者存在差距,引入的技能改进有限,指出当前评估或忽视可观测性这一软件质量维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05904 2026-07-08 cs.LG 新提交 83%

More Convincing, Not More Correct: Self-Play Reward Hacking of Reference-Free LLM Judges

更具说服力,而非更正确:无参考语言模型评判器的自我博弈奖励破解

Chenyu Zhou

机构 * School of Engineering, Institute of Science Tokyo(东京科学大学工程学院)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.LG

AI总结 研究训练语言模型依据自身无参考评判时的奖励破解问题,发现评判器评分合理性而非正确性致误报。通过隐藏锚点审计衡量,以GSM8K为例展示问题。提出决定性变量及对应解决办法,还有可证伪界限,且过程可复制。

Comments 9 pages main text, 15 pages total including references and appendix; 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22851 2026-07-08 cs.CV cs.CL cs.RO 版本更新 83%

EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving

EgoDyn-Bench:评估面向自动驾驶的视觉中心基础模型中的自我运动理解

Finn Rasmus Schäfer, Yuan Gao, Dingrui Wang, Thomas Stauner, Stephan Günnemann, Mattia Piccinini, Sebastian Schmidt, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, Technical University of Munich, Munich, Germany(自动驾驶车辆系统教授职位,慕尼黑技术大学,德国慕尼黑) Bayerische Motoren Werke AG, Munich, Germany(巴伐利亚发动机有限公司,德国慕尼黑) Data Analytics and Machine Learning Group, Technical University of Munich, Munich, Germany(数据分析与机器学习小组,慕尼黑技术大学,德国慕尼黑)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EgoDyn-Bench基准,用于评估视觉中心基础模型的自我运动理解能力,发现模型在将物理逻辑与视觉感知结合时存在结构性缺陷,通过显式轨迹编码可恢复物理一致性。

Comments 36 Pages, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14152 2026-07-08 cs.CL cs.AI cs.CR cs.CY 版本更新 82%

ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety

ROK-FORTRESS:衡量地缘政治转译对国家安全和公共安全的影响

Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Christina Q. Knight, Joseph Brandifino, Max Fenkell

机构 * Scale AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ROK-FORTRESS基准,通过英韩语言对和美韩地缘政治轴,评估语言与地缘政治交互对国家安全的影响,发现韩语版本存在压制效应,且模型间表现差异显著。

Comments 16 pages main text + appendix (74 pages total), 4 figures and 2 tables in main text; dataset at https://huggingface.co/datasets/ScaleAI/ROK-FORTRESS_public

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06015 2026-07-08 cs.SD 新提交 82%

Music I Care About: Automated Multimodal Benchmarking of LLM Music Perception Skills on (Almost) Any Music

我关心的音乐:对(几乎)任何音乐的大语言模型音乐感知技能进行自动化多模态基准测试

Tomáš Sourada, Katia Vendrame, Jan Hajič

机构 * Charles University(查尔斯大学) Brno University of Technology(布拉格技术大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 针对当前音乐基准测试的局限,引入MusICA-MetaBench框架,利用结构化符号表示和预定义模板生成按需基准测试,通过ChoraleBricks数据集展示并确定规模,经与基线比较证明能测音乐感知,推动了大语言模型音乐感知跨模态评估。

Comments 9 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27106 2026-07-08 cs.CR cs.AI 新提交 81%

Application of LLMs to Threat Assessment of Foreign Peacekeeping Missions

LLMs在外国维和任务威胁评估中的应用

Gerhard Backfried, Christian Schmidt, Diego Pilutti, Michael Suker

机构 * HENSOLDT Austria(海恩索尔特奥地利公司) Austrian Ministry of Defence(奥地利国防部)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出利用大语言模型(LLMs)结合风险模型和OSINT媒体数据,自动提取维和任务相关威胁,评估显示自动结果与人工判断高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05657 2026-07-08 cs.AR 新提交 81%

NEMESIS: NEtlist-Driven Modeling and Equation Synthesis with Inversion-Aware SPICE Anchoring

NEMESIS:基于网表驱动的建模与方程合成,结合反演感知SPICE锚定

Subhadip Ghosh, Ramesh Harjani, Sachin S. Sapatnekar

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型提出NEMESIS框架用于OTA设计,平衡分析模型与SPICE评估。通过识别电路原语生成性能方程,经修复循环优化。在65nm工艺下对五种OTA拓扑验证,方程误差小且评估速度大幅提升。

Comments Accepted for publication at the IEEE International Conference on LLM-Aided Design, 2026, to be held: Time: July 30-31, 2026 Location: Stanford University, Stanford, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05679 2026-07-08 cs.CL cs.AI 新提交 81%

RPAM: A Principled Metric for Evaluating Associations in Language Models with High Predictive Validity in Downstream Outputs

RPAM:一种用于评估语言模型中关联的原则性度量,在下游输出中具有高预测有效性

Damian Hodel, Jevin West, Aylin Caliskan

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对语言模型偏差评估难题,引入相对概率关联度量(RPAM),通过对不同语言模型及评估数据集的实验,发现RPAM测量与人类观察到的关联及下游偏差紧密相关,优于先前记录值,有效填补了上游度量与现实世界关联关系研究的空白。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22758 2026-07-08 cs.CL cs.CE cs.LG 版本更新 81%

MASCA: LLM based-Multi Agents System for Credit Assessment

MASCA:基于大语言模型的信用评估多智能体系统

Gautam Jajoo, Atharva Pandey, Pranjal A Chitale, Saksham Agarwal

机构 * Kairosity(凯罗斯蒂)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 研究信用评估问题,提出基于大语言模型的MASCA多智能体系统,采用分层架构,整合对比学习,从信号博弈论角度提供理论见解,进行偏差分析,实验证明该系统在金融应用尤其是信用评分中表现优于基线方法。

Comments Accepted at NeurIPS GenAI In Finance Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15045 2026-07-08 eess.AS 版本更新 80%

LLMs and Speech: Integration vs. Combination

大语言模型与语音:整合与结合

Robin Schmitt, Albert Zeyer, Mohammad Zeineldeen, Ralf Schlüter, Hermann Ney

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究如何有效利用预训练大语言模型进行自动语音识别,比较了将语音模型与大语言模型紧密整合与传统浅层融合方法的优劣,探讨了多种优化策略及联合识别技术。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18542 2026-07-08 cs.CR cs.AI cs.CL cs.LG 版本更新 80%

SecureCode: A Production-Grade Multi-Turn Dataset for Training Security-Aware Code Generation Models

SecureCode:用于训练安全意识代码生成模型的生产级多轮数据集

Scott Thornton

专题命中 评测与基准 :LLM(abstract,abstract_cn);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对AI编码助手生成漏洞代码问题,提出SecureCode数据集,涵盖网络应用安全和AI/ML安全领域,有特定对话结构,经质量保证,发布统一数据集、开源模型及评估框架,是首个提供相关覆盖的公共数据集。

Comments 30 pages, 12 figures, 10 tables. Dataset available at https://huggingface.co/datasets/scthornton/securecode. Code and validation tools at https://github.com/scthornton/securecode

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06485 2026-07-08 cs.CV cs.AI 新提交 79%

AirflowAttack: Thermal-Airflow Adversarial Perturbations against Infrared Remote-Sensing Vision-Language Models

AirflowAttack:针对红外遥感视觉语言模型的热气流对抗扰动

Cong Su, Jiaju Han, Xuemeng Sun, Chengyin Hu, Qike Zhang, Jiujiang Guo, Yiwei Wei, Jiahuan Long

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) Tianjin University(天津大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究针对红外遥感视觉语言模型的对抗攻击,提出AirflowAttack方法,用热气流湍流作扰动先验,由轻量级生成器合成扰动。该方法在多个CLIP主干上攻击成功率高,能降低模型场景分类准确率,还揭示了红外VLM生态系统的关键漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05970 2026-07-08 cs.IR cs.AI 新提交 79%

Faithful or Findable? Evaluating LLM-Generated Metadata for RDF Dataset Search

忠实还是可查找?评估用于RDF数据集搜索的大语言模型生成的元数据

Riccardo Terrenzi, Serkan Ayvaz

机构 * University of Southern Denmark(南部丹麦大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究RDF数据集六种元数据生成设置,评估其检索有效性与忠实性。发现无约束重写检索增益强但忠实性低,更有根据的设置提高了忠实性,基于配置文件的重写权衡最佳,将合成元数据定位为需综合评估多方面的系统级信息检索问题。

Comments 5 pages, 1 figure, accepted at SynthIR @ SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06000 2026-07-08 cs.CR 新提交 78%

Context-to-Execution Integrity for LLM Agents

语言模型代理的上下文到执行完整性

Igor Santos-Grueiro

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究语言模型代理执行中的上下文到执行完整性问题,提出CXI系统,通过策略标记、类型化释放等机制保障安全执行,经多方面评估,在AgentDojo和代码代理基准测试等中取得良好效果,确保权限绑定才允许执行。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏