arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-21 至 2026-07-21 共收录 490 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 110 篇

2607.18027 2026-07-21 cs.LG cs.CL 新提交 62%

L1 Augmented Attention as an Improved Vector Similarity Metric

L1增强注意力作为一种改进的向量相似性度量

Kurt Godden

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对缩放点积注意力在Transformer模型中作为相似性度量的局限,提出L1增强注意力方法,通过减去特定头的L1距离改进相似性计算,经实验在WikiText 2上取得更好效果,揭示了各层几何作用及头级专业化,有效提升语言模型相似性计算。

Comments 16 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17962 2026-07-21 cs.LG cs.AI stat.ML 新提交 62%

Topological Signatures of Context-Level Reliability in TabPFN

TabPFN中上下文级可靠性的拓扑特征

James Hu, Mahdi Ghelichi

机构 * TD Bank(道明银行)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究TabPFN在复杂表格几何上的内部行为,用曲折持久同调将其层表示视为点云,构建合成表格任务基准。发现其内部表示几何拓扑与数据集级可靠性相关,复杂几何有双重拓扑特征,相关描述符与多种指标有关,能诊断可靠性及运行状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16848 2026-07-21 cs.LG cs.AI 新提交 62%

Beyond Memory Leaderboards: Evaluating Scientific Memory as Budgeted Context Restoration

超越内存排行榜:将科学记忆评估为预算上下文恢复

Maksim Sheverev, David Finkelstein, Sergey Nikolenko

机构 * Quantellence Research(Quantellence研究公司) St. Petersburg Department of the Steklov Institute of Mathematics(斯捷克洛夫数学研究所圣彼得堡分部) St. Petersburg State University(圣彼得堡国立大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究提出两个全文科学记忆基准测试PAIM和PTr,评估八个内存/检索系统,发现内存排行榜受多种因素影响,如摄取粒度等。结果显示不同系统表现因条件而异,还表明大语言模型评判排名与人工一致,应将科学记忆评估为预算上下文恢复并开源相关资源。

Comments 40 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15879 2026-07-21 cs.CL cs.AI cs.CY 版本更新 62%

DECODEM: Data Extraction from Corporate Organizational Documents via Enhanced Methods

DECODEM:通过增强方法从公司组织文档中提取数据

Jens Frankenreiter

机构 * Washington University in St. Louis School of Law(圣路易斯华盛顿大学法学院)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在通过增强方法从公司组织文档提取数据,介绍DECODEM基准数据集,评估多种大语言模型提取管道,结果显示自动提取可行且性能因变量而异,标准化基准和评估证明前沿模型能高精度提取信息,凸显自动特征提取作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13518 2026-07-21 stat.ML cs.AI cs.LG 版本更新 62%

Data Balancing Strategies: A Systematic Survey of Resampling and Augmentation Methods

数据平衡策略:重采样与增强方法的系统综述

Behnam Yousefimehr, Mehdi Ghatee, Javad Fazli, Shervin Ghaffari, Zahra Rafei, Mohammad Amin Seifi, Sajed Tavakoli, Abolfazl Nikahd, Mahdi Razi Gandomani, Alireza Orouji, Ramtin Mahmoudi Kashani, Sarina Heshmati, Negin Sadat Mousavi

机构 * Department of Mathematics and Computer Science(数学与计算机科学系) Amirkabir University of Technology (Tehran Polytechnic)(阿美尔卡比大学(德黑兰理工大学)) Iran(伊朗)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文系统回顾了数据平衡方法,涵盖重采样、增强、欠采样及混合策略,分析其适用场景与优劣,指出无一方法普适,需根据数据特征和模型选择优化。

Comments 81 pages, 4 figures, 25 tables

Journal ref Machine Learning and Knowledge Extraction, 2026, 8(7), 211; https://www.mdpi.com/2504-4990/8/7/211

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02454 2026-07-21 cs.SE cs.AI 57%

Causal Software Engineering: A Vision and Roadmap

因果软件工程:愿景与路线图

Roberto Pietrantuono, Luca Giamattei, Stefano Russo, Julien Siebert, Neil Walkinshaw

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究软件工程在不确定性下决策的关键问题,提出因果软件工程范式,通过因果模型和推理为软件生命周期活动提供信息,还给出工作流程视图、路线图及评估议程。

Comments Accepted at FSE 2026 - Ideas, Visions and Reflections (IVR) Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17812 2026-07-21 cs.CL 新提交 57%

ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions

ESCUCHA:用于异构声学条件的西班牙语语音基准测试

Fernando López, Ana Ayala, Guillermo Segovia, Fernando Ibáñez, Ana Martínez, Pablo Gómez, Jordi Luque

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 针对现实声学条件下西班牙语语音理解受关注少的问题,引入ESCUCHA基准测试,含1000个人工挑选与音频配对的问题,强调推理与语言多样性,涵盖多类问题,测试发现先进模型与人类存在性能差距。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17766 2026-07-21 cs.CL 新提交 57%

When to Use Extra Context: Evidence-Grounded Terminology Adaptation for Simultaneous Speech Translation

何时使用额外上下文:基于证据的术语适应在同步语音翻译中的应用

Zeyu Yang, Satoshi Nakamura

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 研究同步语音翻译中额外上下文的使用,提出基于证据的术语适应框架EGTA,通过构建术语记忆、选择候选术语来调整决策空间,无需全模型微调,在多个指标上有提升,改进与特定论文证据对齐有关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17627 2026-07-21 cs.HC cs.CL 新提交 57%

It Matters How You Say It: Exploring Rhetorical Patterns for AI-Assisted Information Evaluation

表达方式很重要:探索用于人工智能辅助信息评估的修辞模式

Sadra Sabouri, Zeinabsadat Saghi, Jordan Lee Boyd-Graber, Jonathan May, Jonathan K. Kummerfeld, Souti Chattopadhyay

机构 * Department of Computer Science, University of Southern California(计算机科学系,南加州大学) Department of Computer Science, University of Maryland(计算机科学系,马里兰大学) Information Sciences Institute, University of Southern California(信息科学研究所,南加州大学) School of Computer Science, University of Sydney(计算机科学学院,悉尼大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 研究人工智能辅助信息评估中修辞模式,通过主体内研究考察八种修辞模式,发现支架式解释与最高准确率提升相关,对抗条件也能适度提高准确率,还探讨了设计不同修辞风格对话代理的意义及相关权衡。

Comments 13 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17250 2026-07-21 cs.CL 新提交 57%

EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

EvolvingWorld:用于交互式文学世界中角色与世界模型协同进化的开放架构框架

Qing Zong, Yue Guo, Mengxin Yang, Yiwen Guo, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) LIGHTSPEED(光速) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究交互式文学世界中角色与世界协同进化问题,提出EvolvingWorld框架,含角色智能体和世界模型两个耦合模块,制定7个可训练任务,构建数据集并引入评估协议,实验证明其能有效改进长期模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17099 2026-07-21 cs.CV cs.AI 新提交 57%

DepthART: Scaling Foundation Monocular Depth to Tiny Models

DepthART:将基础单目深度模型扩展到小型模型

Feng Xue, Wu Chen, Mingshuai Zhao, Guofeng Zhong, Anlong Ming, Haozhe Wang, Dianqiao Lei, Zhaowen Lin, Haiyang Zhang, Nicu Sebe

机构 * University of Trento(特伦托大学) Beijing University of Posts and Telecommunications(北京邮电大学) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 研究旨在将基础单目深度模型扩展到小型模型,核心方法是结合抗偏差数据采样与相机条件微调策略的DepthART,主要贡献是在多数据集上取得更好的零样本泛化和度量精度,还提供了可扩展模型家族。

Comments Accepted in ACM Multimedia 2026 ; Code: https://github.com/xuefeng-cvr/DepthART ; Project page: https://xuefeng-cvr.github.io/DepthART ;

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17050 2026-07-21 cs.CV cs.AI 新提交 57%

EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding

EvoGUI:用于GUI状态转换理解的进化感知基准测试

Yaohan Yang, Minglei Shi, Borui Zhang, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究GUI状态转换理解,提出EvoGUI诊断框架,将GUI轨迹转化为视觉问答探针,无需额外注释。通过Mind2Web和WebLINX实例化EvoGUI-Bench并零样本评估28种模型配置,结果显示其可补充端到端评估,揭示理解提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17037 2026-07-21 cs.LG cs.CE 新提交 57%

Apeliotes: A Diffusion-Based Modeling Framework for km-scale Multi-Level Atmospheric Fields

Apeliotes:一种用于千米尺度多层大气场的基于扩散的建模框架

Evangelia Rafaela Frastali, Achyut Paudel, Maryam Golbazi, Frank Liu

机构 * Old Dominion University(奥多明尼昂大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 针对高分辨率大气数据受限问题,Apeliotes框架基于全球再分析等数据构建,能提供千米尺度天气变量和多层大气场,经评估性能极具竞争力,预测垂直风廓线等有高精度表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16610 2026-07-21 cs.AI 新提交 57%

Just A Rather Very Intelligent Spoken Agent

只是一个相当非常智能的语音代理

Chen Chen, Zhehuai Chen

机构 * NVIDIA(英伟达)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究长期人工智能代理与用户交互薄弱问题,引入JarvisBench基准测试,含代理协作和用户交互两轨道,用模块化原型评估,结果显示贾维斯式调解可提升任务性能,其有效性取决于调解器语言模型大脑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16582 2026-07-21 cs.RO cs.AI cs.CV 新提交 57%

Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings

基于自主虚拟现实的危险环境态势感知风险检测

Mohammad Eskandari, Murali Krishna Varma Indukuri, Stephanie M. Lukin, Cynthia Matuszek

机构 * Interactive Robotics and Language Lab, University of Maryland Baltimore County(马里兰大学巴尔的摩县分校交互式机器人与语言实验室) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究在高风险环境中,提出基于VR的人机交互框架,利用VLM辅助机器人识别潜在危险并标注兴趣点,通过VR界面呈现给操作员,经实验验证该方法能有效支持态势感知,提升交互体验。

Comments 7 Pages, Accepted to RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16564 2026-07-21 cs.SE cs.AI 新提交 57%

ReqGenX: An Empirical Study of Atomic Decomposition, Artifact Regeneration, and Reconstruction for Legacy SRS Documents

ReqGenX:对遗留SRS文档的原子分解、工件再生和重建的实证研究

Ragib Shahariar Ayon, Rayed Fahmi, Sumon Biswas, Shibbir Ahmed

机构 * Texas State University(德克萨斯州立大学) Case Western Reserve University(凯斯西储大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究旨在将遗留SRS文档转化为可追溯工件,以细粒度评估基于大语言模型的SRS生成。方法是用ReqGenX进行实证研究,包括分解、投票、生成工件等步骤。结果表明该方法有效,能支持评估并揭示相关权衡。

Comments Accepted at the International Symposium on Empirical Software Engineering and Measurement (ESEM) technical papers (main) track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16311 2026-07-21 cs.CV cs.AI 新提交 57%

Seeing What Is Actually There: PriVE-Bench and PriVE-Tools for Counterfactual Evaluation of Agentic Visual Evidence in VLMs

看清实际存在的东西:用于在视觉语言模型中对代理视觉证据进行反事实评估的PriVE-Bench和PriVE-Tools

Jingyu Sun, Jiachen Tu, Yuyang Xue, Yaoxin Jiang, Guoyi Xu, Zhengtao Yao, Rui Qian, Yizheng Sun, Hongpeng Zhou, Jingyuan Sun, Yan Lin

机构 * The University of Manchester(曼彻斯特大学) The University of Melbourne(墨尔本大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Edinburgh(爱丁堡大学) University of Southern California(南加州大学) Fudan University(复旦大学) University of Newcastle(纽卡斯尔大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文针对视觉语言模型常依先验而非图像回答问题的现象,引入PriVE-Bench和PriVE-Tools。通过配对图像及工具衍生证据评估模型,对比不同输入,发现视觉证据工具在特定情况有帮助,但不能解决所有模型依先验回答的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14592 2026-07-21 cs.RO cs.AI 版本更新 57%

DSBench: A Comprehensive Benchmark for Evaluating External and In-Cabin Risks

DSBench:用于评估外部和车内风险的综合基准测试

Xianhui Meng, Yuchen Zhang, Zhijian Huang, Zheng Lu, Ziling Ji, Yandan Lin, Yaoyao Yin, Hongyuan Zhang, Wei Zhou, Guangfeng Jiang, Li Zhang, Long Chen, Hangjun Ye, Jun Liu, Xiaoshuai Hao

机构 * University of Science and Technology of China(中国科学技术大学) Georgia Institute of Technology(佐治亚理工学院) Xiaomi EV(小米电动车) Fudan University(复旦大学) Xidian University(西安电子科技大学) South China University of Technology(华南理工大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对视觉语言模型在安全关键场景适用性未充分探索的问题,引入DSBench综合基准测试,涵盖外部与车内风险,分多类别。评估发现模型在复杂情况下降,构建数据集微调可提升性能,推动自动驾驶技术发展,相关资源将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16604 2026-07-21 eess.IV 新提交 50%

When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering

多模态和图增强的检索增强生成(RAG)何时有用?文档问答的对照评估

Sokipriala Jonah

专题命中 评测与基准 :LLM(abstract)

AI总结 研究文档问答中多模态和图增强RAG的作用,提出用多模态图-RAG架构,通过独立检索并融合文本、图和视觉证据源来评估效果。经实验发现其价值取决于多种因素,如检索设计等,还揭示了一些相关问题,如图像检索及生成器效率对结果的影响。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18014 2026-07-21 cs.CV 新提交 50%

SAMRI-3D: Adapting SAM2 for 3D MRI Segmentation with Global Volume Tokens

SAMRI-3D:通过全局体积令牌将SAM2应用于3D MRI分割

Zhao Wang, Wei Dai, Hongfu Sun, Craig Engstrom, Shekhar S. Chandra

机构 * School of Electrical Engineering and Computer Science, The University of Queensland(电气工程与计算机科学学院,昆士兰大学) School of Engineering, College of Engineering, Science and Environment, University of Newcastle(工程学院,工程、科学与环境学院,纽卡斯尔大学) School of Human Movement and Nutrition Sciences, The University of Queensland(人类运动与营养科学学院,昆士兰大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对MRI低软组织对比度导致边界难观察的问题,提出SAMRI-3D方法,通过冻结图像编码器、微调解码器和内存模块,并引入全局体积令牌,在3D MRI分割上取得高精度,提升了基于SAM的医学模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17938 2026-07-21 cs.CV 新提交 50%

MuViSeg: Multi-View Segment Correspondences from Dense Geometry Priors

MuViSeg:基于密集几何先验的多视图段对应

Denis Fatykhoph, Timur Akhtyamov, Konstantin Pakulev, German Devchich, Gonzalo Ferrer

机构 * Applied AI Institute(应用人工智能研究所)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对经典图像对应与对象级推理的差距,基于段级匹配范式提出三个学习匹配头,包括LightGlue风格注意力头、DPT风格多尺度融合模块及多视图扩展,在多个数据集和任务中取得显著性能提升。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17722 2026-07-21 cs.SE 新提交 50%

KernelDiag: Agent-Based Root Cause Diagnosis for Kernel Crashes

KernelDiag:基于代理的内核崩溃根本原因诊断

Weijing Wang, Zan Wang, Dong Wang, Haichi Wang, Junjie Chen

专题命中 评测与基准 :LLM(abstract)

AI总结 针对Linux内核崩溃根本原因诊断难的问题,提出KernelDiag框架,通过日志到代码映射及专门代理进行结构化因果推理,在KGYM基准测试中表现出色,优于现有方法,为自动内核根本原因诊断奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17454 2026-07-21 cs.RO 新提交 50%

Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation

通过零样本几何评估实现世界行动模型的测试时缩放

Zesen Zhao, Minkyoung Cho, Hui shen, Boyuan Zheng, Kunxiao Gao, Yulong Cao, Z. Morley Mao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对世界行动模型,提出无需训练的选择性测试时缩放框架\methodgated,基于预测未来的跨视图深度重投影一致性排序,经实验验证该方法能提高任务成功率,同时减少额外采样决策点,还识别出相关失败模式。

Comments Extened version of CVPR 2026 EAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17138 2026-07-21 cs.CV 新提交 50%

Denoising Models Develop Human-Like Perceptual Illusion Representations Across Architectures

去噪模型在不同架构中开发出类似人类的感知错觉表示

Gautam Ranka, Paras Chopra

机构 * Lossfunk

专题命中 评测与基准 :language model(abstract)

AI总结 研究探讨自然图像训练的深度神经网络在亮度错觉输出与人类一致,发现去噪模型在特定内部层有错觉敏感表示,确定相关层和通道,表明去噪目标更关键,虽激活跟踪人类感知模型,但注入表示无像素偏移,此为去噪视觉模型感知表示的首次此类特征描述。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17097 2026-07-21 cs.CV 新提交 50%

HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis

HarmoHOI:用于多视图手-物体交互合成的外观与3D运动协调

Lingwei Dang, Juntong Li, Zonghan Li, Hongwen Zhang, Liang An, Wei Min, Yebin Liu, Qingyao Wu

机构 * South China University of Technology(华南理工大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) Shadow AI(影谱科技)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对多视图手-物体交互合成难题,提出HarmoHOI统一扩散框架,用多视图扩散Transformer混合模型联合建模视频与点轨迹,结合全局运动对齐扩散确保一致性,采用混合数据学习策略,实现多视图HOI高质量合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16540 2026-07-21 cs.CV 新提交 50%

Do Vision Encoders Exhibit Human-like Color Thresholds?

视觉编码器是否表现出类人的颜色阈值?

Engy Ehab, Pablo Hernández-Cámara, Nahla Belal, Jesús Malo, Javier Vazquez-Corral, Alexandra Gomez-Villa

机构 * Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学) Image Processing Lab, Universitat de València(瓦伦西亚大学图像处理实验室) Arab Academy for Science, Technology, and Maritime Transport(阿拉伯科学、技术和海运学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究探索50多个预训练视觉编码器的色度敏感性,将其与人类辨别阈值比较,发现模型表示与人类感知阈值对齐弱,自监督编码器优于监督的,语言监督模型两极分化,表明当前训练目标不会自然产生类人色度敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14830 2026-07-21 cs.SE 版本更新 50%

AI Prototyper: A Figma Plugin for Decomposition-Based GUI Prototyping with LLMs

AI原型制作器:一个用于基于分解的GUI原型制作的Figma插件

Tawatchai Salangsingha, Ashkan Sami, Md Zia Ullah, Iain McGregor

专题命中 评测与基准 :LLM(abstract)

AI总结 研究针对GUI原型制作耗时问题,提出AI Prototyper插件,通过分解和检索增强生成管道,结合特定技术栈与大语言模型,经人工参与编辑步骤,能多语言输入,在时间和质量维度上表现良好。

Comments Accepted at the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), Tool Demonstration and Data Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12428 2026-07-21 cs.CR 版本更新 50%

Trust but Verify? Uncovering the Security Debt of Autonomous Coding Agents

信任但要验证?揭示自主编码代理的安全债务

A H M Nazmus Sakib, Dipayan Banik, Murtuza Jadliwala

专题命中 评测与基准 :LLM(abstract)

AI总结 本文利用AIDev数据集,通过大语言模型评判框架和人工分析,研究自主编码代理生成拉取请求中的安全代码异味。发现38.9%的请求含安全异味,供应链问题和硬编码凭证占比高,揭示了安全风险及开发者警惕性降低问题,强调需实施上下文感知安全护栏。

Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09249 2026-07-21 cs.CV 版本更新 50%

DECIS: Dual-Evidence Corrective Verification for Interpretable Strabismus Diagnostic Decision-Making

MAGIS:基于证据的多智能体推理用于可解释的斜视临床决策

Xikai Tang, Yifan Wang, Jiafan Zhuang, Li Luo, Jinming Guo, Xiaoling Xie, Jiacheng Liu, Peiwei Wei, Lihao Zhong, Xiaoli Kang, Jie Cen, Guangqiang Yin, Kunliang Qiu, Ce Zheng, Zhun Fan

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院) Joint Shantou International Eye Center of Shantou University and The Chinese University of Hong Kong(汕头大学·香港中文大学联合汕头国际眼科中心) School of Artificial Intelligence, Guangzhou City Polytechnic(广州城市职业学院人工智能学院) Medical College, Shantou University(汕头大学医学院) College of Engineering, Shantou University(汕头大学工学院) Department of Ophthalmology, Xinhua Hospital Affiliated to Shanghai Jiaotong University School of Medicine(上海交通大学医学院附属新华医院眼科) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :language model(abstract)

AI总结 提出MAGIS框架,通过多智能体协作、双重证据约束上下文和基于证据的纠正验证机制,将斜视诊断从黑箱生成转变为结构化推理,在细粒度斜视基准上将加权F1分数从72.0%提升至91.3%,并显著提高诊断报告的临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02002 2026-07-21 cs.CV 版本更新 50%

Parameter-Efficient Adaptation of a Multi-Stream Vision-Language Framework for Blind Image Quality Assessment

面向盲图像质量评估的统计与视觉-语言特征的失真感知融合

Bishr Omer Adam, Xu Li

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出一种失真感知融合框架,通过乘法门控机制动态加权NSS统计特征与VLM嵌入,在三个基准上取得最优或竞争性能,并揭示NSS对不同失真的贡献差异。

详情

展开后加载摘要…

URL PDF HTML 收藏