arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1729 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1729 篇

2607.08164 2026-07-14 cs.CV 版本更新 50%

Continual Test-Time Adaptation in Computer Vision: Methods, Benchmarks, and Future Directions

计算机视觉中的持续测试时间适应:方法、基准和未来方向

Sarthak Kumar Maharana, Shambhavi Mishra, Yunbei Zhang, Shuaicheng Niu, Taki Hasan Rafi, Jihun Hamm, Marco Pedersoli, Jose Dolz, Yunhui Guo

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) LIVIA ETS Montreal, ILLS International Laboratory on Learning Systems (ILLS)(蒙特利尔LIVIA ETS,学习系统国际实验室(ILLS)) Tulane University(路易斯安那州立大学) Nanyang Technological University(南洋理工大学) Hanyang University(翰阳大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文针对计算机视觉中训练与测试数据分布不同的问题,定义CTTA问题,分析持续域转移模式,提出分层分类法将现有方法分为三类,回顾代表性方法并展示实验结果,讨论局限性与新兴方向,为持续测试时间适应研究提供路线图。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06000 2026-07-08 cs.CR 新提交 50%

Context-to-Execution Integrity for LLM Agents

语言模型代理的上下文到执行完整性

Igor Santos-Grueiro

专题命中 代码评测 :repository(abstract)

AI总结 研究语言模型代理执行中的上下文到执行完整性问题,提出CXI系统,通过策略标记、类型化释放等机制保障安全执行,经多方面评估,在AgentDojo和代码代理基准测试等中取得良好效果,确保权限绑定才允许执行。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05413 2026-07-08 cs.CY 新提交 50%

Measuring the Invisible: Evaluating the Impact of Public Funding on Open Source Software

衡量无形:评估公共资金对开源软件的影响

Laia Domenech Burin

专题命中 代码评测 :repository(abstract)

AI总结 研究公共资金对开源软件的影响,结合目标-问题-指标框架与广义合成控制法,估计主权科技基金对OSS仓库活动的因果效应,发现资金对项目速度指标有显著正向影响,为公共OSS资金评估框架设计提供实践启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12995 2026-07-08 math.CO cs.DS 版本更新 50%

Extending Exact Integrality Gap Computations for the Metric TSP

扩展度量TSP的子游走松弛整数规划间隙计算

William Cook, Stefan Hougardy, Moritz Petrich

专题命中 代码评测 :repository(abstract)

AI总结 本文通过扩展子游走松弛的整数规划间隙验证,发现n=11和n=12时极端点列表不完整,并将极端点枚举扩展到14个顶点,为4/3猜想提供支持。

Comments We extended the enumeration to n=15 in the general case

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04825 2026-07-07 cs.MA 新提交 50%

Dynamic Airspace Management for UAVs in Evolving Urban Environments: Collaborative Coordination and Human Safety

动态空域管理用于不断演变的城市环境中的无人机:协同协调与人类安全

Lin Sun, Yuhang Wang, Fan Meng Hong, Haopeng Chen, Yan Jiao, Yongming Xu

专题命中 代码评测 :repository(abstract)

AI总结 针对复杂城市环境中无人机安全运行难题,提出协作多无人机空域管理系统Pharos,介于分布式与集中式范式间,采用MAPPO算法,经仿真验证其有效协调能力及在减少人类恐惧、提升空间利用率方面优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00387 2026-07-02 eess.AS 新提交 50%

From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning

从目标到应用:对齐音频自监督学习中的架构偏差

Kele Xu, Yulu Fang, Boda Zhou, Yulin Sun, Qisheng Xu, Qiya Song, Jin Zhang, Cheng Yang, Huaimin Wang

专题命中 代码评测 :repository(abstract)

AI总结 本文通过预训练目标、架构归纳偏差与下游应用的对齐,系统分析音频自监督学习,围绕五种范式讨论不同监督信号对表征的影响,并关联到CNN、RNN、状态空间模型、Transformer及混合架构的偏差,最后解读在语音、环境声、音乐、医学及多模态等领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07685 2026-06-29 cs.CC math.DS 版本更新 50%

Expansive homeomorphisms on complexity quasi-metric spaces

复杂度准度量空间上的扩展同胚

Yaé U. Gaba

专题命中 代码评测 :repository(abstract)

AI总结 本文研究复杂度准度量空间上的扩展同胚理论,证明缩放变换在该空间上扩张当且仅当α≠1,并将轨道分离与经典时间层级定理联系起来。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22868 2026-06-23 eess.AS 新提交 50%

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios

MSU-Bench:面向对话多说话人场景中以说话人为中心的理解

Zhaokai Sun, Shuai Wang, Zhennan Lin, Chengyou Wang, Dehui Gao, Yuang Cao, Chunjiang He, Pan Zhou, Lei Xie

专题命中 代码评测 :repository(abstract)

AI总结 提出MSU-Bench基准,包含16个说话人中心任务和2300个问答实例,用于评估多说话人对话中的说话人定位与推理能力,揭示现有模型在复杂场景下的不足。

Comments 4 pages, accepted by interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15149 2026-06-18 cs.CE cs.NA math.NA 版本更新 50%

SoliDualSPHysics: An extension of DualSPHysics for solid mechanics with hyperelasticity, plasticity, and fracture

SoliDualSPHysics:一种用于固体力学的DualSPHysics扩展,支持超弹性、塑性及断裂

Mohammad Naqib Rahimi, George Moutsanidis

专题命中 代码评测 :repository(abstract)

AI总结 本文提出SoliDualSPHysics,一种基于SPH的开源软件,扩展DualSPHysics以模拟超弹性、有限应变塑性及脆性断裂行为,采用总拉格朗日格式,支持动态加载下的裂纹萌生与扩展,验证了其准确性和可扩展性。

Journal ref Computer Physics Communications 327 (2026) 110257

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16871 2026-06-16 cs.MA 新提交 50%

Human-on-the-Bridge: Scalable Evaluation for AI Agents

Human-on-the-Bridge: 可扩展的AI智能体评估方法

Fouad Bousetouane

专题命中 代码评测 :code generation(abstract)

AI总结 提出Human-on-the-Bridge (HOB)范式,通过专家预先策划可复用的评估智能体(包括领域上下文、红队陷阱、陪审员角色等),结合ProofAgent测试框架进行多轮对抗评估,实现可扩展的AI智能体行为评估。

Comments 33 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09977 2026-06-16 cs.CV 版本更新 50%

A Survey on 3D Gaussian Splatting Applications: Segmentation, Editing, and Generation

3D高斯泼溅应用综述:分割、编辑与生成

Shuting He, Peilin Ji, Yitong Yang, Changshuo Wang, Jiayi Ji, Yinglin Wang, Henghui Ding

机构 * Shanghai University of Finance and Economics(上海财经大学) University College London(伦敦大学学院) Xiamen University(厦门大学) Fudan University(复旦大学)

专题命中 代码评测 :repository(abstract)

AI总结 综述3D高斯泼溅在分割、编辑和生成三大任务中的应用,总结代表性方法、监督策略和学习范式,并分析公共基准上的比较结果。

Comments IEEE TPAMI, GitHub Repo: https://github.com/heshuting555/Awesome-3DGS-Applications

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11563 2026-06-11 cs.CV cs.RO 新提交 50%

Cross-Modal Benchmarking for Robotic Perception in Natural Environments

自然环境中机器人感知的跨模态基准测试

David Hall, Joshua Knights, Mark Cox, Peyman Moghadam

机构 * CSIRO Robotics, CSIRO, Australia(CSIRO机器人研究所,CSIRO,澳大利亚) University of Sydney (USyd), Australia(悉尼大学(USyd),澳大利亚) Queensland University of Technology (QUT), Australia(昆士兰理工大学(QUT),澳大利亚)

专题命中 代码评测 :repository(abstract)

AI总结 针对自然环境中机器人感知的挑战,提出WildCross跨模态基准,用于大规模自然场景下的地点识别和度量深度估计,并扩展了度量深度估计实验。

Comments Accepted to the IEEE ICRA Workshop on Open Challenges for Rigorous Robot Perception 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04661 2026-06-11 astro-ph.CO astro-ph.IM 版本更新 50%

unimpeded: A Public Grid of Nested Sampling Chains for Cosmological Model Comparison and Tension Analysis

unimpeded: 用于宇宙学模型比较和张力分析的公共嵌套采样链网格

Dily Duan Yi Ong, Will Handley

专题命中 代码评测 :repository(abstract)

AI总结 发布公共Python库unimpeded,提供预计算嵌套采样和MCMC链,对8个宇宙学模型和39个数据集进行系统分析,发现ΛCDM模型最受青睐,并量化了DES与Planck、SH0ES与Planck之间的显著张力。

Comments 49 pages, 13 figures. Version 3: Revised in response to the JCAP editor's report. Added Section 3.2.12 on the treatment of nuisance parameters in the evidence and tension calculations. Results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07851 2026-06-09 physics.med-ph 新提交 50%

ULMShare: A Large-Scale In Vivo Ultrasound Localization Microscopy Dataset for Microvascular Imaging

ULMShare:用于微血管成像的大规模体内超声定位显微镜数据集

Brice Rauby, Nin Ghigo, Gerardo Ramos-Palacios, Alexis Leconte, Stephen A. Lee, Alice Wu, Paul Xing, Oleksandra Gulenko, Louis Caron, Antoine Malescot, Eric Martineau, Jonathan Porée, Maxime Gasse, Ravi L. Rungta, Abbas F. Sadikot, Jean Provost

专题命中 代码评测 :repository(abstract)

AI总结 本文介绍ULMShare,一个包含99次全脑经颅超声定位显微镜采集的开放数据集,旨在为微血管成像方法开发、验证和基准测试提供标准化资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.09829 2026-06-04 math.NA cs.NA 50%

An Abaqus UEL implementation of the smoothed finite element method

Abaqus中基于单元的平滑有限元方法的UEL实现

Pramod Y Kumbhar, Amrita Francis, Narasimhan Swaminathan, Ratna Kumar Annabattula, Sundararajan Natarajan

专题命中 代码评测 :repository(abstract)

AI总结 本文讨论了在商业有限元软件Abaqus中实现基于单元的平滑有限元方法(CSFEM)的方法。CSFEM的特点是不需要显式导出形状函数的导数,也不需要等参数映射。通过使用软件的用户元素子程序(UEL)功能实现了该方法。给出了输入数据格式的细节以及所提出的用户元素子程序,这是有限元分析的核心。通过解决线性弹性静力学问题的二维和三维基准问题来验证所提出的实现。开发的UEL和相关的输入文件可以从GitHub仓库下载:https://github.com/nsundar/SFEM_in_Abaqus。

Journal ref International Journal of Computational Methods, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.04666 2026-06-04 math.NA cs.NA physics.comp-ph 50%

Taylor-Duffy Method for Singular Tetrahedron-Product Integrals: Efficient Evaluation of Galerkin Integrals for VIE Solvers

泰勒-迪菲方法用于奇异四面体积积分:用于离散化体积积分方程(VIE)求解器的加权伽辽金积分的高效评估

M. T. Homer Reid

专题命中 代码评测 :code generation(abstract)

AI总结 本文提出一种高效准确的数值方法,用于计算四面体积域上六维奇异积分,适用于计算离散化体积积分方程求解器的加权伽辽金矩阵元素,通过扩展通用泰勒-迪菲策略,实现将六维奇异积分转化为低维非奇异积分,提升计算效率。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1510.06108 2026-06-04 eess.SY cs.SY 50%

A Counter-Example Guided Framework for Robust Synthesis of Switched Systems Using Control Certificates

一种用于切换系统鲁棒综合的反例引导框架使用控制证书

Hadi Ravanbakhsh, Sriram Sankaranarayanan

专题命中 代码评测 :program synthesis(abstract)

AI总结 本文提出通过生成

Comments The paper has been withdrawn by the author. The main reason is incorrect proof of Theorem 4 and some incorrect results in the evaluation parts due to some bugs in the code

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00873 2026-06-02 cs.CY 50%

Prompts for Public-Sector LLMs Should Be Governed as Commons

公共部门LLM的提示应作为公共资源进行治理

Rashid Mushkani

专题命中 代码评测 :repository(abstract)

AI总结 本文提出公共部门部署大型语言模型时使用的提示应作为受治理的制品,而非私有临时输入,并设计了带版本控制、社区维护的提示模板仓库及协商集成方法。

Comments To appear in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26884 2026-05-27 cs.CV 50%

Small Object Detection in Industrial Recycling: A New Dataset and YOLO Performance Evaluation

工业回收中的小目标检测:新数据集与YOLO性能评估

Oussama Messai, Abbass Zein-Eddine, Abdelouahid Bentamou, Mickael Picq, Nicolas Duquesne, Stéphane Puydarrieux, Yann Gavet

机构 * Mines Saint-Etienne, CNRS, UMR 5307 LGF(圣艾蒂安 Mines、法国国家科学研究中心、UMR 5307 LGF)

专题命中 代码评测 :repository(abstract)

AI总结 针对工业回收中小、密集、重叠目标的检测难题,本文提出新数据集并对比基于深度学习的监督方法,评估YOLO等系统的性能、精度与计算效率,同时探索数据增强与合成图像的优势。

Journal ref Journal of Electronic Imaging 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17287 2026-05-26 cs.CV 50%

LISA: Language-guided Interference-aware Spatial-Frequency Attention for Driver Gaze Estimation

LISA: 语言引导的干扰感知空间-频率注意力用于驾驶员视线估计

Jun Ma, Zhenye Yang, Ruichen Zhou, Pei Zhang, Huan Li, Jinpeng Chen

机构 * School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(北京邮电大学计算机科学学院(国家级试点软件工程学院)) Key Laboratory of Trustworthy Distributed Computing and Service (BUPT), Ministry of Education(教育部可信分布式计算与服务重点实验室(BUPT)) School of Electrical Engineering, Guangxi University(广西大学电气工程学院) Zhejiang University(浙江大学)

专题命中 代码评测 :repository(abstract)

AI总结 提出LISA框架,结合频域先验与视觉语言知识,通过双域融合机制和训练时解耦策略,实现鲁棒的驾驶员视线估计,在遮挡和光照变化下达到最优性能。

Comments 9 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24134 2026-05-26 cs.MA 50%

ProofAgent Harness: Open Infrastructure for Adversarial Evaluation of AI Agents

ProofAgent Harness:用于AI智能体对抗性评估的开放基础设施

Fouad Bousetouane

专题命中 代码评测 :code generation(abstract)

AI总结 提出ProofAgent Harness开放基础设施,通过对抗性多轮试验、轨迹捕获和多评委评分,实现可扩展、可审计的AI智能体对抗性评估。

Comments 48 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19399 2026-05-20 cs.AR 50%

HSCO-Bench: An Agent-Driven End-to-End Hardware-Software Co-design Benchmark for Systems-on-Chip

HSCO-Bench: 一种由智能体驱动的端到端硬件软件协同设计基准,用于片上系统

Pei-Huan Tsai, Kuan-Lin Chiu, William Baisi, Pin-Yu Chen, Luca P. Carloni

专题命中 代码评测 :repository(abstract)

AI总结 本文提出HSCO-Bench,一个用于评估大型语言模型在端到端硬件软件协同设计能力的基准,通过评估LLM在资源约束下生成高效SoC原型的能力,揭示了当前模型在硬件加速方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19328 2026-05-20 cs.CR cs.RO 50%

RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents

RoboJailBench: 对具身体验机器人代理中对抗攻击和防御的基准测试

Doguhuan Yeke, Yanming Zhou, Leo Y. Lin, Hongyu Cai, Antonio Bianchi, Z. Berkay Celik

机构 * Purdue University(普渡大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文提出RoboJailBench,通过建立安全分类学、引入意图对比数据集管道以及提供一个演进的存储库,为具身体验人工智能中的对抗攻击和防御提供了标准化评估框架,同时构建了一个新的分类平衡数据集并增强了五个现有数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16817 2026-05-19 eess.IV cs.CV 50%

Adaptive Fused Prior Transfer for Controllable Generative Image Compression

自适应融合先验传输用于可控生成图像压缩

Yifei Pei, Ying Liu, Nam Ling

机构 * Department of Computer Science and Engineering, Santa Clara University(计算机科学与工程系,圣克拉拉大学)

专题命中 代码评测 :code model(abstract)

AI总结 本文提出了一种可控生成图像压缩方法AFP-GIC,通过自适应融合先验传输实现解码端的高质量重建,减少了延迟并降低了参数数量,同时在低比特率下提升了视觉质量。

Comments 19 pages, 10 figures. This work has been submitted to IEEE Access for possible publication. Code is available at https://github.com/yifeipet/AFP_GIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14651 2026-05-15 cs.CV 50%

TERRA-CD: Multi-Temporal Framework for Multi-class and Semantic Change Detection

TERRA-CD:多时相框架用于多类和语义变化检测

Omkar Oak, Rukmini Nazre, Rujuta Budke, Suraj Sawant

机构 * COEP Technological University, Pune, India(科帕尔技术大学,印度普纳) University of Massachusetts, Amherst, USA(马萨诸塞大学,美国阿姆赫斯特) North Carolina State University, USA(北卡罗来纳州立大学,美国)

专题命中 代码评测 :repository(abstract)

AI总结 本文提出TERRA-CD数据集,包含2019和2024年的Sentinel-2影像对,用于多类和语义变化检测,采用多种深度学习方法评估其有效性。

Comments Paper presented at 11th International Congress on Information and Communication Technology (ICICT) 2026, London

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18326 2026-05-15 cs.CV 50%

Enhancing Few-Shot Classification of Benchmark and Disaster Imagery with ABHFA-Net

通过ABHFA-Net增强基准和灾害图像的少样本分类

Gao Yu Lee, Tanmoy Dam, Md Meftahul Ferdaus, Daniel Puiu Poenar, Vu Duong

机构 * School of Mechanical and Aerospace Engineering (MAE), NTU(南洋理工大学机械与航空航天工程学院) Department of Computer Science, The University of New Orleans(新奥尔良大学计算机科学系)

专题命中 代码评测 :repository(abstract)

AI总结 本文提出ABHFA-Net,通过空间通道注意力机制和基于Bhattacharyya距离的对比softmax损失,提升少样本灾害图像分类性能,在基准和真实灾害数据集上均取得优异效果。

Comments Revised and Submitted to SN Computer journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03061 2026-05-13 cs.CV 50%

Can Nano Banana 2 Replace Traditional Image Restoration Models? An Evaluation of Its Performance on Image Restoration Tasks

Nano Banana 2能否替代传统图像修复模型?对其在图像修复任务上的性能评估

Weixiong Sun, Xiang Yin, Chao Dong

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Fudan University(复旦大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)

专题命中 代码评测 :repository(abstract)

AI总结 本文评估了Nano Banana 2在图像修复任务中的性能,发现提示设计至关重要,简洁提示和显式保真约束能平衡重建与感知质量。模型在全参考性能上表现竞争,用户研究中表现优异,但在感知质量与修复保真度之间存在差距,需改进可控性与保真度评估。

Comments Accepted by CVPR 2026 Workshop AAVM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09473 2026-05-12 cs.NI 50%

PolicyCache-SDN: Hierarchical Intra-Path Learning for Adaptive SDN Traffic Control

PolicyCache-SDN:分层路径内学习用于自适应SDN流量控制

Wenyang Jia, Jingjing Wang, Ziwei Yan, Tanren Liu, Yakun Ren, Kai Lei

专题命中 代码评测 :repository(abstract)

AI总结 PolicyCache-SDN通过分层路径内学习实现自适应SDN流量控制,提升核心链路利用率并降低网络延迟和SLA违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04425 2026-05-12 cs.NI cs.SY eess.IV eess.SY 50%

TeleSim: A Network-Aware Testbed and Benchmark Dataset for Telerobotic Applications

TeleSim: 一种网络感知的测试床和基准数据集用于远程机器人应用

Zexin Deng, Zhenhui Yuan, Longhao Zou

专题命中 代码评测 :repository(abstract)

AI总结 TeleSim通过模拟不同网络条件下的远程机器人任务,提供了一种网络感知的测试床和基准数据集,用于评估远程机器人系统在异构网络环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15744 2026-05-11 cs.AR cs.PF 50%

Cleaning up the Mess: Re-Evaluating the Real-System Modeling Accuracy of Ramulator 2.0

清理混乱:重新评估Ramulator 2.0真实系统建模精度

F. Nisa Bostanci, Haocong Luo, Ataberk Olgun, Maria Makeenkova, Geraldo F. Oliveira, A. Giray Yaglikci, Onur Mutlu

专题命中 代码评测 :repository(abstract)

AI总结 本文指出Mess论文存在技术配置错误、方法论问题及不完整的工具包,导致Ramulator 2.0和DAMOV的模拟结果不可复现,纠正了其对真实系统性能的错误结论。

Comments Extended version of our publication at IEEE International Symposium on Performance Analysis of Systems and Software (ISPASS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏