PITMuS: A Tool for Automated Bug Dataset Generation via Source-Level Mutant Reconstruction
PITMuS: 通过源级变异体重建实现自动化bug数据集生成工具
专题命中 评测与基准 :LLM(abstract)
AI总结 本文提出PITMuS工具,通过源级变异体重建生成自动化bug数据集,解决现有工具生成的变异体难以复现和利用的问题,为bug定位和修复技术提供结构化数据支持。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
PITMuS: 通过源级变异体重建实现自动化bug数据集生成工具
专题命中 评测与基准 :LLM(abstract)
AI总结 本文提出PITMuS工具,通过源级变异体重建生成自动化bug数据集,解决现有工具生成的变异体难以复现和利用的问题,为bug定位和修复技术提供结构化数据支持。
模型上下文协议(MCP)软件中的真实故障:一种全面的分类
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文首次提出MCP服务器故障的分类,通过实证研究识别出五个高层故障类别,揭示MCP特定故障与非MCP故障的区别,为提升AI软件系统的可靠性提供依据。
Comments Revised version following peer review. Expanded methodological details, practitioner-survey validation, statistical analyses, and discussion; main conclusions unchanged
QuASH:使用自然语言启发式方法查询视觉语言机器人地图
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出QuASH方法,利用自然语言启发式处理查询相关的语言空间,训练分类器划分环境,提升地图和图像的可查询性,该方法与表示及编码器无关且训练量有限。
Comments ICRA 2026
面向距离的软提示学习用于多模态愉悦-唤醒估计
机构 * Graduate School of Automobile and Mobility(汽车与移动研究生院) ; Department of Automobile and IT Convergence(汽车与IT融合系)
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出一种多模态框架,通过引入距离感知的软提示学习,提升多模态愉悦-唤醒估计的精度,在无约束场景中取得良好效果。
Comments 8pages
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026, pp. 5294-5301
Qwen-Audio-3.0-Gen-Preview 技术报告
专题命中 评测与基准 :language model(abstract)
AI总结 针对现有音频系统难以组织多类型音频形成长时场景的问题,提出 Qwen-Audio-3.0-Gen-Preview 框架,采用 DiT 与共享 VAE 实现统一多域音频生成,在多个基准上展现出性能优势。
EgoSafe:用于视觉安全理解的第一人称移动采集基准
机构 * South China University of Technology(华南理工大学) ; Beihang University(北京航空航天大学)
专题命中 评测与基准 :language model(abstract)
AI总结 该研究推出第一人称移动采集的视觉安全理解基准 EgoSafe-Bench,含12000个样本,用分层推理评估(HRE)协议测试,发现现有大视觉语言模型存在感知-推理解耦问题,为逻辑鲁棒视频理解系统提供评估框架
大规模低成本的 GitHub 毒性人工参与调查
专题命中 评测与基准 :LLM(abstract)
AI总结 研究 GitHub 毒性标注问题,提出人工参与注释方法,通过小型本地语言模型预测及随机森林验证器筛选,降低标注成本,应用此流程处理大量对话,评估先前研究发现并给出新见解。
Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)
PoseMaster: 一个统一的3D原生框架用于风格化姿态生成
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Tencent Hunyuan(腾讯文脉)
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文提出PoseMaster框架,通过统一姿态风格化与3D生成,提升3D姿态风格化的精度和多样性,采用3D骨架直接指导生成,增强模型在姿态风格化中的表现。
Comments Accepted by CVPR 2026, Code: https://github.com/hanryyan/PoseMaster
MetaRank: 为模型可迁移性估计的任务感知度量选择
机构 * Fudan University(复旦大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 评测与基准 :language model(abstract)
AI总结 MetaRank通过元学习框架实现任务感知的MTE度量选择,提升模型迁移性估计的准确性。
Comments 5 figures
LabRobFail:化学自动驾驶实验室中机器人故障分析的基准
专题命中 评测与基准 :language model(abstract)
AI总结 针对化学自动驾驶实验室中机器人可靠性受化学实验特性限制、故障数据稀缺及评估协议缺乏等问题,引入LabRobFail框架,通过注入故障构建数据集,开发专门模型,提升故障检测等能力及下游任务成功率。
Comments Under review. Haobo Wang and Baoli Sun contributed equally. Code and data: https://github.com/Su-ISE-2001/SciRobo
大型大学中生成式人工智能的可用性、成绩与学生满意度
专题命中 评测与基准 :LLM(abstract)
AI总结 研究大型大学中GenAI对学生成绩和满意度的影响,通过教学大纲和行政数据,用差异中的差异设计及人工验证的大语言模型管道衡量课程GenAI易感性,发现GenAI对成绩和自我报告理解无显著差异影响,仅在特定假设下对兴趣有显著影响,缓解相关担忧。
ReSAGE-PAR:行人属性识别中生成式扩展的表征相似性评估
机构 * Universidad Autónoma de Madrid(阿隆托纳大学马德里分校)
专题命中 评测与基准 :prompting(abstract)
AI总结 针对行人属性识别数据稀缺问题,提出ReSAGE-PAR管道,通过扩散模型生成图像并利用贝叶斯分类器验证属性,实现可扩展的高保真数据集扩展,在标准骨干网络上提升高达8.7%。
通过语义长期跟踪实现手术视频的分割:SAM2S
机构 * National University of Singapore(新加坡国立大学) ; University of Sheffield(谢菲尔德大学)
专题命中 评测与基准 :foundation model(abstract)
AI总结 SAM2S通过语义长期跟踪提升手术视频分割性能,实现更准确的零样本泛化和实时推理
Comments 19 pages, 7 figures, 11 tables
HyperImageNet:一个用于细粒度高光谱土地覆盖理解的大规模基准
专题命中 评测与基准 :foundation model(abstract)
AI总结 介绍用于细粒度高光谱土地覆盖理解的HyperImageNet基准,含原始图像等数据,支持语义和实例分割,建立开放环境基准评估方法和模型,实验证明其在相关研究中的有效性。
用于校园垃圾检测的合成与派生训练图像:基于YOLOv8n的多种子评估
机构 * University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校)
专题命中 评测与基准 :pretraining(abstract)
AI总结 研究校园垃圾检测中合成与派生图像对YOLOv8n检测器的作用,通过多种子实验设置不同联合训练配置,对比不同图像来源及处理方式下的检测效果,发现各配置未超真实图像基线,测试集小难得出特定类别有力结论。
AgenticNav:零样本视觉与语言导航作为工具调用框架
机构 * Shanghai Jiao Tong University(上海交通大学) ; Huawei Technologies Ltd(华为技术有限公司)
专题命中 评测与基准 :language model(abstract)
AI总结 提出AgenticNav,通过将动作、深度和记忆作为可调用工具暴露给VLM,实现零样本连续环境导航,在R2R-CE基准上达到SOTA性能。
基于视网膜图像的青光眼筛查:面向视网膜知识的动态多级特征整合
机构 * State Key Laboratory of Ophthalmology, Zhongshan Ophthalmic Center, Sun Yat-sen University, Guangdong Provincial Key Laboratory of Ophthalmology and Vision Science, Guangdong Provincial Clinical Research Center for Ocular Diseases(眼科学国家重点实验室、中山眼科中心、中山大学、广东省眼科学重点实验室和视觉科学、广东省眼科临床研究中心) ; Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) ; Hainan International College, Minzu University of China(海南国际学院,中国民族大学) ; School of Information Technology, Faculty of Business and Hospitality, Torrens University Australia(澳大利亚托伦斯大学信息科技学院,商业与酒店管理学院) ; AIM for Health Lab, Faculty of IT, Monash University, Australia(健康AIM实验室,墨尔本大学IT学院,澳大利亚) ; Department of Ophthalmology, Guangzhou First People’s Hospital, the Second Affiliated Hospital of South China University of Technology(广州第一人民医院,华南理工大学第二附属医院) ; The Third Xiangya Hospital of Central South University(中南大学湘雅医学院第三医院)
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文提出基于视网膜知识的动态多级特征整合框架,通过动态窗口机制和知识增强卷积注意力模块提升青光眼筛查的鲁棒性,实验表明其在AIROGS数据集上达到98.5%的AUC和94.6%的准确率。
Comments 15 pages. Published in Knowledge-based System
OccTrack360: 从环视鱼眼相机实现4D全景占用跟踪
机构 * School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) ; State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(极端光子学与仪器国家重点实验室,浙江大学) ; National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学)
专题命中 评测与基准 :SLM(abstract_cn)
AI总结 OccTrack360提出新的4D全景占用跟踪基准及FoSOcc框架,解决鱼眼成像中的球面投影和体素定位问题,提升占用跟踪性能。
Comments Accepted to IEEE/RSJ IROS 2026. The benchmark and source code will be made publicly available at https://github.com/YouthZest-Lin/OccTrack360
OpenNavMap: 无需结构的拓扑制图通过大规模协作定位
机构 * Robot Perception and Learning Lab, Intelligent Robotics, Department of Computer Science, University College London(机器人感知与学习实验室,智能机器人,计算机科学系,伦敦大学学院) ; Department of Computer Science and Engineering, Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) ; Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) ; Institute of Robotics and Automatic Information System, Nankai University(机器人与自动信息系统研究所,南开大学) ; College of control science and engineering, Zhejiang University(控制科学与工程学院,浙江大学) ; AI Centre, Department of Computer Science, University College London(人工智能中心,计算机科学系,伦敦大学学院)
专题命中 评测与基准 :foundation model(abstract)
AI总结 OpenNavMap通过大规模协作定位实现无需结构的拓扑制图,利用3D几何模型进行按需重建,实现高精度的子图对齐和全局一致性。
Comments 21 pages, 20 figures, https://rpl-cs-ucl.github.io/OpenNavMap_page/
RAD:面向机器人观测的真实异常检测数据集与基准
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Peking University(北京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Great Bay University(大湾大学) ; Harvard University(哈佛大学) ; Tsinghua University(清华大学) ; Nanjing University(南京大学) ; Deakin University(德克萨斯大学)
专题命中 评测与基准 :language model(abstract)
AI总结 提出RAD数据集,包含13类日常物体和4种缺陷,从60多个机器人视角在非受控光照下采集,用于评估2D特征、3D重建和视觉语言模型在姿态无关的异常检测中的表现,发现2D方法优于3D和VLM方法。
通过深度先验增强玻璃表面重建以提升机器人导航
机构 * Shenzhen Key Laboratory of Robotics and Computer Vision(机器人与计算机视觉深圳重点实验室) ; Southern University of Science and Technology(南方科技大学) ; CKS Robotics Institute(CKS机器人研究院)
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文提出一种无需训练的框架,利用深度基础模型作为结构先验,结合鲁棒的局部RANSAC对齐方法,融合原始传感器深度数据,从而避免错误的玻璃测量污染,恢复准确的度量尺度,并引入新的RGB-D数据集用于玻璃区域的几何真实值。
Comments 9 pages, 8 figures, Accepted by IROS 2026
从时间维度上统一研究相机陷阱物种识别的启示与开放问题
机构 * The Ohio State University(俄亥俄州立大学) ; Boston University(波士顿大学)
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文通过统一研究相机陷阱物种识别的时间变化,揭示了生态实践中维持可靠识别的挑战,提出了一种真实场景的基准测试,并发现生物基础模型在多个站点表现不佳,适应性困难,以及类不平衡和时间偏移是主要因素。
Comments The first three authors contribute equally. Accepted by ECCV 2026
PRiSM:少样本视觉语言模型的原型正则化
机构 * ÉTS Montreal(蒙特利尔高等商学院)
专题命中 评测与基准 :language model(abstract)
AI总结 研究针对视觉语言模型少样本适应方法,质疑现有基准假设,引入新基准。提出PRiSM类原型正则化方法,优化多术语损失,结合有效优化器,提升性能,尤其在处理类不平衡和大量类时效果显著。
无人机-开放词汇视频实例分割:无人机也需要开放词汇视频实例分割
专题命中 评测与基准 :foundation model(abstract)
AI总结 研究针对无人机视频感知在开放场景中支持灵活查询和细粒度实例级动态理解不足的问题,提出无需训练的AeroTrack统一框架,构建AeroVIS评估基准,其实例化变体在无人机场景表现优异,还发布框架和基准以支持后续研究。
基于指目标识的对象识别
机构 * Comenius University, Bratislava, Slovakia(科门纽斯大学,布拉迪斯拉发,斯洛伐克)
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出了一种识别人类指目标识的综合流程,结合物体检测、姿态估计和视觉语言模型等方法,通过单张图像重建3D空间信息提升目标识别精度。
Comments Submitted to InnovAIte conference
GigaSpeechBench:一个真实世界的多语言语音到文本基准
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出GigaSpeechBench,一个包含680小时人工标注语音的多语言多维度ASR和AST基准,覆盖低资源语言、方言、口音、专业术语和年龄变化,揭示现有模型在挑战场景下的性能退化。
在多对多关联中部署DINO
专题命中 评测与基准 :prompting(abstract)
AI总结 为解决监督图像匹配模型在未见图像领域泛化能力有限的问题,本文探索了DINO特征的零样本部署。通过多对多匹配范式提升鲁棒性,并提出更高效的Harmonic Consensus Maximization机制,展示了其在相机姿态估计中的有效性。
Comments 14 pages, 10 figures
AI原型制作器:一个用于基于分解的GUI原型制作的Figma插件
专题命中 评测与基准 :LLM(abstract)
AI总结 研究针对GUI原型制作耗时问题,提出AI Prototyper插件,通过分解和检索增强生成管道,结合特定技术栈与大语言模型,经人工参与编辑步骤,能多语言输入,在时间和质量维度上表现良好。
Comments Accepted at the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), Tool Demonstration and Data Showcase Track
信任但要验证?揭示自主编码代理的安全债务
专题命中 评测与基准 :LLM(abstract)
AI总结 本文利用AIDev数据集,通过大语言模型评判框架和人工分析,研究自主编码代理生成拉取请求中的安全代码异味。发现38.9%的请求含安全异味,供应链问题和硬编码凭证占比高,揭示了安全风险及开发者警惕性降低问题,强调需实施上下文感知安全护栏。
Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)
MAGIS:基于证据的多智能体推理用于可解释的斜视临床决策
机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) ; Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院) ; Joint Shantou International Eye Center of Shantou University and The Chinese University of Hong Kong(汕头大学·香港中文大学联合汕头国际眼科中心) ; School of Artificial Intelligence, Guangzhou City Polytechnic(广州城市职业学院人工智能学院) ; Medical College, Shantou University(汕头大学医学院) ; College of Engineering, Shantou University(汕头大学工学院) ; Department of Ophthalmology, Xinhua Hospital Affiliated to Shanghai Jiaotong University School of Medicine(上海交通大学医学院附属新华医院眼科) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 评测与基准 :language model(abstract)
AI总结 提出MAGIS框架,通过多智能体协作、双重证据约束上下文和基于证据的纠正验证机制,将斜视诊断从黑箱生成转变为结构化推理,在细粒度斜视基准上将加权F1分数从72.0%提升至91.3%,并显著提高诊断报告的临床可靠性。