ChainSWE: Benchmarking Coding Agents on Multi-Bug Software Maintenance
ChainSWE:在多漏洞软件维护中对编码代理进行基准测试
专题命中 评测与基准 :language model(abstract)
AI总结 研究针对语言模型代理在多漏洞软件维护中的评估问题,引入ChainSWE基准,通过收集Python项目问题链进行评估,发现链长度增加时性能下降。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
ChainSWE:在多漏洞软件维护中对编码代理进行基准测试
专题命中 评测与基准 :language model(abstract)
AI总结 研究针对语言模型代理在多漏洞软件维护中的评估问题,引入ChainSWE基准,通过收集Python项目问题链进行评估,发现链长度增加时性能下降。
对基准进行基准测试:工具调用评估的有效性审计
专题命中 评测与基准 :LLM(abstract)
AI总结 对四个主要工具调用基准家族进行系统有效性和可重复性审计,发现诸多评估者与人类意见分歧,指出当前分数可能反映评估者问题而非智能体能力,还介绍相关分类、审计工件等及新基准和系统。
LongEgoRefer: 长形式自我中心视频指代表达理解基准
机构 * Woven by Toyota, Japan(丰田公司,日本) ; The University of Tokyo, Japan(东京大学,日本) ; National Institute of Informatics, Japan(日本信息机构国家研究所) ; Institute of Science Tokyo, Japan(东京科学研究所,日本) ; NII LLMC, Japan(日本信息机构LLMC) ; Kyoto University, Japan(京都大学,日本)
专题命中 评测与基准 :language model(abstract)
AI总结 提出LongEgoRefer基准,基于Ego4D长视频构建,解决现有基准仅关注短视频导致目标稀疏和活动复杂的问题,评估现有方法发现性能显著下降,凸显长形式自我中心时空定位的挑战。
Comments ECCV 2026. Dataset and code: https://github.com/shunya-kato/LongEgoRefer
FoundDP:重新审视双像素深度估计中的弱视差可观测性
机构 * Huazhong University of Science and Technology(华中科技大学)
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出FoundDP框架,结合双像素深度与单目深度基础模型的全局结构先验,通过ViT特征对齐缓解散焦模糊导致的表示退化,在弱视差区域提升结构一致性与度量精度。
RTE-FM-Dehazer: 辐射传输方程启发的流匹配用于真实图像去雾
机构 * Mashang Consumer Finance Co. Ltd(马上消费金融股份有限公司) ; Tsinghua University(清华大学) ; Hunan University(湖南大学) ; University of Liverpool(利物浦大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 评测与基准 :language model(abstract)
AI总结 提出基于辐射传输方程(RTE)的流匹配去雾方法RTE-FM-Dehazer,通过扩散-吸收正则化引导去雾轨迹,并构建包含5万对真实雾/清晰图像的P-HAZE数据集,在五个真实基准上取得领先结果。
硅像素探测器研发的基于证据的检索基准与混合RAG框架
专题命中 评测与基准 :language model(abstract)
AI总结 针对硅像素探测器文献检索瓶颈,提出首个基于证据的检索基准和混合检索框架,结合稀疏、密集、混合检索和图探索,实验表明混合稀疏-密集检索在证据恢复上最可靠。
Comments 30 pages, 12 figures
GKDT: 通用关键点检测Transformer
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Australian National University(澳大利亚国立大学) ; Tencent Inc.(腾讯公司) ; Adelaide University(阿德莱德大学)
专题命中 评测与基准 :language model(abstract)
AI总结 提出通用关键点检测模型GKDT,基于大规模统一数据集MegaKPT和DINOv3 Transformer,支持视觉/文本提示,在22个测试集上多数类别PCK@0.1超90%。
Comments Accepted by ECCV 2026
文本到图像模型是归纳主义的火鸡吗?一个用于因果推理的反事实基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 评测与基准 :language model(abstract)
AI总结 提出反事实基准CF-World,通过三个递进层级测试T2I模型在违反现实先验规则下的图像生成能力,发现所有模型在反事实设置下性能急剧下降,原因是模型将世界知识与视觉外观编码为紧密耦合的模式。
Comments 10 pages, 7 figures. Project page: https://github.com/jylei16/CF-World.github.io
基于地标的心脏分割的自监督时间正则化与自动AHA区域映射
机构 * Biomedical Image Technologies, ETSI Telecomunicación, Universidad Politécnica de Madrid, Madrid, Spain(生物医学图像技术,电信工程学院,马德里理工大学,马德里,西班牙) ; Centro de Investigación Biomédica en Red de Bioingeniería, Biomateriales y Nanomedicina (CIBER-BBN), Instituto de Salud Carlos III, Madrid, Spain(生物工程、生物材料和纳米医学网络生物医学研究中心(CIBER-BBN),卡洛斯三世健康研究所,马德里,西班牙) ; APOLO Biotech, Ciudad Autónoma de Buenos Aires, Argentina(APOLO Biotech,布宜诺斯艾利斯自治市,阿根廷) ; Departamento de Computación, Universidad de Buenos Aires, Ciudad Autónoma de Buenos Aires, Argentina(计算系,布宜诺斯艾利斯大学,布宜诺斯艾利斯自治市,阿根廷) ; Instituto de Ciencias de la Computación (ICC), CONICET-Universidad de Buenos Aires, Ciudad Autónoma de Buenos Aires, Argentina(计算机科学研究所(ICC),CONICET-布宜诺斯艾利斯大学,布宜诺斯艾利斯自治市,阿根廷)
专题命中 评测与基准 :post-training(abstract)
AI总结 提出自监督时间正则化方法,利用图像序列的时间一致性增强心脏分割和运动估计的连续性,并自动映射到AHA 17节段标准,在CAMUS数据集上验证了临床实用性。
Comments Accepted at MICCAI 2026
DrivingDepth: 稀疏提示的像素级尺度校正用于驾驶深度估计
机构 * Baidu Inc.(百度公司)
专题命中 评测与基准 :foundation model(abstract)
AI总结 针对自动驾驶深度估计中几何与尺度的冲突,提出DrivingDepth方法,利用稀疏LiDAR作为几何提示,通过残差像素级尺度校正校准冻结的深度基础模型,在保持密集视觉几何的同时实现度量精度与几何一致性。
一视频一世界:将单目视频转化为物理4D场景
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; SparcAI Inc(SparcAI公司) ; University of Science and Technology of China(中国科学技术大学) ; The Hong Kong Polytechnic University(香港理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Nanyang Technological University(南洋理工大学) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
专题命中 评测与基准 :language model(abstract)
AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。
Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/
重新审视视觉-语言-动作模型中的参数冗余:从VLM到VLA适配的见解
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)
专题命中 评测与基准 :language model(abstract)
AI总结 通过分析VLM到VLA适配中参数差异的空间分布,设计多模块联合剪枝方案,在无需微调恢复的情况下减少12%-30%参数并保持约90%性能。
Comments 22 pages, 3 figures, ECCV 2026 Conference
重新思考特征工程与学习策略在少样本隐藏情感识别中的作用
机构 * Hefei University of Technology(合肥工业大学) ; University College London(伦敦大学学院) ; The University of Sydney(悉尼大学) ; Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯光科技有限公司) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) ; Beihang University(北京航空航天大学) ; The University of New South Wales(新南威尔士大学) ; United Arab Emirates University(阿拉伯联合酋长国大学)
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出跨注意力机制与多实例学习框架,利用多源特征(2D/3D骨架、面部Blendshapes、DINOv2/v3、X-CLIP、Gemini)解决长视频中弱稀疏隐式情感识别,在IJCAI挑战赛Track 3中获第一名。
一种增强的无源无监督域适应框架:基于预测编码和测试时训练的跨数据集脑电情感识别
专题命中 评测与基准 :pretraining(abstract)
AI总结 提出一种无源无监督域适应框架,通过非对比预测编码自监督预训练和双阶段自适应优化(多损失自适应正则化与局部一致性学习),结合轻量测试时训练,解决跨数据集脑电情感识别中的域偏移和噪声伪标签问题。
Comments Under review
“一丝混乱与疯狂”:AI评估量表与评估改革工作
专题命中 评测与基准 :prompting(abstract)
AI总结 本研究通过越南和英国两所大学的焦点小组,探讨AI评估量表(AIAS)的实施经验,发现其能促进真实评估设计,但若脱离学习成果和学科背景可能沦为合规工具。
Comments V2: Corrections of errata, additional limitations
发票草垛:强视觉同质性下的文档检索与视觉问答基准测试
机构 * The University of Melbourne(墨尔本大学) ; Lakehead University(湖首大学)
专题命中 评测与基准 :language model(abstract)
AI总结 针对视觉同质文档集合中的检索困难,提出Invoice Haystack基准和VL-RAG混合检索框架,通过文本与视觉嵌入融合及VLM验证过滤,显著提升检索准确率。
Comments Accepted to presentation at ECCV 2026
LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准
机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) ; Beihang University(北京航空航天大学) ; Eastern Institute of Technology, Ningbo(宁波东方理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; Microsoft Research Asia (MSRA)(微软亚洲研究院)
专题命中 评测与基准 :foundation model(abstract)
AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。
Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/
OctoSense: 多模态机器人感知的自监督学习
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出OctoSense传感器平台和数据集,通过“晚融合”掩码自编码器实现多模态自监督学习,在多种退化条件下鲁棒预测光流、深度、语义分割和自运动。
RelAfford6D:用于约束驱动机器人操作的关系型6D可操作图
机构 * School of Computer Science, Shanghai Jiaotong University(上海交通大学计算机科学学院)
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出RelAfford6D框架,通过构建关系型6D可操作图将语义指令转化为SE(3)位姿约束,并利用运动学约束求解实现零样本操作,在仿真和真实环境中优于数据驱动方法。
操纵行为依赖于任务:前沿语言模型的多轴、多环境评估
专题命中 评测与基准 :language model(abstract)
AI总结 通过六种环境、三个轴(框架、激励结构、任务难度)评估六个前沿语言模型的操纵行为,发现操纵倾向在不同任务间相关性低,且不同环境下驱动因素不同。
USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习
机构 * Nanyang Technological University(南洋理工大学)
专题命中 评测与基准 :prompting(abstract)
AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。
TacVerse:面向跨传感器视觉触觉感知的多传感器数据集与基准
机构 * Imperial College London(帝国理工学院) ; Queen Mary University of London(伦敦玛丽女王大学)
专题命中 评测与基准 :pretraining(abstract)
AI总结 提出TacVerse多传感器数据集与基准,包含7种视觉触觉传感器的106800张图像,支持形状分类、光栅分类和力回归任务,实验表明跨传感器直接迁移性能下降,而少样本适应可提升力回归性能。
LinStereo:用于多尺度迭代立体匹配的线性复杂度全局注意力
机构 * Australian Centre for Robotics (ACFR), School of Aerospace, Mechanical and Mechatronic Engineering (AMME), Faculty of Engineering, The University of Sydney(悉尼大学工程学院航空航天、机械与机电工程学院澳大利亚机器人中心(ACFR))
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出LinStereo,通过位置感知线性注意力实现全局聚合,结合层次化语义代价体积和深度先验初始化,在标准基准和跨域场景(尤其水下)取得最先进精度。
KidRisk:儿童危险动作识别基准数据集
机构 * Thong Nhat Hospital(统一医院)
专题命中 评测与基准 :language model(abstract)
AI总结 构建包含2500个短视频和10000张图像的儿童危险动作数据集KidRisk,提出基于视觉语言模型的方法,在动作分类和危险识别上分别达到83.53%和96.14%的准确率。
Comments SOICT 2024
机器人操作的世界价值模型
机构 * Peking University(北京大学) ; Tsinghua University(清华大学)
专题命中 评测与基准 :language model(abstract)
AI总结 提出世界价值模型(WVM),融合世界模型与价值估计,通过时序建模评估数据质量,在标准基准和次优轨迹基准上达到SOTA,提升策略学习性能。
Comments preprint
VisCritic: 视觉状态比较作为GUI智能体的过程奖励
机构 * City University of Hong Kong(香港城市大学)
专题命中 评测与基准 :language model(abstract)
AI总结 提出VisCritic框架,通过比较操作前后截图在视觉特征空间中的变化来验证GUI智能体动作,结合孪生视觉Transformer和动作感知评判头,无需额外人工标注即可提升多基准测试性能。
Comments 17 pages, 4 figures; ECCV 2026 submission; supplementary material uploaded as ancillary file
EgoSAT: 一个全面的自我中心流式交互理解基准
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 评测与基准 :language model(abstract)
AI总结 提出EgoSAT基准,统一自我中心视频的回顾、在线和前瞻推理任务,评估视觉语言模型在流式设置中的表现,发现现有模型存在前瞻/回顾困难及置信度校准问题。
Comments Accepted to ECCV 2026. Project page: https://leiyj23.github.io/EgoSAT/
SignNet-1M:大规模多语言手语视频数据集及下游基准
机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ; ChatSign Technology(ChatSign 技术公司) ; Tsinghua University(清华大学)
专题命中 评测与基准 :language model(abstract)
AI总结 提出SignNet-1M,通过3D高斯泼溅、扩散模型和后期渲染增强合成多样化手语视频,提升模型在跨视角、背景和身份等分布偏移下的泛化能力。
Comments 25 pages. Accepted to ECCV 2026
基于扩散解耦的双分支交叉投影去偏
机构 * Xidian University(西安电子科技大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 评测与基准 :foundation model(abstract)
AI总结 针对有偏数据下基础模型的泛化问题,提出置信引导的偏差概念挖掘(CBCM)和双分支交叉投影去偏(DCD)框架,通过扩散解耦和交叉零空间投影分离目标与虚假特征,在无组标签条件下实现最差组准确率最优。
Sat2City v2: 从单张卫星图像生成原生3D城市资产
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Chinese University of Hong Kong(香港中文大学) ; Auckland University of Technology(奥克兰理工大学) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出Sat2City v2,利用预训练的原生结构化潜空间3D基础模型,从单张卫星图像生成具有可控外观和几何形状的纹理网格,在真实数据集上优于基线方法。