arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2780 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2780 篇

2607.02606 2026-07-07 cs.SE 新提交 50%

ChainSWE: Benchmarking Coding Agents on Multi-Bug Software Maintenance

ChainSWE:在多漏洞软件维护中对编码代理进行基准测试

Qirui Jin, Lingching Tung, Kenan Li, Qiyang Shi, Yushi She, Huanzhong Jia, Harrison Zhao, Kejing Xia, Zhenbang Du, Yikai Zhang, Jiaxin Pei, Zhenyu Zhang, Zhen Qi, Yuyan Duan, Wenke Lee, Zijian Jin

专题命中 评测与基准 :language model(abstract)

AI总结 研究针对语言模型代理在多漏洞软件维护中的评估问题,引入ChainSWE基准,通过收集Python项目问题链进行评估,发现链长度增加时性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02577 2026-07-07 cs.SE 新提交 50%

Benchmarking the Benchmarks: A Validity Audit of Tool-Calling Evaluation

对基准进行基准测试:工具调用评估的有效性审计

Vishvesh Bhat, Jay Vaghasiya, Muhammad Ahmed Mohsin, Asad Aali

专题命中 评测与基准 :LLM(abstract)

AI总结 对四个主要工具调用基准家族进行系统有效性和可重复性审计,发现诸多评估者与人类意见分歧,指出当前分数可能反映评估者问题而非智能体能力,还介绍相关分类、审计工件等及新基准和系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02096 2026-07-03 cs.CV 新提交 50%

LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension

LongEgoRefer: 长形式自我中心视频指代表达理解基准

Shunya Kato, Taiki Miyanishi, Shuhei Kurita, Mahiro Ukai, Nakamasa Inoue, Chenhui Chu

机构 * Woven by Toyota, Japan(丰田公司,日本) The University of Tokyo, Japan(东京大学,日本) National Institute of Informatics, Japan(日本信息机构国家研究所) Institute of Science Tokyo, Japan(东京科学研究所,日本) NII LLMC, Japan(日本信息机构LLMC) Kyoto University, Japan(京都大学,日本)

专题命中 评测与基准 :language model(abstract)

AI总结 提出LongEgoRefer基准,基于Ego4D长视频构建,解决现有基准仅关注短视频导致目标稀疏和活动复杂的问题,评估现有方法发现性能显著下降,凸显长形式自我中心时空定位的挑战。

Comments ECCV 2026. Dataset and code: https://github.com/shunya-kato/LongEgoRefer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01900 2026-07-03 cs.CV 新提交 50%

FoundDP: Revisiting Weak Disparity Observability in Dual-Pixel Depth Estimation

FoundDP:重新审视双像素深度估计中的弱视差可观测性

Fengchen He, Hao Xu, Dayang Zhao, Tingwei Quan, Shaoqun Zeng

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出FoundDP框架,结合双像素深度与单目深度基础模型的全局结构先验,通过ViT特征对齐缓解散焦模糊导致的表示退化,在弱视差区域提升结构一致性与度量精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01748 2026-07-03 cs.CV 新提交 50%

RTE-FM-Dehazer: Radiative Transfer Equation Inspired Flow Matching for Real-World Image Dehazing

RTE-FM-Dehazer: 辐射传输方程启发的流匹配用于真实图像去雾

Chenfeng Wei, Chun Wang, Boyang Zhao, Si Zuo, Shenhong Wang, Chenguang Yang

机构 * Mashang Consumer Finance Co. Ltd(马上消费金融股份有限公司) Tsinghua University(清华大学) Hunan University(湖南大学) University of Liverpool(利物浦大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出基于辐射传输方程(RTE)的流匹配去雾方法RTE-FM-Dehazer,通过扩散-吸收正则化引导去雾轨迹,并构建包含5万对真实雾/清晰图像的P-HAZE数据集,在五个真实基准上取得领先结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24725 2026-07-03 physics.ins-det physics.comp-ph 新提交 50%

A Reproducible Benchmark and Evidence-Retrieval Software Framework for Silicon Detector R&D Literature

硅像素探测器研发的基于证据的检索基准与混合RAG框架

Tianqi Gao, Ruobing Jiang, Dawei Fu, Qiang Li, Matthew Kenzie

专题命中 评测与基准 :language model(abstract)

AI总结 针对硅像素探测器文献检索瓶颈,提出首个基于证据的检索基准和混合检索框架,结合稀疏、密集、混合检索和图探索,实验表明混合稀疏-密集检索在证据恢复上最可靠。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00752 2026-07-02 cs.CV 新提交 50%

GKDT: General Keypoint Detection Transformer

GKDT: 通用关键点检测Transformer

Changsheng Lu, Yuxin Chen, Haokun Gui, Rong Wang, Jie Yang, Harry Yang, Anton van den Hengel, Jiaya Jia

机构 * Hong Kong University of Science and Technology(香港科技大学) Australian National University(澳大利亚国立大学) Tencent Inc.(腾讯公司) Adelaide University(阿德莱德大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出通用关键点检测模型GKDT,基于大规模统一数据集MegaKPT和DINOv3 Transformer,支持视觉/文本提示,在22个测试集上多数类别PCK@0.1超90%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24548 2026-07-02 cs.CV 新提交 50%

Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning

文本到图像模型是归纳主义的火鸡吗?一个用于因果推理的反事实基准

Jiayi Lei, Yuandong Pu, Xingyu Han, Rongpeng Zhu, Jing Xu, Jinyao Wang, Zijian Zhou, Bin Fu, Yuewen Cao, Yihao Liu, Hongsheng Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出反事实基准CF-World,通过三个递进层级测试T2I模型在违反现实先验规则下的图像生成能力,发现所有模型在反事实设置下性能急剧下降,原因是模型将世界知识与视觉外观编码为紧密耦合的模式。

Comments 10 pages, 7 figures. Project page: https://github.com/jylei16/CF-World.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31785 2026-07-01 cs.CV 新提交 50%

Self-Supervised Temporal Regularization for Landmark-Based Cardiac Segmentation with Automatic AHA Regional Mapping

基于地标的心脏分割的自监督时间正则化与自动AHA区域映射

David Montalvo-García, Nicolás Gaggion, María J. Ledesma-Carbayo, Enzo Ferrante

机构 * Biomedical Image Technologies, ETSI Telecomunicación, Universidad Politécnica de Madrid, Madrid, Spain(生物医学图像技术,电信工程学院,马德里理工大学,马德里,西班牙) Centro de Investigación Biomédica en Red de Bioingeniería, Biomateriales y Nanomedicina (CIBER-BBN), Instituto de Salud Carlos III, Madrid, Spain(生物工程、生物材料和纳米医学网络生物医学研究中心(CIBER-BBN),卡洛斯三世健康研究所,马德里,西班牙) APOLO Biotech, Ciudad Autónoma de Buenos Aires, Argentina(APOLO Biotech,布宜诺斯艾利斯自治市,阿根廷) Departamento de Computación, Universidad de Buenos Aires, Ciudad Autónoma de Buenos Aires, Argentina(计算系,布宜诺斯艾利斯大学,布宜诺斯艾利斯自治市,阿根廷) Instituto de Ciencias de la Computación (ICC), CONICET-Universidad de Buenos Aires, Ciudad Autónoma de Buenos Aires, Argentina(计算机科学研究所(ICC),CONICET-布宜诺斯艾利斯大学,布宜诺斯艾利斯自治市,阿根廷)

专题命中 评测与基准 :post-training(abstract)

AI总结 提出自监督时间正则化方法,利用图像序列的时间一致性增强心脏分割和运动估计的连续性,并自动映射到AHA 17节段标准,在CAMUS数据集上验证了临床实用性。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31488 2026-07-01 cs.CV 新提交 50%

DrivingDepth: Sparse-Prompted Pixel-wise Scale Correction for Driving Depth Estimation

DrivingDepth: 稀疏提示的像素级尺度校正用于驾驶深度估计

Chi Huang, Wenhao Zhang, Hang Yin, YuAn Wang, Hao Li, Bosheng Wang, Xun Sun, Liang Wang

机构 * Baidu Inc.(百度公司)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对自动驾驶深度估计中几何与尺度的冲突,提出DrivingDepth方法,利用稀疏LiDAR作为几何提示,通过残差像素级尺度校正校准冻结的深度基础模型,在保持密集视觉几何的同时实现度量精度与几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31388 2026-07-01 cs.CV 新提交 50%

One Video, One World: Turning Monocular Video into Physical 4D Scenes

一视频一世界:将单目视频转化为物理4D场景

Junhao Chen, Boran Zhang, Mingjin Chen, Henghaofan Zhang, Saining Zhang, Congcong Zhu, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) SparcAI Inc(SparcAI公司) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 评测与基准 :language model(abstract)

AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。

Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31382 2026-07-01 cs.RO 新提交 50%

Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation

重新审视视觉-语言-动作模型中的参数冗余:从VLM到VLA适配的见解

Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 评测与基准 :language model(abstract)

AI总结 通过分析VLM到VLA适配中参数差异的空间分布,设计多模块联合剪枝方案,在无需微调恢复的情况下减少12%-30%参数并保持约90%性能。

Comments 22 pages, 3 figures, ECCV 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31249 2026-07-01 cs.CV 新提交 50%

Rethinking the Role of Feature Engineering and Learning Strategies in Few-Shot Hidden Emotion Recognition

重新思考特征工程与学习策略在少样本隐藏情感识别中的作用

Xiaochuan Guo, Jihao Gu, Haixu Liu, Yuxin Liu, Qi Wang, Yufei Wang, Fei Wang, Kun Li, Dan Guo

机构 * Hefei University of Technology(合肥工业大学) University College London(伦敦大学学院) The University of Sydney(悉尼大学) Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯光科技有限公司) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Beihang University(北京航空航天大学) The University of New South Wales(新南威尔士大学) United Arab Emirates University(阿拉伯联合酋长国大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出跨注意力机制与多实例学习框架,利用多源特征(2D/3D骨架、面部Blendshapes、DINOv2/v3、X-CLIP、Gemini)解决长视频中弱稀疏隐式情感识别,在IJCAI挑战赛Track 3中获第一名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28202 2026-06-29 eess.SP 新提交 50%

An Enhanced Source-Free Unsupervised Domain Adaptation Framework for Cross-Dataset EEG Emotion Recognition via Predictive Coding and Test-Time Training

一种增强的无源无监督域适应框架:基于预测编码和测试时训练的跨数据集脑电情感识别

Md Niaz Imtiaz, Naimul Khan

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出一种无源无监督域适应框架,通过非对比预测编码自监督预训练和双阶段自适应优化(多损失自适应正则化与局部一致性学习),结合轻量测试时训练,解决跨数据集脑电情感识别中的域偏移和噪声伪标签问题。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26729 2026-06-29 cs.HC 新提交 50%

'A bit of chaos and madness': The AI Assessment Scale and the work of assessment reform

“一丝混乱与疯狂”:AI评估量表与评估改革工作

Mike Perkins, Darius Postma, Jasper Roe, Susan Sisay, Craig Holdcroft

专题命中 评测与基准 :prompting(abstract)

AI总结 本研究通过越南和英国两所大学的焦点小组,探讨AI评估量表(AIAS)的实施经验,发现其能促进真实评估设计,但若脱离学习成果和学科背景可能沦为合规工具。

Comments V2: Corrections of errata, additional limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25343 2026-06-29 cs.CV 新提交 50%

Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity

发票草垛:强视觉同质性下的文档检索与视觉问答基准测试

Heethanjan Kanagalingam, Thenukan Pathmanathan, Mokeeshan Vathanakumar, Basim Azam, Sarah Monazam Erfani, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) Lakehead University(湖首大学)

专题命中 评测与基准 :language model(abstract)

AI总结 针对视觉同质文档集合中的检索困难,提出Invoice Haystack基准和VL-RAG混合检索框架,通过文本与视觉嵌入融合及VLM验证过滤,显著提升检索准确率。

Comments Accepted to presentation at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23686 2026-06-29 cs.RO 新提交 50%

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) Beihang University(北京航空航天大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。

Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27317 2026-06-26 cs.CV cs.RO 新提交 50%

OctoSense: Self-Supervised Learning for Multimodal Robot Perception

OctoSense: 多模态机器人感知的自监督学习

Anthony Bisulco, Jeremy Wang, Kostas Daniilidis, Randall Balestriero, Pratik Chaudhari

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出OctoSense传感器平台和数据集,通过“晚融合”掩码自编码器实现多模态自监督学习,在多种退化条件下鲁棒预测光流、深度、语义分割和自运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27036 2026-06-26 cs.RO 新提交 50%

RelAfford6D: Relational 6D Affordance Graphs for Constraint-Driven Robotic Manipulation

RelAfford6D:用于约束驱动机器人操作的关系型6D可操作图

Guodong Zhang, Qichen He, Wenyuan Xie, Shaokai Wu, Yanbiao Ji, Qiuchang Li, Bayram Bayramli, Yue Ding, Hongtao Lu

机构 * School of Computer Science, Shanghai Jiaotong University(上海交通大学计算机科学学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出RelAfford6D框架,通过构建关系型6D可操作图将语义指令转化为SE(3)位姿约束,并利用运动学约束求解实现零样本操作,在仿真和真实环境中优于数据驱动方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25899 2026-06-25 cs.MA 新提交 50%

Manipulation Is Task-Dependent: A Multi-Axis, Multi-Environment Evaluation of Frontier LLMs

操纵行为依赖于任务:前沿语言模型的多轴、多环境评估

Adeeb Zaman, Erik Nordby, Fred Heiding

专题命中 评测与基准 :language model(abstract)

AI总结 通过六种环境、三个轴(框架、激励结构、任务难度)评估六个前沿语言模型的操纵行为,发现操纵倾向在不同任务间相关性低,且不同环境下驱动因素不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25880 2026-06-25 cs.CV 新提交 50%

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习

Yuchen Xie, Xinyu Zhou, Kuangji Zuo, Yanshuo Lu, Fengrui Huang, Boyu Ma, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :prompting(abstract)

AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25877 2026-06-25 cs.RO 新提交 50%

TacVerse: A Multi-Sensor Dataset and Benchmark for Cross-Sensor Vision-Based Tactile Perception

TacVerse:面向跨传感器视觉触觉感知的多传感器数据集与基准

Lan Wei, Gurmeher Khurana, Sirine Bhouri, Wenhao Hong, Zeyuan Xin, Qingzheng Cong, Wen Fan, Yanzheng Xiang, Dandan Zhang

机构 * Imperial College London(帝国理工学院) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出TacVerse多传感器数据集与基准,包含7种视觉触觉传感器的106800张图像,支持形状分类、光栅分类和力回归任务,实验表明跨传感器直接迁移性能下降,而少样本适应可提升力回归性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25437 2026-06-25 cs.CV 新提交 50%

LinStereo: Linear-Complexity Global Attention for Multi-Scale Iterative Stereo Matching

LinStereo:用于多尺度迭代立体匹配的线性复杂度全局注意力

Yiran Wang, Oliver Turner, Viorela Ila

机构 * Australian Centre for Robotics (ACFR), School of Aerospace, Mechanical and Mechatronic Engineering (AMME), Faculty of Engineering, The University of Sydney(悉尼大学工程学院航空航天、机械与机电工程学院澳大利亚机器人中心(ACFR))

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出LinStereo,通过位置感知线性注意力实现全局聚合,结合层次化语义代价体积和深度先验初始化,在标准基准和跨域场景(尤其水下)取得最先进精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25298 2026-06-25 cs.CV 新提交 50%

KidRisk: Benchmark Dataset for Children Dangerous Action Recognition

KidRisk:儿童危险动作识别基准数据集

Minh-Kha Nguyen, Trung-Hieu Do, Kim Anh Phung, Thao Thi Phuong Dao, Minh-Triet Tran, Trung-Nghia Le

机构 * Thong Nhat Hospital(统一医院)

专题命中 评测与基准 :language model(abstract)

AI总结 构建包含2500个短视频和10000张图像的儿童危险动作数据集KidRisk,提出基于视觉语言模型的方法,在动作分类和危险识别上分别达到83.53%和96.14%的准确率。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24742 2026-06-24 cs.RO 新提交 50%

World Value Models for Robotic Manipulation

机器人操作的世界价值模型

Zhihao Wang, Jianxiong Li, Yu Cui, Yuan Gao, Xianyuan Zhan, Junzhi Yu, Xiao Ma

机构 * Peking University(北京大学) Tsinghua University(清华大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出世界价值模型(WVM),融合世界模型与价值估计,通过时序建模评估数据质量,在标准基准和次优轨迹基准上达到SOTA,提升策略学习性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24525 2026-06-24 cs.CV 新提交 50%

VisCritic: Visual State Comparison as Process Reward for GUI Agents

VisCritic: 视觉状态比较作为GUI智能体的过程奖励

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出VisCritic框架,通过比较操作前后截图在视觉特征空间中的变化来验证GUI智能体动作,结合孪生视觉Transformer和动作感知评判头,无需额外人工标注即可提升多基准测试性能。

Comments 17 pages, 4 figures; ECCV 2026 submission; supplementary material uploaded as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24422 2026-06-24 cs.CV 新提交 50%

EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding

EgoSAT: 一个全面的自我中心流式交互理解基准

Yijia Lei, Jinzhao Li, Yichi Zhang, Jiacheng Hua, Yin Li, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :language model(abstract)

AI总结 提出EgoSAT基准,统一自我中心视频的回顾、在线和前瞻推理任务,评估视觉语言模型在流式设置中的表现,发现现有模型存在前瞻/回顾困难及置信度校准问题。

Comments Accepted to ECCV 2026. Project page: https://leiyj23.github.io/EgoSAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24361 2026-06-24 cs.CV 新提交 50%

SignNet-1M: Large-Scale Multilingual Sign Language Video Dataset with Downstream Benchmarks

SignNet-1M:大规模多语言手语视频数据集及下游基准

Zhewen He, Junyi Hu, Haomian Huang, Zhenhua Li, Yu-Shen Liu, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ChatSign Technology(ChatSign 技术公司) Tsinghua University(清华大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出SignNet-1M,通过3D高斯泼溅、扩散模型和后期渲染增强合成多样化手语视频,提升模型在跨视角、背景和身份等分布偏移下的泛化能力。

Comments 25 pages. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24161 2026-06-24 cs.CV 新提交 50%

Dual-Branch Cross-Projection Debiasing through Diffusion-based Disentanglement

基于扩散解耦的双分支交叉投影去偏

Xiangqian Zhao, Xinyang Jiang, Zhipeng Xu, Lingfeng He, Zilong Wang, Dongsheng Li, De Cheng, Nannan Wang

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对有偏数据下基础模型的泛化问题,提出置信引导的偏差概念挖掘(CBCM)和双分支交叉投影去偏(DCD)框架,通过扩散解耦和交叉零空间投影分离目标与虚假特征,在无组标签条件下实现最差组准确率最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24138 2026-06-24 cs.CV 新提交 50%

Sat2City v2: Native 3D City Asset Generation from a Single Satellite Image

Sat2City v2: 从单张卫星图像生成原生3D城市资产

Tongyan Hua, Dongli Wu, Jinjing Zhu, Yinrui Ren, Zhongcheng Hong, Ying-Cong Chen, Hui Xiong, Wufan Zhao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学) Auckland University of Technology(奥克兰理工大学) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出Sat2City v2,利用预训练的原生结构化潜空间3D基础模型,从单张卫星图像生成具有可控外观和几何形状的纹理网格,在真实数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏