arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 78
2608.12279 2026-08-13 cs.CV 新提交

Curvature-Aware Zeroth-Order Optimization for Memory-Efficient Test-Time Adaptation

面向内存高效测试时适应的曲率感知零阶优化

Junming Zhang, Shuyu Yin, Peilin Liu, Rendong Ying, Fei Wen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文针对零阶测试时适应方法梯度估计方差高的问题,提出CAZO方法,利用损失海森结构优化扰动采样,在降内存开销的同时实现了最优跨域适应性能。

Comments Published in CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 836-846

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11933 2026-08-13 cs.CV 新提交

Dual Anchors, Do It Better: Hierarchical Group Merging for Zero-Shot Anomaly Detection

双锚点,效果更佳:用于零样本异常检测的分层分组合并方法

Jimin Roh, DongKyu Kim, Suk-Ju Kang

机构 * Sogang University(西江大学) LG Electronics(LG电子) NAVER Cloud(NAVER云)

AI总结 针对现有CLIP-based零样本异常检测方法的局限,提出Dual-Anchor框架,结合分层图像锚点与文本锚点,在8个工业和6个医疗基准上实现了优异泛化性能。

Comments 10 pages, 5 figures, 4 tables. Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11367 2026-08-13 cs.CV cs.AI 新提交

Gaze Target Estimation Anywhere with Concepts

基于概念的任意场景注视目标估计

Xu Cao, Houze Yang, Vipin Gunda, Zhongyi Zhou, Tianyu Xu, Adarsh Kowdle, Inki Kim, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌公司)

AI总结 针对现有注视估计方法依赖中间阶段、缺乏灵活性的局限,提出PGE任务,构建Gaze-Co数据集,开发GazeAnywhere模型,实现端到端的概念驱动注视目标估计并达到最优性能。

Comments CVPR 2026 Code and Benchmark are aviliable at https://github.com/IrohXu/GazeAnywhere and https://huggingface.co/datasets/IrohXu/Gaze-Co-Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08867 2026-08-11 cs.CV 新提交

Zero-Shot Traffic Accident Detection via a Coarse-to-Fine VLM-Tracking Pipeline

基于粗到细VLM跟踪流水线的零样本交通事故检测

Dipit Saha, Shah Mohammad Abdul Mannan, Mohammad Raihan Rashid, Ruwad Naswan, Ahnaf Tahmid

机构 * Bangladesh University of Engineering and Technology(孟加拉工程技术大学)

AI总结 本文提出一种无需训练的双通粗到细流水线,结合Qwen3-VL-32B-Instruct、YOLO11x与BoT-SORT,在零样本约束下于ACCIDENT @ CVPR基准测试中实现22%相对优势,达成0.504的三方调和均值得分。

Comments Accepted at the AUTOPILOT Workshop, CVPR 2026, Denver, CO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07117 2026-08-10 cs.CV 新提交

Beyond Fluency: A Clinical Benchmark and Anomaly-Enhanced Baseline for Spine MRI Report Generation

超越流畅性:脊柱MRI报告生成的临床基准与异常增强基线

Bruno Palau, Franziska Vogt, Daria Laslo, Haobo Li, Ender Konukoglu, Maria Monzon, Catherine R. Jutzeler

机构 * ETH Zurich(苏黎世联邦理工学院) Swiss Institute of Bioinformatics (SIB)(瑞士生物信息学研究所)

AI总结 该研究针对放射学报告的耗时与阅片差异问题,构建腰椎MRI的VLM临床基准,提出半监督U-Net++生成异常热图增强VLM的框架,提升诊断可靠性与可解释性。

Comments Maria Monzon and Catherine R. Jutzeler contributed equally as shared last authors. Accepted at the CV4Clinic Workshop, CVPR 2026

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6759-6770

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04764 2026-08-06 cs.CV cs.GR 新提交

Splat-Based Metal Artifact Reduction in Cone-Beam CT via Compact Attenuation Modeling

基于样条的锥形束CT金属伪影消除方法:通过紧凑衰减建模实现

Kiseok Choi, Jaemin Cho, Inchul Kim, Min H. Kim

机构 * KAIST(韩国科学技术院)

AI总结 本文针对锥形束CT的金属伪影问题,提出基于样条的框架,将物理多能前向模型融入连续高斯表示,实现高效联合优化,实验显示其收敛更快、抑伪影效果更优。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04752 2026-08-06 cs.CV cs.GR 新提交

Revisiting Pose Sensitivity in Splat-based Computed Tomography under Sparse-view Reconstruction

稀疏视图重建下基于Splat的计算机断层扫描中姿态敏感性的再探讨

Kiseok Choi, Hyeongjun Cho, Inchul Kim, Min H. Kim

机构 * KAIST(韩国科学技术院)

AI总结 本研究针对基于Splat的CT在实际稀疏视图下的伪影问题,分析其源于姿态不准确性,推导了联合优化几何参数的稳定梯度框架,提升了重建保真度且易于集成。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04737 2026-08-06 cs.CV cs.GR 新提交

Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors

基于稀疏直接飞行时间传感器的密集度量深度补全

Hakyeong Kim, Ruicheng Wang, Chengtang Yao, Jiaolong Yang, Min H. Kim

机构 * KAIST(韩国科学技术院) USTC(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出一种深度引导双分支视觉Transformer框架,结合dToF模拟流程,实现稀疏dToF到密集度量深度的零样本泛化补全,性能优于现有方法且高效。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04379 2026-08-06 cs.CV cs.AI 新提交

Image Classification Using CNN-QNN Hybrid Model with Optimized Correlated Features

基于优化相关特征的CNN-QNN混合模型的图像分类

Minseo Seong, Youngwook Kim

机构 * Sogang University(西江大学)

AI总结 本文提出优化CNN特征相关性的CNN-QNN混合模型,在CIFAR-10等三项分类任务中,使特征平均相关性达0.5可提升分类准确率与稳定性,凸显QNN的性能潜力。

Comments Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03851 2026-08-05 cs.CV 新提交

LiteMVS: Efficient Multi-View Stereo with Foundation Distillation and Expert Aggregation

LiteMVS:结合基础模型蒸馏与专家聚合的高效多视图立体匹配

Tianbao Zhang, Zeyu Liu, Shuyu Wu, Fanxing Li, Zhaoxin Fan, Wenjun Wu, Danping Zou

AI总结 LiteMVS是集成平面扫描几何推理与单目先验的轻量多视图深度模型,通过MoE和基础模型蒸馏提升重建质量与效率,在ScanNetv2等数据集上表现优异。

Comments CVPR 2026 Workshop accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01794 2026-08-04 cs.CV cs.AI cs.CL 新提交

Illuminating Visual Identity in Universal Multimodal Embeddings

揭示通用多模态嵌入中的视觉身份

Jiawei Cao, Junyi Feng, Jiashen Hua, Ziheng Huang, Bing Deng, Kaijie Wu, Chaochen Gu, Jieping Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对通用多模态嵌入缺乏视觉身份判别能力的问题,提出视觉身份判别统一形式化,构建MVEB基准,设计身份感知采样的学习框架,提升了UMEs的身份判别能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01730 2026-08-04 cs.CV 新提交

Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliency

学习关注何处与如何判断:具备质量感知显著性的分辨率无关图像质量评估

Hakan Emre Gedik, Shashank Gupta, Alan Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Colorado Boulder(科罗拉多大学博尔德分校)

AI总结 提出基于CLIP的多尺度补丁驱动模型ReLIQS,解决无参考图像质量评估的分辨率适配、计算效率等问题,在多类基准上泛化能力优于主流基线且成本相当或更低。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00356 2026-08-04 cs.CV 新提交

The 1st AI Children Challenge

第一届AI儿童挑战赛

Boyi Li, Yifan Shen, Houze Yang, Xu Cao, Guojun Yun, Li Gao, Turong Chen, Long Xu, Jianguo Cao, Meihuan Huang

机构 * PediaMed AI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Hong Kong Polytechnic University(香港理工大学)

AI总结 该第一届AI儿童挑战赛推出儿童步态视觉分析赛道,设EVGS评分、脑瘫步态模式分类任务,提供对应数据集与真值以推动AI在儿童医疗领域的应用。

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 5564-5570. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27566 2026-07-31 cs.CV 新提交

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA

面向稳健多帧医学视觉问答的目标对齐直接答案监督微调

Site Li, Jianyi Hao, Xiaofeng Liu

机构 * Yale University(耶鲁大学)

AI总结 该研究针对MedFrameQA数据集,提出目标对齐的直接答案SFT是最强稳健适配系列,其在保留报告准确率上优于冻结基线且稳定性好,还可迁移至其他骨干网络,旨在引导研究聚焦稳健优化而非架构复杂度。

Comments Presented at the CVPR 2026 Workshop on Multimodal Foundation Models for Biomedicine: Challenges and Opportunities

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27564 2026-07-31 cs.CV 新提交

Inference-Time Agentic Decision Rules Beat Longer Evolving Search for Multi-Image Medical Reasoning

推理时代理决策规则在多图像医学推理任务中优于更长的进化搜索

Site Li, Jianyi Hao, Xiaofeng Liu

机构 * Yale University(耶鲁大学)

AI总结 本研究对比5种推理时代理策略,发现多图像医学推理中,顺序投票决策规则比扩展进化搜索预算的影响更大,其最终测试准确率显著优于基线及复杂变体。

Comments Presented at the CVPR 2026 Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21619 2026-07-27 cs.CL cs.AI 新提交

Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization

对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱

Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding

机构 * Tsinghua University(清华大学) Harbin Engineering University(哈尔滨工程大学) Shandong University(山东大学) Xidian University(西安电子科技大学)

AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17842 2026-07-21 cs.CV cs.AI 新提交

CaT-GS: Efficient 3DGS Rendering for Large Scale Scenes via Inter-frame Caching and Tile Scheduling

CaT-GS:通过帧间缓存和瓦片调度实现大规模场景的高效3DGS渲染

Tingjia Zhang, Bo Chen, Shengzhong Liu, Fan Wu, Guihai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对3DGS在大规模场景中性能下降问题,CaT-GS提出通过推测性多帧预处理、帧间缓存机制及重构光栅化任务来消除冗余与减轻负载不平衡,实验证明其显著提升渲染速度,为大规模场景高保真实时渲染建立新基准。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17454 2026-07-21 cs.RO 新提交

Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation

通过零样本几何评估实现世界行动模型的测试时缩放

Zesen Zhao, Minkyoung Cho, Hui shen, Boyuan Zheng, Kunxiao Gao, Yulong Cao, Z. Morley Mao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达)

AI总结 研究针对世界行动模型,提出无需训练的选择性测试时缩放框架\methodgated,基于预测未来的跨视图深度重投影一致性排序,经实验验证该方法能提高任务成功率,同时减少额外采样决策点,还识别出相关失败模式。

Comments Extened version of CVPR 2026 EAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16859 2026-07-21 cs.CV 新提交

Dataset Distillation by Influence Matching

通过影响匹配进行数据集蒸馏

Haoru Tan, Wang Wang, Sitong Wu, Xiuzhe Wu, Yangtian Sun, Chirui Chang, Shaofeng Zhang, Xiaojuan Qi

机构 * HKU(香港大学) CUHK(香港中文大学) Stanford(斯坦福大学)

AI总结 从结果角度重审数据集蒸馏,提出影响匹配方法,通过可微估计器量化参数变化,学习合成集使影响与真实数据集匹配,在分类和视觉语言蒸馏任务中表现出色,超越基线。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16351 2026-07-21 cs.CV cs.AI 新提交

Privacy-Aware Synthetic Video Benchmarking and Relational Evaluation for Worker-Under-Suspended-Load Detection

用于悬吊负载下工人检测的隐私感知合成视频基准测试与关系评估

Anshu Singh, Alejandro Seif

机构 * Government Technology Agency of Singapore(新加坡政府科技局)

AI总结 研究悬吊负载下工人检测的隐私问题,引入SynthSite合成视频基准测试及隐私感知混合生成工作流程,在五种隐私条件下评估相关指标,发现保留结构的模糊处理效用更好,强调建筑安全分析隐私评估需兼顾外观抑制和几何线索保留。

Comments Accepted at the 3rd Workshop on Synthetic Data for Computer Vision (SynData4CV), CVPR 2026. OpenReview: https://openreview.net/forum?id=dMfhFmDWsg . Dataset and code: https://huggingface.co/datasets/govtech/SynthSite

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16330 2026-07-21 cs.CV 新提交

Local Brushstroke Quality Assessment via Vision-Language Feedback

通过视觉-语言反馈进行局部笔触质量评估

Mio Mitamura, Hirokatsu Kataoka

机构 * Tokyo Institute of Science High School(东京理科大学附属高中) National Institute of Advanced Industrial Science and Technology (AIST)(国立先进工业科学技术研究所) Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

AI总结 研究多模态语言模型能否评估书法局部笔触质量并生成反馈,构建评估框架让三个模型评估图像对并与专家打分比较,还研究了RAG变体,结果显示模型有一定绝对分数准确性,但与专家排名相关性不强,RAG有正负两方面表现。

Comments 6 pages, 8 figures. Accepted to the SAUAFG Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15418 2026-07-20 cs.AI cs.CV 新提交

DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings

DrawingVQA:建筑图纸上多深度视觉文本推理的真实世界基准测试

Yoonhwa Jung, Junryu Fu, Mani Golparvar-Fard

机构 * Louisiana State University(路易斯安那州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 DrawingVQA针对建筑图纸多深度视觉文本推理设计基准测试,利用图纸与问答对,提出双分类框架评估模型,揭示模型与专家表现差距,为领域特定多模态推理及AI与工程工作流程整合奠定基础。

Comments CVPR 2026 Findings accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14115 2026-07-17 cs.AI cs.CL cs.CV 新提交

DialogueVPR: Towards Conversational Visual Place Recognition

DialogueVPR:迈向对话式视觉场所识别

Yukun Song, Changwei Wang, Xingtian Pei, Shibiao Xu, Wenhao Xu, Shunpeng Chen, Yu Zhang, Ke Zhang, Rongtao Xu, Xuxiang Feng, Pengyang Wang

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Shandong Computer Science Center, Qilu University of Technology(山东省计算中心(国家超级计算济南中心),齐鲁工业大学) Macquarie University(麦考瑞大学) Spatialtemporal AI(时空人工智能公司) University of Macau(澳门大学) Aerospace Information Research Institute(航天信息研究所)

AI总结 研究针对语言引导地理定位中现有方法不足,提出DlgPR,将场所识别转为对话驱动推理过程。构建DlgQuest-Cities基准及统一推理框架,用课程训练DQ-pilot,通过特定指标指导学习并实验,该方法显著优于基线。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12764 2026-07-15 cs.CV 新提交

EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

EvoGraph-R1:用于智能检索的自进化多模态知识超图

Jiashi Lin, Changhong Jiang, Xiangru Lin, Ruifei Zhang, Xinyi Zhu, Jiyao Liu, Cheng Tang, Ye Du, Shujian Gao, Junzhi Ning, Lihao Liu, Ziyan Huang, Tianbin Li, Jin Ye, Junjun He

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Monash University(莫纳什大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

AI总结 研究针对现有GraphRAG方法将知识图视为静态数据结构的局限,提出EvoGraph-R1自进化框架,把检索建模为MDP,智能体通过多种操作使超图结构进化以支持多跳推理,实验证明该方法在多模态问答基准测试中大幅优于现有基线。

Comments 10 pages main paper, 6 figures. CVPR 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11529 2026-07-14 cs.CV 新提交

Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory

解析、搜索与确认:基于思维链推理和结构化空间记忆的免训练空中视觉与对话导航

Yu Qi, Hongyu Li, Shaofei Huang, Tianrui Hui, Yaxiong Wang, Lechao Cheng, Zhun Zhong, Si Liu, Meng Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) Jianghuai Advance Technology Center(江淮先进技术中心) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) University of Macau(澳门大学)

AI总结 研究免训练环境下的空中视觉与对话导航任务,提出PSC - AVDN框架,结合解析 - 搜索 - 确认推理管道与结构化空间记忆,整合多种空间线索,在免训练设置中取得新的最优性能。

Comments 10 pages, 4 figures. Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 23859-23868

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11008 2026-07-14 cs.CV cs.AI 新提交

SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception

SynCLIP:用于鲁棒开放词汇密集感知的同义词一致语言-图像预训练

Mingjie Xie, Guangjun He, Dongli Xu, Youtian Lin, Hongjue Li, Pengming Feng, Jian Guan, Yue Deng

机构 * Beihang University(北京航空航天大学) State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室) Nanjing University(南京大学) Harbin Engineering University(哈尔滨工程大学) Beijing Zhongguancun Academy(北京中关村科学城)

AI总结 研究针对开放词汇密集感知中同义词引起的定位不一致问题,提出SynCLIP框架,通过SSA和SAR模块增强注意力一致性与定位精度,构建SEViC支持预训练,实验证明该方法显著提升定位一致性并达领先性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08745 2026-07-10 cs.AI cs.CV 新提交

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

自动驾驶视觉问答:以事件为中心的行车记录仪理解视觉语言模型基准测试

Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal Kalita

机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校) University of Michigan(密歇根大学) University of Notre Dame(圣母大学)

AI总结 针对评估视觉语言模型对安全关键事件推理能力的挑战,提出AUTOPILOT-VQA基准,通过围绕真实驾驶事件的结构化问题评估系统,涵盖多安全相关类别,推动向安全意识推理发展,为自动驾驶系统评估提供标准,助力相关视觉语言系统开发。

Comments CVPR Autopilot Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07880 2026-07-10 cs.CV 新提交

GIRAF: Towards Generalizable Human Interactions with Articulated Objects

GIRAF:迈向与关节物体的可泛化人类交互

Xiaohan Zhang, Sebastian Starke, Alexander Winkler, Federica Bogo, Samir Aroudj, Yuting Ye

机构 * Meta

AI总结 针对合成与关节物体的逼真全身人类交互难题,现有模型有局限。本文提出文本条件扩散模型,通过以物体为中心的表示、混合域训练策略和基于接触的增强方案应对挑战,实验证明其对未见物体配置泛化能力强,超越现有方法。

Comments 12 pages, 6 figures, 3 tables. Accepted at the Third Workshop on Human Motion Generation (HuMoGen), CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07693 2026-07-09 cs.LG cs.AI cs.CV 新提交

Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF

用于样本高效扩散强化学习从人类反馈中学习的选择性时间步加权和基于优势的重放

Eric Zhu, Abhinav Shrivastava, Soumik Mukhopadhyay

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Maryland, College Park(马里兰大学帕克分校)

AI总结 研究如何提高扩散模型中强化学习从人类反馈的效率,提出选择性时间步加权和基于优势的重放两种互补策略,通过强调信息丰富的时间步和轨迹优化,提升反馈效率,样本效率比基线提高6倍。

Comments 19 pages, 18 figures, 4 tables. Submission under review. A shorter, non-archival 4-page abstract version of this work was accepted to CVPR 2026 Workshops (GCV, CVEU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05850 2026-07-08 cs.CV 新提交

Breaking Spurious Correlations via Generative Randomization and Cross-Variant Self-Supervised Learning

通过生成式随机化和跨变体自监督学习打破虚假相关性

Suraj Yadav, Anjaneya Sharma, Siddharth Yadav

机构 * Indraprastha Institute of Information Technology Delhi(德里英迪拉甘地信息技术学院)

AI总结 研究针对深度神经网络在分布转移时因利用虚假相关性而失败的问题,提出两阶段框架,先通过生成式干预分离前景对象并生成变体,再引入跨变体自监督学习,经微调后在多个基准测试中取得优异最差组性能。

Comments Accepted at CVPR Workshop 2026 GCV

详情

展开后加载摘要…

URL PDF HTML 收藏