arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2407
2506.08001 2025-12-12 cs.LG cs.AI cs.CL

Reparameterized LLM Training via Orthogonal Equivalence Transformation

通过正交等价变换重新参数化LLM训练

Zeju Qiu, Simon Buchholz, Tim Z. Xiao, Maximilian Dax, Bernhard Schölkopf, Weiyang Liu

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) The Chinese University of Hong Kong(香港中文大学)

AI总结 POET通过正交等价变换重新参数化神经元,提升LLM训练的稳定性与泛化能力,并验证了其在大规模神经网络训练中的有效性。

Comments NeurIPS 2025 (40 pages, 26 figures, project page: https://spherelab.ai/poet/, v4: added experiments of finetuning and larger-scale pretraining)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09616 2025-12-11 cs.CV cs.AI cs.CL cs.LG

Rethinking Chain-of-Thought Reasoning for Videos

重新思考视频中的链式推理

Yiwu Zhong, Zi-Yuan Hu, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本研究提出了一种高效的视频推理框架,通过简洁推理和减少的视觉标记提升推理效率和性能,无需依赖传统CoT注释或监督微调。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07596 2025-12-11 cs.CV cs.RO

More than Segmentation: Benchmarking SAM 3 for Segmentation, 3D Perception, and Reconstruction in Robotic Surgery

超越分割:在机器人手术中评估SAM 3用于分割、3D感知和重建的基准测试

Wenzhen Dong, Jieming Yu, Yiming Huang, Hongqiu Wang, Lei Zhu, Albert C. S. Chung, Hongliang Ren, Long Bai

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Technical University of Munich(慕尼黑技术大学)

AI总结 本文评估了SAM 3在机器人手术中的分割、3D感知和重建能力,展示了其在动态视频跟踪中的有效性,同时指出了基于语言提示的局限性及进一步改进的必要性。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18309 2025-12-11 stat.ML cs.LG eess.SP

Efficient Transformed Gaussian Process State-Space Models for Non-Stationary High-Dimensional Dynamical Systems

高效变换高斯过程状态空间模型用于非平稳高维动态系统

Zhidi Lin, Ying Li, Feng Yin, Juan Maroñas, Alexandre H. Thiéry

机构 * Department of Statistics and Actuarial Science, University of Hong Kong(统计与精算科学系,香港大学) Department of Statistics and Data Science, National University of Singapore(统计与数据科学系,新加坡国立大学) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(人工智能学院,香港中文大学(深圳)) Machine Learning Group, Universidad Autónoma de Madrid(马德里自治大学机器学习组)

AI总结 本文提出ETGPSSM,通过整合共享GP与输入依赖的归一化流,实现高效建模高维非平稳动态系统,提升计算效率和预测精度。

Comments IEEE Transactions on Signal Processing (16 pages, 6 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08765 2025-12-10 cs.CV

Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance

Wan-Move:通过潜在轨迹引导实现可动视频生成

Ruihang Chu, Yefei He, Zhekai Chen, Shiwei Zhang, Xiaogang Xu, Bin Xia, Dingdong Wang, Hongwei Yi, Xihui Liu, Hengshuang Zhao, Yu Liu, Yingya Zhang, Yujiu Yang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Tsinghua University(清华大学) HKU(香港大学) CUHK(香港中文大学)

AI总结 Wan-Move通过潜在轨迹引导实现视频生成的精确运动控制,无需修改架构即可提升运动可控性。

Comments NeurlPS 2025. Code and data available at https://github.com/ali-vilab/Wan-Move

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08673 2025-12-10 cs.CV

Dual-Branch Center-Surrounding Contrast: Rethinking Contrastive Learning for 3D Point Clouds

双分支中心-周围对比:重新思考3D点云中的对比学习

Shaofeng Zhang, Xuanqi Chen, Xiangdong Zhang, Sitong Wu, Junchi Yan

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出双分支中心-周围对比框架,通过双分支输入和补丁级对比损失,提升3D点云对比学习性能,达到SOTA效果。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08500 2025-12-10 cs.GR cs.CV

Learning to Control Physically-simulated 3D Characters via Generating and Mimicking 2D Motions

通过生成和模仿2D动作来学习控制物理模拟的3D角色

Jianan Li, Xiao Chen, Tao Huang, Tien-Tsin Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Monash University(墨尔本大学)

AI总结 Mimic2DM通过生成和模仿2D动作直接学习控制物理模拟的3D角色,无需依赖3D运动数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08358 2025-12-10 cs.CV

TrackingWorld: World-centric Monocular 3D Tracking of Almost All Pixels

TrackingWorld: 以世界为中心的单目3D像素跟踪

Jiahao Lu, Weitao Xiong, Jiacheng Deng, Peng Li, Tianyu Huang, Zhiyang Dou, Cheng Lin, Sai-Kit Yeung, Yuan Liu

机构 * HKUST(香港科技大学) USTC(中国科学技术大学) CUHK(香港中文大学) HKU(香港大学) XMU(厦门大学) MUST(澳门科技大学)

AI总结 TrackingWorld提出了一种以世界为中心的单目3D像素跟踪方法,通过上采样器和优化框架实现对视频中几乎所有像素的密集3D跟踪。

Comments Accepted by NeurIPS 2025. Project Page: https://igl-hkust.github.io/TrackingWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07720 2025-12-10 cs.CV

ViSA: 3D-Aware Video Shading for Real-Time Upper-Body Avatar Creation

ViSA: 一种3D感知的视频着色方法用于实时上半身数字人生成

Fan Yang, Heyuan Li, Peihao Li, Weihao Yuan, Lingteng Qiu, Chaoyue Song, Cheng Chen, Yisheng He, Shifeng Zhang, Xiaoguang Han, Steven Hoi, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tongyi Lab, Alibaba Group(阿里云实验室)

AI总结 ViSA结合3D重建与视频生成技术,实时生成高质量上半身数字人,减少模糊和僵硬问题,提升视觉质量。

Comments Project page: \url{https://lhyfst.github.io/visa}

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00518 2025-12-10 cs.CV cs.CL

Fine-grained Spatiotemporal Grounding on Egocentric Videos

细粒度眼动视频时空定位

Shuo Liang, Yiwu Zhong, Zi-Yuan Hu, Yeyao Tao, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出EgoMask基准和EgoMask-Train数据集,针对眼动视频细粒度时空定位的挑战,通过微调提升模型性能。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22930 2025-12-10 cs.CV

Towards Explainable Bilingual Multimodal Misinformation Detection and Localization

迈向可解释的双语多模态虚假信息检测与定位

Yiwei He, Zhenglin Huang, Haiquan Wen, Tianxiao Li, Yi Dong, Hao Fei, Baoyuan Wu, Guangliang Cheng

机构 * University of Liverpool, United Kingdom(利物浦大学) National University of Singapore, Singapore(新加坡国立大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

AI总结 BiMi提出双语多模态框架,通过联合定位、一致性检测和自然语言解释,提升多语言虚假信息检测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07831 2025-12-09 cs.CV

UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation

UnityVideo: 一体化多模态多任务学习以增强世界感知视频生成

Jiehui Huang, Yuechen Zhang, Xu He, Yuan Gao, Zhi Cen, Bin Xia, Yan Zhou, Xin Tao, Pengfei Wan, Jiaya Jia

机构 * HKUST(香港科技大学) CUHK(香港中文大学) Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

AI总结 UnityVideo通过一体化多模态多任务学习提升视频生成的世界感知能力,引入动态噪声化和模态切换器,实现更全面的世界知识表示。

Comments Project Website https://jackailab.github.io/Projects/UnityVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07747 2025-12-09 cs.CV

Unison: A Fully Automatic, Task-Universal, and Low-Cost Framework for Unified Understanding and Generation

Unison: 一个完全自动、任务通用且低成本的统一理解和生成框架

Shihao Zhao, Yitong Chen, Zeyinzi Jiang, Bojia Zi, Shaozhe Hao, Yu Liu, Chaojie Mao, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 Unison提出一个低成本、全自动的多模态理解和生成框架,通过两阶段方案实现任务自适应,覆盖多种理解和生成任务,提升生成质量与自动化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07136 2025-12-09 cs.CV cs.AI

A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning

大规模多模态数据集与基准用于人类活动场景理解和推理

Siyang Jiang, Mu Yuan, Xiang Ji, Bufang Yang, Zeyu Liu, Lilin Xu, Yang Li, Yuting He, Liran Dong, Wenrui Lu, Zhenyu Yan, Xiaofan Jiang, Wei Gao, Hongkai Chen, Guoliang Xing

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of Pittsburgh(匹兹堡大学)

AI总结 CUHK-X是一个大规模多模态数据集和基准,用于人类活动场景理解和推理,通过生成逻辑一致的活动序列提升描述一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06921 2025-12-09 cs.CV cs.AI cs.CL

NeuroABench: A Multimodal Evaluation Benchmark for Neurosurgical Anatomy Identification

NeuroABench: 一种多模态评估基准,用于神经外科解剖识别

Ziyang Song, Zelin Zang, Xiaofan Ye, Boqiang Xu, Long Bai, Jinlin Wu, Hongliang Ren, Hongbin Liu, Jiebo Luo, Zhen Lei

机构 * Hong Kong Institute of Science and Innovation(香港科学与创新研究院) The University of Hong Kong-Shenzhen Hospital(香港大学深圳医院) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

AI总结 NeuroABench是首个用于评估神经外科领域解剖理解的多模态基准,通过实验揭示了MLLMs在解剖识别任务中的局限性,并展示了人类表现与模型之间的差距。

Comments Accepted by IEEE ICIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09620 2025-12-09 cs.CV cs.AI cs.CL

Exploring the Potential of Encoder-free Architectures in 3D LMMs

探索无编码器架构在3D大语言模型中的潜力

Yiwen Tang, Zoey Guo, Zhuhao Wang, Ray Zhang, Qizhi Chen, Junli Liu, Delin Qu, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Tele AI

AI总结 本文提出首个无编码器3D大语言模型ENEL,通过嵌入语义编码和分层几何聚合策略,在3D理解任务中达到与SOTA模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06533 2025-12-09 cs.LG cs.AI

Beyond Token-level Supervision: Unlocking the Potential of Decoding-based Regression via Reinforcement Learning

超越标记级监督:通过强化学习解锁解码回归的潜力

Ming Chen, Sheng Tang, Rong-Xi Tan, Ziniu Li, Jiacheng Chen, Ke Xue, Chao Qian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学)

AI总结 本文提出通过强化学习提升基于解码的回归性能,引入序列级信号以提高预测精度和采样效率,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06506 2025-12-09 econ.GN cs.AI q-fin.EC stat.AP

AI as "Co-founder": GenAI for Entrepreneurship

AI作为'联合创始人':生成式人工智能与创业

Junhui Jeff Cai, Xian Gu, Liugang Sheng, Mengjia Xia, Linda Zhao, Wu Zhu

机构 * Mendoza College of Business, University of Notre Dame(诺丁汉大学梅森商学院) Department of Finance, Durham University Business School(杜伦大学商学院金融系) Department of Economics, The Chinese University of Hong Kong(香港中文大学经济系) Department of Economics, The University of Pennsylvania(宾夕法尼亚大学经济系) Wharton School, The University of Pennsylvania(宾夕法尼亚大学沃顿商学院) Department of Finance, SEM, Tsinghua University(清华大学经济管理学院金融系)

AI总结 本文研究生成式人工智能对创业的影响,发现其通过促进小企业创立,增强了市场竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06422 2025-12-09 cs.CV

A Perception CNN for Facial Expression Recognition

用于面部表情识别的感知CNN

Chunwei Tian, Jingyuan Xie, Lingjun Li, Wangmeng Zuo, Yanning Zhang, David Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学) School of Software, Northwestern Polytechnical University(软件学院,西北工业大学) School of Software, Zhengzhou University of Light Industry(软件学院,郑州轻工业学院) School of Computer Science, Northwestern Polytechnical University(计算机科学学院,西北工业大学) School of Science and Engineering, Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳))

AI总结 本文提出了一种用于面部表情识别的感知CNN,通过多域交互机制和两阶段损失函数提升识别性能。

Comments in IEEE Transactions on Image Processing (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00781 2025-12-09 cs.AI

CoP: Agentic Red-teaming for Large Language Models using Composition of Principles

CoP: 用于大型语言模型的代理式红队测试:原理组合

Chen Xiong, Pin-Yu Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong Sha Tin, Hong Kong(香港中文大学(深圳)) IBM Research New York, USA(IBM纽约研究院)

AI总结 CoP通过原理组合框架实现LLMs红队测试自动化,发现新型jailbreak提示并显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22634 2025-12-09 cs.RO cs.SE

LabUtopia: High-Fidelity Simulation and Hierarchical Benchmark for Scientific Embodied Agents

LabUtopia:高保真模拟与分层基准用于科学具身智能体

Rui Li, Zixuan Hu, Wenxi Qu, Jinouwen Zhang, Zhenfei Yin, Sha Zhang, Xuantuo Huang, Hanqing Wang, Tai Wang, Jiangmiao Pang, Wanli Ouyang, Lei Bai, Wangmeng Zuo, Ling-Yu Duan, Dongzhan Zhou, Shixiang Tang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Oxford(牛津大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学)

AI总结 LabUtopia通过高保真模拟和分层基准推动实验室环境中具身智能的发展。

Comments Accepted by NeurIPS 2025 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06861 2025-12-09 cs.LG cs.AI eess.SP

CSI-BERT2: A BERT-inspired Framework for Efficient CSI Prediction and Classification in Wireless Communication and Sensing

CSI-BERT2:一种基于BERT的高效CSI预测与分类框架,用于无线通信与传感

Zijian Zhao, Fanyi Meng, Zhonghao Lyu, Hang Li, Xiaoyang Li, Guangxu Zhu

机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Department of Electrical and Electronic Engineering(电子与电气工程系) Department of Information Science and Engineering(信息科学与工程系) KTH Royal Institute of Technology(皇家理工学院)

AI总结 CSI-BERT2基于BERT提出,通过双向自注意力机制和改进的结构,实现高效CSI预测与分类,适用于无线通信与传感场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05965 2025-12-08 cs.CV

EditThinker: Unlocking Iterative Reasoning for Any Image Editor

EditThinker: 解锁任何图像编辑器的迭代推理

Hongyu Li, Manyuan Zhang, Dian Zheng, Ziyu Guo, Yimeng Jia, Kaituo Feng, Hao Yu, Yexin Liu, Yan Feng, Peng Pei, Xunliang Cai, Linjiang Huang, Hongsheng Li, Si Liu

机构 * Beihang University(北航大学) Meituan(美团) CUHK MMLab CUHK IMIXR Tsinghua University(清华大学)

AI总结 EditThinker通过迭代推理框架提升图像编辑指令遵循能力,利用强化学习优化编辑过程,显著提高模型性能。

Comments Project page: https://appletea233.github.io/think-while-edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05811 2025-12-08 cs.LG cs.AI

MOSS: Efficient and Accurate FP8 LLM Training with Microscaling and Automatic Scaling

MOSS:基于微缩和自动缩放的高效准确FP8大语言模型训练

Yu Zhang, Hui-Ling Zhen, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab, Huawei(华为诺亚实验室)

AI总结 MOSS通过微缩和自动缩放技术,实现高效准确的FP8大语言模型训练,提升训练吞吐量34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05578 2025-12-08 cs.RO

A Hyperspectral Imaging Guided Robotic Grasping System

基于超光谱成像的机器人抓取系统

Zheng Sun, Zhipeng Dong, Shixiong Wang, Zhongyi Chu, Fei Chen

机构 * Department of Mechanical and Automation Engineering, T-Stone Robotics Institute, The Chinese University of Hong Kong, Hong Kong SAR(机械与自动化工程系,T-Stone机器人研究所,香港中文大学,香港特别行政区) School of Instrumentation and Optoelectronic Engineering, Beihang University(仪器与光电工程学院,北航大学)

AI总结 本文提出一种基于超光谱成像的机器人抓取系统,通过PRISM和SpectralGrasp框架提升纺织品识别和分拣效率。

Comments 8 pages, 7 figures, Accepted to IEEE Robotics and Automation Letters (RA-L) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05511 2025-12-08 cs.CV

Rethinking Infrared Small Target Detection: A Foundation-Driven Efficient Paradigm

重新思考红外小目标检测:一种基础驱动的高效范式

Chuang Yu, Jinmiao Zhao, Yunpeng Liu, Yaokun Li, Xiujun Shu, Yuanhao Feng, Bo Wang, Yimian Dai, Xiangyu Yue

机构 * Key Laboratory of Opto-Electronic Information Processing, Chinese Academy of Sciences(光电信息处理重点实验室,中国科学院) Shenyang Institute of Automation, Chinese Academy of Sciences(沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Sun Yat-sen University(中山大学) Tencent(腾讯) Nankai University(南开大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

AI总结 本文提出FDEP范式,通过基础模型冻结表示与任务特征融合,提升红外小目标检测精度,构建综合评估指标,实现多数据集SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05112 2025-12-05 cs.CV cs.AI cs.CL cs.LG

DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation

DraCo: 文本到图像预览与稀有概念生成的草稿作为CoT

Dongzhi Jiang, Renrui Zhang, Haodong Li, Zhuofan Zong, Ziyu Guo, Jun He, Claire Guo, Junyan Ye, Rongyao Fang, Weijia Li, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学 MMLab) CUHK IMIXR(香港中文大学 IMIXR) Sun Yat-Sen University(中山大学) SCUT(华南理工大学) CUHK (Shenzhen)(香港中文大学(深圳))

AI总结 DraCo通过结合文本和视觉内容的交错推理,提升文本到图像生成的精度和稀有概念生成能力。

Comments Project Page: https://github.com/CaraJ7/DraCo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05111 2025-12-05 cs.CV

ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning

ARM-Thinker: 通过智能工具使用和视觉推理强化多模态生成奖励模型

Shengyuan Ding, Xinyu Fang, Ziyu Liu, Yuhang Zang, Yuhang Cao, Xiangyu Zhao, Haodong Duan, Xiaoyi Dong, Jianze Liang, Bin Wang, Conghui He, Dahua Lin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 ARM-Thinker通过智能工具使用和视觉推理提升多模态奖励模型的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05091 2025-12-05 cs.CV

Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark

视觉推理追踪器:对象级 grounded 推理基准

Haobo Yuan, Yueyi Sun, Yanwei Li, Tao Zhang, Xueqing Deng, Henghui Ding, Lu Qi, Anran Wang, Xiangtai Li, Ming-Hsuan Yang

机构 * UC Merced(加州大学默塞德分校) PKU(北京大学) NTU(国立台湾大学) CUHK(香港中文大学) WHU(武汉大学) FDU(福建大学)

AI总结 本文提出视觉推理追踪器任务,通过对象级 grounded 推理基准评估模型的推理路径生成能力,并引入了新的评估指标和大规模数据集提升模型推理表现。

Comments Technical Report; Project Page: https://harboryuan.github.io/visual-reasoning-tracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04985 2025-12-05 stat.ML cs.LG math.ST stat.TH

Towards a unified framework for guided diffusion models

迈向引导扩散模型的统一框架

Yuchen Jiao, Yuxin Chen, Gen Li

机构 * Department of Statistics, the Chinese University of Hong Kong, Hong Kong(香港中文大学统计学系) Department of Statistics and Data Science, the Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院统计学与数据科学系)

AI总结 本文提出统一框架,通过引入奖励引导项提升扩散模型奖励表现,并首次理论化无分类器引导的性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏