机构
*
School of Electrical Engineering, Korea University(韩国大学电气工程学院)
;
Department of Hospital Pathology, The Catholic University of Korea College of Medicine(韩国天主教大学医学院医院病理学系)
Diffusion-Based Material Regularization for Physics-Based Inverse Rendering
基于扩散的材料正则化用于物理逆渲染
Jingwang Ling, Lifan Wu, Feng Xu, Shuang Zhao
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
NVIDIA(英伟达)
;
BNRist and School of Software, Tsinghua University(清华大学软件学院及北京国家信息科学与技术研究中心)
ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs
ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性
Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Huawei Technologies Ltd.(华为技术有限公司)
;
State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)
机构
*
Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院)
;
Unicom Data Intelligence, China Unicom(中国联通联通数据智能)
;
National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)
Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding
Reflect-R1:长视频理解中基于证据驱动的自纠正反思
Shuimu Chen, Yuteng Chen, Yuanshen Guan, Zebang Cheng, Zeyu Zhang, Shengqian Qin, Bin Xia, Jiaran Li, Wenming Yang, Fei Ma
机构
*
Tsinghua University(清华大学)
;
Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))
;
Nanyang Technological University(南洋理工大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Shenzhen University(深圳大学)
;
University of California(加利福尼亚大学)
;
Shanghai Jiao Tong University(上海交通大学)
RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning
RSICCLLM:用于遥感图像变化描述的多模态大语言模型
Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu
机构
*
State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国)
;
Great Bay University, Dongguan, China(东莞Great Bay大学,中国)
;
Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院,中国)
;
Dongguan Key Laboratory for Intelligence and Information Technology, Dongguan, China(东莞智能与信息科技重点实验室,中国)
HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
HAT-4D: 通过人机协作从单目视频提升4D多物体交互
Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yifan Ding, Boran Wen, Li Zhang, Ruiyang Liu, Yong-Lu Li
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
University of Science and Technology of China(中国科学技术大学)
;
Math Magic
TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts
TextDS: 分布偏移下场景文本检测的参数高效表示对齐
Boyuan Chen, Zichen Dang, Chuang Yang, Lap-Pui Chau, Yi Wang
机构
*
School of Electrical Engineering, Xi’an Jiaotong University(西安交通大学电气工程学院)
;
Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系)
There and Back Again: A Flexible-Frame Transformer for Multi-Exposure Fusion
去而复返:用于多曝光融合的灵活帧数Transformer
Lishen Qu, Yao Liu, Shihao Zhou, Jie Liang, Hui Zeng, Lei Zhang, Jufeng Yang
机构
*
Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田))
;
Peng Cheng Laboratory(鹏城实验室)
;
College of Computer Science, Nankai University(南开大学计算机学院)
;
The Hong Kong Polytechnic University(香港理工大学)
;
OPPO Research Institute(OPPO研究院)