Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation
Seg-Agent: 无训练语言引导分割的测试时多模态推理
Chao Hao, Jun Xu, Ji Du, Shuo Ye, Ziyue Qiao, Xiaodong Cun, Guangcong Wang, Xubin Zheng, Zitong Yu
机构
*
School of Computing and Information Technology(计算与信息科技学院)
;
Great Bay University(大湾大学)
;
Hangzhou International Innovation Institute(杭州国际创新研究院)
;
Beihang University(北航大学)
;
Department of Computing(计算系)
;
The Hong Kong Polytechnic University(香港理工大学)
HCSG: Human-Centric Semantic-Geometric Reasoning for Vision-Language Navigation
HCSG:以人类为中心的语义-几何推理用于视觉-语言导航
Haoxuan Xu, Tianfu Li, Wenbo Chen, Yi Liu, Jin Wu, Huashuo Lei, Yunfan Lou, Lujia Wang, Hesheng Wang, Haoang Li
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Tsinghua University(清华大学)
;
University of Science and Technology Beijing(北京科技大学)
;
National University of Singapore(新加坡国立大学)
;
Shanghai Jiao Tong University(上海交通大学)
Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs
迈向统一的手术场景理解:通过多模态大语言模型弥合推理与 grounding
Jincai Huang, Shihao Zou, Yuchen Guo, Jingjing Li, Wei Ji, Kai Wang, Shanshan Wang, Weixin Si
机构
*
Southern University of Science and Technology(南方科技大学)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
;
Northwestern University(西北大学)
;
University of Alberta(阿尔伯塔大学)
;
Yale University(耶鲁大学)
;
Nanfang Hospital(南华医院)
;
Shenzhen University of Advanced Technology(深圳大学先进技术研究院)
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
GraphThinker: 通过事件图思维强化时间感知的视频推理
Zixu Cheng, Da Li, Jian Hu, Yuhang Zang, Ziquan Liu, Shaogang Gong, Wei Li
机构
*
Queen Mary University of London(伦敦玛丽女王大学)
;
Samsung AI Centre Cambridge(剑桥三星人工智能中心)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Nanyang Technological University(南洋理工大学)
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
SpatialReward: 通过显式空间推理弥合在线强化学习中图像编辑的感知差距
Yancheng Long, Yankai Yang, Hongyang Wei, Wei Chen, Tianke Zhang, Haonan fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang
机构
*
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)
机构
*
Tencent Youtu Lab(腾讯云图实验室)
;
Sichuan University(四川大学)
;
University of the Chinese Academy of Sciences(中国科学院大学)
;
Fudan University(复旦大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
;
Nanyang Technological University(南洋理工大学)
20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone
20/20 Vision Language Models: 通过数据整理单独提升VLMs的方案
DatologyAI, :, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, Aldo Carranza, Alex Fang, Amro Abbas, Anshuman Suri, Brett Larsen, Daniel Zayas, Darren Teh, David Schwab, Diego Kiner, Fan Pan, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Kaleigh Mentzer, Luke Merrick, Maximilian Böther, Parth Doshi, Paul Burstein, Pratyush Maini, Ties Robroek, Tony Jiang, Vidhi Jain, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt