机构
*
Tencent Youtu Lab(腾讯云图实验室)
;
Sichuan University(四川大学)
;
University of the Chinese Academy of Sciences(中国科学院大学)
;
Fudan University(复旦大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
;
Nanyang Technological University(南洋理工大学)
专题命中
视觉推理
:visual reasoning(title);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation
Seg-Agent: 无训练语言引导分割的测试时多模态推理
Chao Hao, Jun Xu, Ji Du, Shuo Ye, Ziyue Qiao, Xiaodong Cun, Guangcong Wang, Xubin Zheng, Zitong Yu
机构
*
School of Computing and Information Technology(计算与信息科技学院)
;
Great Bay University(大湾大学)
;
Hangzhou International Innovation Institute(杭州国际创新研究院)
;
Beihang University(北航大学)
;
Department of Computing(计算系)
;
The Hong Kong Polytechnic University(香港理工大学)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)
ChatSR: Multimodal Large Language Models for Scientific Formula Discovery
ChatSR:用于科学公式发现的多模态大语言模型
Yanjie Li, Lina Yu, Weijun Li, Min Wu, Liping Zhang, Jingyi Liu, Yusong Deng, Mingzhu Wan, Xin Ning
机构
*
AnnLab, Institute of Semiconductors, Chinese Academy of Sciences, Beijing, China(安 lab,半导体研究所,中国科学院,北京,中国)
;
School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences, Beijing, China(电子、电气与通信工程学院,中国科学院大学,北京,中国)
;
Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)
;
School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing 101408, China(先进交叉科学学院,中国科学院大学,北京101408,中国)
;
College of Materials Science and Opto-Electronic Technology, University of Chinese Academy of Sciences, Beijing, 100049, China(材料科学与光电技术学院,中国科学院大学,北京100049,中国)
;
School of Integrated Circuits, University of Chinese Academy of Sciences, Beijing 100049, China(集成电路学院,中国科学院大学,北京100049,中国)
专题命中
视觉推理
:multimodal large language model(title,abstract);分类 cs.AI
HCSG: Human-Centric Semantic-Geometric Reasoning for Vision-Language Navigation
HCSG:以人类为中心的语义-几何推理用于视觉-语言导航
Haoxuan Xu, Tianfu Li, Wenbo Chen, Yi Liu, Jin Wu, Huashuo Lei, Yunfan Lou, Lujia Wang, Hesheng Wang, Haoang Li
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Tsinghua University(清华大学)
;
University of Science and Technology Beijing(北京科技大学)
;
National University of Singapore(新加坡国立大学)
;
Shanghai Jiao Tong University(上海交通大学)
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
OPPO AI Center(OPPO AI中心)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV
机构
*
Wuhan University of Technology(武汉理工大学)
;
Tsinghua University(清华大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Shanghai AI Lab(上海人工智能实验室)
;
University of Oxford(牛津大学)
;
INSAIT, Sofia Un. St Kliment Ohridski(索菲亚大学克里门特·欧里迪斯基学院)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs
迈向统一的手术场景理解:通过多模态大语言模型弥合推理与 grounding
Jincai Huang, Shihao Zou, Yuchen Guo, Jingjing Li, Wei Ji, Kai Wang, Shanshan Wang, Weixin Si
机构
*
Southern University of Science and Technology(南方科技大学)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
;
Northwestern University(西北大学)
;
University of Alberta(阿尔伯塔大学)
;
Yale University(耶鲁大学)
;
Nanfang Hospital(南华医院)
;
Shenzhen University of Advanced Technology(深圳大学先进技术研究院)
专题命中
视觉定位与Grounding
:grounding(title,title_cn);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)
;
National Key Laboratory of Data Space Technology and System(数据空间技术与系统国家重点实验室)
;
School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院)
;
College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)
机构
*
Stony Brook University(石溪大学)
;
Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)
;
Stanford University(斯坦福大学)
;
Penn State University(宾夕法尼亚州立大学)
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
GraphThinker: 通过事件图思维强化时间感知的视频推理
Zixu Cheng, Da Li, Jian Hu, Yuhang Zang, Ziquan Liu, Shaogang Gong, Wei Li
机构
*
Queen Mary University of London(伦敦玛丽女王大学)
;
Samsung AI Centre Cambridge(剑桥三星人工智能中心)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Nanyang Technological University(南洋理工大学)
专题命中
视觉定位与Grounding
:grounding(summary_cn,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
机构
*
Chongqing University(重庆大学)
;
Tianjin University(天津大学)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院MAIS)
;
Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局高性能计算研究所)
;
Chongqing National Data AI Research Institute, AI Research Lab(重庆国家数据AI研究院,AI研究实验室)
机构
*
Institute of Information Science and Technologies of the National Research Council (ISTI-CNR)(意大利国家研究理事会信息科学与技术研究所)
;
University of Pisa - Department of Information Engineering(比萨大学信息工程系)