LA4VLA: Learning to Act without Seeing via Language-Action Pretraining
LA4VLA:通过语言-动作预训练实现无视觉行动学习
Tao Lin, Yuxin Du, Yiran Mao, Zewei Ye, Yilei Zhong, Bing Cheng, Yiming Wang, Jiting Liu, Yang Tian, Junchi Yan, Feiran Wu, Zenan Meng, Hu Wei, Yuqian Fu, Gen Li, Bo Zhao
机构
*
School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)
;
Alibaba Group(阿里巴巴集团)
;
Nanyang Technological University(南洋理工大学)
;
KAUST(阿卜杜拉国王科技大学)
RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning
RSICCLLM:用于遥感图像变化描述的多模态大语言模型
Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu
机构
*
State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国)
;
Great Bay University, Dongguan, China(东莞Great Bay大学,中国)
;
Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院,中国)
;
Dongguan Key Laboratory for Intelligence and Information Technology, Dongguan, China(东莞智能与信息科技重点实验室,中国)
专题命中
指令微调
:language model(title,abstract);large language model(title);post-training(abstract);preference optimization(abstract)
Comments17 pages (8 pages main text), 5 figures, 9 tables. Accepted to the AI for Law Workshop at the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea
机构
*
South China University of Technology, China(华南理工大学,中国)
;
Huya Inc., China(欢丫公司,中国)
;
Tongyi Fun Team, Alibaba Group, China(通义 Fun 团队,阿里巴巴集团,中国)
;
Foshan University, China(佛山大学,中国)
专题命中
指令微调
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography
EchoSonar-R: 一种用于超声心动图疾病分类和报告生成的多视图推理增强模型
Darya Taratynova, Ahmed Aly, Numan Saeed, Mohammad Yaqub
机构
*
Division of Computing and Mathematical Sciences, Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学计算与数学科学系,阿布扎比,阿联酋)
ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering
ProMSA: 渐进式多模态搜索智能体用于基于知识的视觉问答
ZhengXian Wu, Hangrui Xu, Kai Shi, Zhuohong Chen, Yunyao Yu, Chuanrui Zhang, Zirui Liao, Jun Yang, Zhenyu Yang, Haonan Lu, Haoqian Wang
机构
*
OPPO AI Center, OPPO Inc. China(OPPO AI中心,OPPO公司)
;
The Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
Nanyang Technological University, Singapore(新加坡南洋理工大学)
TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts
TextDS: 分布偏移下场景文本检测的参数高效表示对齐
Boyuan Chen, Zichen Dang, Chuang Yang, Lap-Pui Chau, Yi Wang
机构
*
School of Electrical Engineering, Xi’an Jiaotong University(西安交通大学电气工程学院)
;
Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系)