ASSCG: Just-Right Gating over Chattering for Fast-Slow LLM Planning in Autonomous Driving
ASSCG:自动驾驶中快慢LLM规划的恰到好处门控
Sining Ang, Yuan Chen, Liu Haiyan, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang
机构
*
Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
;
Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系)
;
Beijing University of Aeronautics and Astronautics(北京航空航天大学)
;
Lenovo Group Limited(联想集团)
P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling
P-MTP: 通过渐进深度缩放的多令牌预测实现高效文档解析
Le Xiang, Chenxi Zhai, Shu Wei, Jingjing Wu, Qunyi Xie, Xiao Tan, Kunbin Chen, Wei He
机构
*
Department of Computer Vision Technology (VIS) Baidu Inc China(百度计算机视觉技术部(VIS))
;
Tsinghua University Shenzhen International Graduate School China(清华大学深圳国际研究生院)
GTA-Net: Cooperative Game Theory for Vision-Language Alignment in Chest X-Ray Report Generation
GTA-Net:合作博弈论在胸部X光报告生成中的视觉-语言对齐
Saif ur Rehman Khan, Imad Ahmed Waqar, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim
机构
*
Department of Computer Science, Rhineland-Palatinate Technical University of Kaiserslautern-Landau(莱茵兰-普法尔茨凯泽斯劳滕-兰道工业大学计算机科学系)
;
German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)
;
IntelligentX GmbH
Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think
微调视觉-语言-动作模型所需的层数比你想象的少
Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha, Khoa Vo, Philip Lund Møller, Quang T. Nguyen, Long Dinh, Tung M. Luu, Tuan Dam, Vu Duong, Trung Le, Nghi D. Q. Bui, Minh Vu, Tran Nguyen Le, An Thai Le, Ngan Le, Daniel Sonntag, James Zou, Jan Peters, Duy M. H. Nguyen, Ngo Anh Vien
机构
*
Center for AI Research, VinUniversity(VinUniversity人工智能研究中心)
;
VinRobotics
;
University of Arkansas(阿肯色大学)
;
Technical University of Denmark(丹麦技术大学)
;
Hanoi University of Science and Technology(河内科技大学)
;
KAIST(韩国科学技术院)
;
Monash University(莫纳什大学)
;
Oldenburg University(奥尔登堡大学)
;
DFKI(德国人工智能研究中心)
;
University of Stuttgart(斯图加特大学)
;
IMPRS-IS(国际马克斯·普朗克智能系统研究学院)
;
Stanford University(斯坦福大学)
;
Technische Universität Darmstadt(达姆施塔特工业大学)
Ying Shen, Zhiyang Xu, Jiuhai Chen, Shizhe Diao, Jiaxin Zhang, Yuguang Yao, Joy Rimchala, Ismini Lourentzou, Lifu Huang
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
University of Maryland(马里兰大学)
;
Nvidia(英伟达)
;
Salesforce AI Research(Salesforce AI研究)
;
Intuit AI Research(Intuit AI研究)
机构
*
Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(韩国科学技术院赵春植移动研究生院)
;
Department of Mechanical Engineering, Hanyang University(汉阳大学机械工程系)
;
Narnia Labs(纳尼亚实验室)
机构
*
University of Central Florida(中央佛罗里达大学)
;
BITS Pilani(比特斯理工学院)
;
Ho Chi Minh City University of Science(胡志明市科学大学)
;
Amazon GenAI Project(亚马逊生成人工智能项目)
CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning
CapRL++:基于可验证奖励的统一强化学习用于密集图像和视频描述生成
Penghui Yang, Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Yibin Wang, Yujie Zhou, Jiazi Bu, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin
机构
*
Tsinghua University(清华大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Microsoft(微软)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Shanghai Innovation Institute(上海创新研究院)
;
Alibaba Cloud(阿里云)
;
The Chinese University of Hong Kong(香港中文大学)
专题命中
VLM训练与架构
:vision-language model(abstract);visual language model(abstract);分类 cs.CV