机构
*
AI Lab, Qifu Technology(启赋科技AI实验室)
;
College of Future Information Technology, Fudan University(复旦大学未来信息学院)
;
School of Future Technology, South China University of Technology(华南理工大学未来技术学院)
;
Pazhou Lab(琶洲实验室)
CasLayout: Cascaded 3D Layout Diffusion for Indoor Scene Synthesis with Implicit Relation Modeling
CasLayout:基于级联3D布局扩散的室内场景合成与隐式关系建模
Yingrui Wu, Youkang Kong, Mingyang Zhao, Weize Quan, Dong-Ming Yan, Yang Liu
机构
*
MAIS, Institute of Automation, Chinese Academy of Sciences and School of Artificial Intelligence, University of Chinese Academy of Sciences(MAIS,自动化研究所,中国科学院,人工智能学院,中国科学院大学)
;
Tsinghua University(清华大学)
;
SKLMS, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(系统科学研究所,中国科学院)
;
Microsoft Research Asia(微软亚洲研究院)
专题命中
文档图表理解
:vision language model(abstract);分类 cs.CV
InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?
InteractWeb-Bench: 多模态代理能否在交互式网站生成中避免盲目执行?
Qiyao Wang, Haoran Hu, Longze Chen, Hongbo Wang, Hamid Alinejad-Rokny, Yuan Lin, Min Yang
机构
*
Shenzhen Institute of Advanced Technology Chinese Academy of Sciences(深圳先进技术研究院中国科学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Dalian University of Technology(大连理工大学)
;
UNSW Sydney(悉尼大学)
;
Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中
GUI与屏幕智能体
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation
SpaAct:基于课程适应的空间激活转换学习用于视觉语言导航
Pengna Li, Kangyi Wu, Shaoqing Xu, Fang Li, Hanbing Li, Lin Zhao, Kailin Lyu, Long Chen, Zhi-Xin Yang, Nanning Zheng
机构
*
National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室)
;
National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心)
;
Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所)
;
The State Key Laboratory of Internet of Things for Smart City(智能城市物联网国家重点实验室)
;
Centre for Artificial Intelligence and Robotics(人工智能与机器人中心)
;
University of Macau(澳门大学)
;
Xiaomi EV(小i EV)
;
School of Automation(自动化学院)
;
Beijing Institute of Technology(北京理工大学)
;
Institute of Automation(自动化研究所)
;
Chinese Academy of Sciences(中国科学院)
Comments4 pages , 3 figures , This paper has been submitted to the IEEE-affiliated ICBME Conference (Iran), 2025, and is currently under review. DOR number: [20.1001.2.0425023682.1404.10.1.440.7]
机构
*
Shanghai University of Engineering Science(上海工程技术大学)
;
Tencent YouTu Lab(腾讯优图实验室)
;
Clinical Research Unit, Zhongshan Hospital of Fudan University(复旦大学中山医院临床研究部)
专题命中
VLM训练与架构
:multimodal large language model(abstract);分类 cs.CV、cs.AI