arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-04-27 至 2026-04-27 共收录 5
2604.20834 2026-04-27 cs.RO

PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance

PokeVLA:通过全面的世界知识指导赋能便携式视觉-语言-动作模型

Yupeng Zheng, Xiang Li, Songen Gu, Yuhang Zheng, Shuai Tian, Weize Li, Linbo Wang, Senyu Fei, Pengfei Li, Yinfeng Gao, Zebin Xing, Yilun Chen, Qichao Zhang, Haoran Li, Wenchao Ding

机构 * CASIA(中国科学院自动化研究所) TARS Robotics(TARS机器人实验室) Tsinghua University(清华大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

AI总结 本文提出PokeVLA,一种轻量但强大的具身体验模型,通过预训练视觉语言模型和多视角目标感知学习提升机器人操作效率与空间认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22542 2026-04-27 cs.CL cs.AI

Controllable Spoken Dialogue Generation: An LLM-Driven Grading System for K-12 Non-Native English Learners

可控的口语对话生成:一种基于LLM的评分系统用于K-12非母语英语学习者

Haidong Yuan, Haokun Zhao, Wanshi Xu, Songjun Cao, Qingyu Zhou, Long Ma, Hongjie Fan

机构 * Peking University(北京大学) Tencent(腾讯) China University of Political Science and Law(中国政法大学) Independent Researcher(独立研究者) Fudan University(复旦大学)

AI总结 本文提出一种基于LLM的评分系统,通过四级分级系统控制词汇复杂度,提升非母语K-12英语学习者的口语对话质量与教学价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22506 2026-04-27 cs.CV

ICPR 2026 Competition on Low-Resolution License Plate Recognition

ICPR 2026 关于低分辨率车牌识别的比赛

Rayson Laroca, Valfride Nascimento, Donggun Kim, Sanghyeok Chung, Subin Bae, Uihwan Seo, Seungsang Oh, Chi M. Phung, Minh G. Vo, Xingsong Ye, Yongkun Du, Yuchen Su, Zhineng Chen, Sunhee Heo, Hyangwoo Lee, Kihyun Na, Khanh V. Vu Nguyen, Sang T. Pham, Duc N. N. Phung, Trong P. Le, Vy N. Vo Tran, David Menotti

机构 * Federal University of Paraná, Brazil(巴西南里奥格兰德联邦大学) Pontifical Catholic University of Paraná, Brazil(巴西帕尔米拉天主教大学) Korea University, Republic of Korea(韩国釜山大学) University of Information Technology, Vietnam(越南信息科技大学) Ho Chi Minh University of Technology, Vietnam(越南胡志明技术大学) Vietnam National University, Vietnam(越南国家大学) Fudan University, China(复旦大学) Shanghai Key Laboratory of Multimodal Embodied AI, China(上海多模态具身人工智能重点实验室) Handong Global University, Republic of Korea(韩国韩东全球大学)

AI总结 本文介绍了ICPR 2026低分辨率车牌识别比赛,通过LRLPR-26数据集评估了269支队伍的性能,揭示了该任务的挑战性和研究趋势。

Comments Accepted for presentation at the International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10093 2026-04-27 cs.LG cs.AI q-bio.QM

Equivariant Asynchronous Diffusion: An Adaptive Denoising Schedule for Accelerated Molecular Conformation Generation

等变异步扩散:一种适应性去噪时间表用于加速分子构象生成

Junyi An, Chao Qu, Yun-Fei Shi, Zhijian Zhou, Fenglei Cao, Yuan Qi

机构 * Shanghai Academy of Artificial Intelligence for Science, SAIS(上海人工智能科学研究院,SAIS) College of Chemistry and Chemical Engineering, Xiamen University(厦门大学化学与化工学院) Artificial Intelligence Innovation and Incubation (AI 3 ) Institute, Fudan University(复旦大学人工智能创新与孵化(AI 3)研究院)

AI总结 本文提出等变异步扩散模型,结合异步去噪时间表与分子级时间表,有效捕捉分子层次结构,提升3D分子生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21435 2026-04-27 cs.AI

Graph-to-Vision: Multi-graph Understanding and Reasoning using Vision-Language Models

图到视觉:利用视觉-语言模型进行多图理解与推理

Qihang Ai, Ruizhou Li, Menghui Wang, Haiyun Jiang

机构 * Nanyang Technological University(南洋理工大学) Shandong University(山东大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出首个评估和提升视觉语言模型多图推理能力的基准,涵盖四种常见图类型并支持复杂任务,评估了多种先进模型并验证了数据集的有效性。

Comments 26 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏