arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-04-06 至 2026-04-06 共收录 9
2604.03179 2026-04-06 cs.LG cs.AI cs.CV

Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models

理解强化学习在多模态推理模型后训练中幻觉的作用

Gengwei Zhang, Jie Peng, Zhen Tan, Mufan Qiu, Hossein Nourkhiz Mahjoub, Vaishnav Tadiparthi, Kwonjoon Lee, Yanyong Zhang, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Science and Technology of China(中国科学技术大学) Arizona State University(亚利桑那州立大学) Honda Research Institute, USA(本田美国研究所)

AI总结 本文提出Hallucination-as-Cue框架,通过引入模态特异性扰动分析强化学习对多模态推理模型的影响,揭示幻觉在训练中的关键作用,挑战现有假设。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02973 2026-04-06 cs.CV

Exploring Motion-Language Alignment for Text-driven Motion Generation

探索文本与运动对齐以实现文本驱动的运动生成

Ruxi Gu, Zilei Wang, Wei Wang

机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院)

AI总结 本文提出MLA-Gen框架,通过整合全局运动先验与局部条件,提升文本驱动运动生成的对齐精度,并引入SinkRatio指标解决注意力集中问题,提升运动质量和语义对齐。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02934 2026-04-06 cs.CV

PolyReal: A Benchmark for Real-World Polymer Science Workflows

PolyReal:一个用于现实世界聚合物科学工作流程的基准

Wanhao Liu, Weida Wang, Jiaqing Xie, Suorong Yang, Jue Wang, Benteng Chen, Guangtao Mei, Zonglin Yang, Shufei Zhang, Yuchun Mo, Lang Cheng, Jin Zeng, Houqiang Li, Wanli Ouyang, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Tongji University(同济大学) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 PolyReal是一个新的多模态基准,用于评估大规模语言模型在聚合物实验全流程中的能力,揭示了模型在实践任务上的不足,填补了评估空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02860 2026-04-06 cs.CV cs.AI

A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos

范式转变:面向视频中的时序句子定位的端到端训练

Allen He, Qi Liu, Kun Liu, Xinchen Liu, Wu Liu

机构 * BASIS International School Park Lane Harbour(贝赛思国际学校(公园港)) UCAS(中国科学院大学) JD Explore Academy(京东探索研究院) USTC(中国科学技术大学)

AI总结 本文提出一种端到端训练范式,联合优化视频主干网络和定位头,通过引入Sentence Conditioned Adapter提升视觉表征,实验表明优于现有方法。

Comments Accepted as CVPR 2026 Workshop PVUW

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26535 2026-04-06 cs.AI

PAPO: Stabilizing Rubric Integration Training via Decoupled Advantage Normalization

PAPO:通过解耦优势归一化稳定规则整合训练

Zelin Tan, Zhouliang Yu, Bohan Lin, Zijie Geng, Hejia Geng, Yudong Zhang, Mulei Zhang, Yang Chen, Shuyue Hu, Zhenfei Yin, Chen Zhang, Lei Bai

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) University of Oxford(牛津大学) Wuhan University(武汉大学)

AI总结 PAPO通过解耦优势归一化整合过程级评估,解决现有奖励设计的两个局限:Outcome Reward Models(ORM)仅评估最终答案正确性,而Process Reward Models(PRM)虽监督更丰富但易导致奖励黑客。

Comments 16 Pages,9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08980 2026-04-06 cs.CV cs.AI

Training Multi-Image Vision Agents via End2End Reinforcement Learning

通过端到端强化学习训练多图像视觉代理

Chengqi Dong, Chuhuai Yue, Hang He, Rongge Mao, Fenghe Tang, S Kevin Zhou, Zekun Xu, Xiaohan Wang, Jiajun Chai, Guojun Yin

机构 * MeiTuan(美团) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出IMAgent,通过端到端强化学习训练视觉代理,解决多图像问答任务中的输入限制问题,通过设计视觉反思和验证工具提升模型注意力,首次从注意力角度揭示工具使用对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01770 2026-04-06 cs.RO

Lightweight Learning from Actuation-Space Demonstrations via Flow Matching for Whole-Body Soft Robotic Grasping

通过流匹配实现的基于动作空间的轻量学习:用于全身软机器人抓取

Liudi Yang, Yang Bai, Yuhao Wang, Ibrahim Alsarraj, Gitta Kutyniok, Zhanchi Wang, Ke Wu

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) University of Science and Technology of China (USTC)(中国科学技术大学) University of Freiburg(弗莱堡大学) Ludwig Maximilian University of Munich (LMU Munich)(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

AI总结 本文提出一种轻量级动作空间学习框架,通过流匹配模型直接从确定性演示中推断分布控制表示,实现全身软机器人抓取的高效学习,仅需30次演示即可达到97.5%的成功率,并在动态调整时保持稳定性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03198 2026-04-06 cs.CV cs.AI

FLEX: A Largescale Multimodal, Multiview Dataset for Learning Structured Representations for Fitness Action Quality Assessment

FLEX:一个大规模多模态、多视角数据集,用于学习结构化表示以评估健身动作质量

Hao Yin, Lijun Gu, Paritosh Parmar, Lin Xu, Tianxiao Guo, Xiujin Liu, Weiwei Fu, Yang Zhang, Tianyou Zheng

机构 * School of Biomedical Engineering (Suzhou), USTC(中国科学技术大学苏州生物医学工程学院) Suzhou Institute of Biomedical Engineering and Technology, CAS(中国科学院苏州生物医学工程技术研究所) Institute of High-Performance Computing, A*STAR, Singapore(新加坡科技研究局高性能计算研究所) School of Psychology, Beijing Sports University(北京体育大学心理学院) School of Competitive Sports, Beijing Sports University(北京体育大学竞技体育学院) Department of Robotics, University of Michigan(密歇根大学机器人系)

AI总结 FLEX数据集通过多模态融合和结构化知识图谱提升健身动作质量评估的准确性与解释性,支持跨模态预测和生物力学导向的表示学习。

Comments Dataset and code are available at https://github.com/HaoYin116/FLEX . Link to Project page https://haoyin116.github.io/FLEX_Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16341 2026-04-06 cs.CV

Motion Capture from Inertial and Vision Sensors

从惯性与视觉传感器进行动作捕捉

Xiaodong Chen, Wu Liu, Qian Bao, Xinchen Liu, Ruoli Dai, Yongdong Zhang, Tao Mei

机构 * University of Science and Technology of China(中国科学技术大学) JD Explore Academy(京东探索研究院) Noitom Technology Ltd.(诺亦腾科技有限公司)

AI总结 本文提出MINIONS数据集,用于基于单目相机和少量IMU的多模态人体动作捕捉,提出SparseNet框架以展示惯性与视觉传感器在消费级动作捕捉中的潜力。

Comments 12 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏