机构
*
Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))
;
Berkeley Artificial Intelligence Research (BAIR), University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究院(BAIR))
MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action
MPCoT: 奖励引导的多路径潜在推理用于测试时可扩展的视觉-语言-动作
Boyang Zhang, Lianlei Shan
机构
*
Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系)
;
Department of Computer Science, Tsinghua University(清华大学计算机系)
The Sensation Modulating Network:Haltability as the architectural ground for object-directed phenomenology
感觉调节网络:可停性作为对象导向现象学的架构基础
G. Nagarjuna, Durgaprasad Karnam
机构
*
Indian Institute of Science Education and Research (IISER) Pune(印度科学教育与研究学院(IISER)浦那)
;
Centre for Educational Technology (CET), Indian Institute of Technology Bombay(教育技术中心(CET),印度理工学院孟买)
机构
*
Monash University(墨尔本大学)
;
Stanford University(斯坦福大学)
;
University of Washington(华盛顿大学)
;
Griffith University(格里菲斯大学)
;
Princeton University(普林斯顿大学)
;
Allen Institute for Artificial Intelligence(人工智能研究院)
MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation
MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型
Yang Liu, Pengxiang Ding, Tengyue Jiang, Xudong Wang, Wenxuan Song, Minghui Lin, Han Zhao, Hongyin Zhang, Zifeng Zhuang, Wei Zhao, Siteng Huang, Jinkui Shi, Donglin Wang
机构
*
Westlake University(西湖大学)
;
Zhejiang University(浙江大学)
;
East China University of Science and Technology(华东理工大学)
;
Huawei Celia Team(华为Celia团队)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
OpenHelix Robotics
To Use AI as Dice of Possibilities with Timing Computation
将AI用作带有时序计算的可能性骰子
Jia Li, Vipin Kumar, Rui Zhang
机构
*
Department of Surgery, University of Minnesota(明尼苏达大学外科系)
;
Department of Computer Science & Engineering, University of Minnesota(明尼苏达大学计算机科学与工程系)
CommentsPreprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)
GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMs
GroupToM-Bench: 多模态大语言模型中群体心智理论和非线性社会涌现的基准测试
Weidong Tang, Jierui Li, Yueling Hou, Zihan Mei, Can Zhang, Xinyan Wan, Zhiyuan Liang, Pengfei Zhou, Yang You, Wangbo Zhao
机构
*
Xidian University(西安电子科技大学)
;
National University of Singapore(新加坡国立大学)
;
University of Electronic Science and Technology of China(电子科技大学)
;
University of Science and Technology of China(中国科学技术大学)
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
大型音频语言模型综述:通用性、可信度与展望
Kaiwen Luo, Zhenhong Zhou, Leyan Wang, Liang Lin, Tianyu Shao, Yuanhe Zhang, Yang Xiao, Yuxuan Li, Miao Yu, Kailin Lyu, Jiaming Zhang, Li Sun, Songze Li, Yueming Wu, Ting Dang, Xiaojun Jia, Dongrui Liu, Kai Li, Rohan Kumar Das, Siyuan Liang, Xinfeng Li, Qiankun Li, Jing Chen, Xingjun Ma, Kun Wang, Junhao Dong, Deqing Zou, Yu Cheng, Xia Hu, Zhigang Zeng, Sen Su, Yang Liu, Yu-Gang Jiang, Philip S. Yu, Yew-Soon Ong
机构
*
Nanyang Technological University(南洋理工大学)
;
Independent Researcher(独立研究者)
;
The University of Melbourne(墨尔本大学)
;
North China Electric Power University(华北电力大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Huazhong University of Science and Technology(华中科技大学)
;
Tsinghua University(清华大学)
;
Fortemedia Singapore(富媒体新加坡)
;
Tencent(腾讯)
;
Fudan University(复旦大学)
;
Wuhan University(武汉大学)
;
Chinese University of Hong Kong(香港中文大学)
;
Chongqing University of Posts and Telecommunications(重庆邮电大学)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)