arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-06-05 至 2026-06-05 共收录 12
2606.06476 2026-06-05 cs.CV

Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators

思考与想象:基于世界模拟器的智能视觉空间推理

Chenming Zhu, Jingli Lin, Yilin Long, Peizhou Cao, Tai Wang, Jiangmiao Pang, Xihui Liu

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Beihang University(北航大学)

AI总结 提出Astra框架,通过强化学习训练VLM策略与Bagel世界模拟器交互,在推理中生成想象视觉证据,解决空间推理中的未观察布局、跨视角一致性和替代视角推理问题。

Comments Project page: https://zcmax.github.io/projects/Thinking-With-Imagination

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06316 2026-06-05 quant-ph cs.AI cs.DS

Quantum enhanced rare event discovery and sampling

量子增强的罕见事件发现与采样

Naixu Guo, Po-Wei Huang, Qisheng Wang, Jayne Thompson, Patrick Rebentrost, Mile Gu, Chengran Yang

机构 * Centre for Quantum Technologies, National University of Singapore(量子技术中心,新加坡国立大学) Mathematical Institute, University of Oxford(牛津大学数学研究所) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Informatics, University of Edinburgh(爱丁堡大学信息学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Nanyang Quantum Hub, School of Physical and Mathematical Sciences, Nanyang Technological University(南洋量子中心,南洋理工大学物理与数学科学学院)

AI总结 针对概率极低的罕见事件发现与采样问题,提出一种无需预先知道事件类型的量子算法,实现了与稀有度阈值的最优量子标度,并在重尾系统和稳态随机过程中分别获得二次加速和鲁棒多项式加速。

Comments 36 pages (8+28)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05979 2026-06-05 cs.RO cs.AI

World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis

世界-语言-动作模型:统一世界建模、语言推理与动作合成

Yi Yang, Zhihong Liu, Siqi Kou, Yiyang Chen, Yanzhe Hu, Jianbo Zhou, Boyuan Zhao, Zhijie Wei, Xiao Xia, Xueqi Li, Pengfei Liu, Zhijie Deng

机构 * SJTU(上海交通大学) SII(上海研究院) HUST(华中科技大学) SCUT(华南理工大学) ECUST(东华大学) SHU(上海大学) NJUPT(南京工业大学)

AI总结 提出世界-语言-动作(WLA)模型,通过自回归Transformer联合预测文本子任务、子目标图像和机器人动作,融合世界建模与语言推理能力,实现多任务和长时域任务的最优性能。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05885 2026-06-05 cs.LG

When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training

当更密集的信用不足时:面向长周期LLM智能体训练的基于证据校准的策略优化

Yuanfan Li, Qi Zhou, Wenjing Duan, Lu Chen

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室,计算机科学学院,上海交通大学,上海,中国) Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(电子与信息工程学院,西安交通大学)

AI总结 针对长周期LLM智能体在稀疏延迟奖励下的信用分配问题,提出一种无评论家的策略优化算法ECPO,通过证据校准的动作优势和方差门控信用加权来修正密集信用的统计不可靠性,在ALFWorld和WebShop上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05728 2026-06-05 cs.AI cs.CL

DiG-Plan: Mitigating Early Commitment for Tool-Graph Planning via Diffusion Guidance

DiG-Plan:通过扩散引导缓解工具图规划中的早期承诺问题

Yansi Li, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 针对工具图规划中自回归解码的早期承诺问题,提出基于扩散生成器与自回归精炼器解耦的DiG-Plan框架,显著提升组合搜索覆盖率和任务性能。

Comments Accepted at IJCAI-ECAI 2026. This is an author preprint; the final version will appear in the IJCAI Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05561 2026-06-05 cs.CL cs.AI

InfoShield: Privacy-Preserving Speech Representations for Mental Health Screening via Information-Theoretic Optimization

InfoShield:通过信息论优化实现心理健康筛查的隐私保护语音表示

Xueyang Wu, Siyuan Liu, Kezhuo Yang, Guang Ling

机构 * Shenzhen NeurStar Inc., China(深圳NeurStar公司,中国) University of York, United Kingdom(约克大学,英国) Shanghai Jiao Tong University, China(上海交通大学,中国)

AI总结 提出InfoShield框架,通过最小化语音表示与敏感属性间的互信息,在保持抑郁分类性能的同时有效降低人口统计信息泄露风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05400 2026-06-05 cs.AI cs.CL cs.LG

LeanMarathon: Toward Reliable AI Co-Mathematicians through Long-Horizon Lean Autoformalization

LeanMarathon:通过长视界Lean自动形式化实现可靠的AI合作数学家

Yuanhe Zhang, Yuekai Sun, Taiji Suzuki, Jason D. Lee, Fanghui Liu

机构 * Department of Statistics, University of Warwick, UK(英国沃里克大学统计系) Center for Advanced Intelligence Project, RIKEN, Japan(日本理化学研究所高级智能项目) Department of Statistics, University of Michigan, USA(美国密歇根大学统计系) Department of Mathematical Informatics, The University of Tokyo(东京大学数学信息学系;日本理化学研究所高级智能项目) also Center for Advanced Intelligence Project, RIKEN, Japan(加州大学伯克利分校电气工程与计算机科学系;统计系) Department of Electrical Engineering and Computer Sciences, also Department of Statistics, University of California, Berkeley, USA(上海交通大学数学科学学院,自然科学院和MOE-LSC) School of Mathematical Sciences, Institute of Natural Sciences and MOE-LSC, Shanghai Jiao Tong University, China

AI总结 提出多智能体框架LeanMarathon,通过蓝图抽象和两阶段编排器实现长视界研究数学的可靠自动形式化,在四个Erdős问题上成功形式化七个定理。

Comments 26 pages, 9 figures. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05359 2026-06-05 cs.CV

Recovering Physically Plausible Human-Object Interactions from Monocular Videos

从单目视频中恢复物理上可信的人-物交互

Dingbang Huang, Etienne Vouga, Qixing Huang, Georgios Pavlakos

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出RePHO方法,通过物理引导的重建框架和强化学习策略,从单目视频中恢复物理上可信的人-物交互,解决了现有方法中的穿透和物体漂浮问题。

Comments CVPR 2026. Project Page: https://dingbang777.github.io/RePHO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05232 2026-06-05 cs.LG cs.AI

Differentiable Efficient Operator Search

可微分高效算子搜索

Xiaohuan Pei, Jiyuan Zhang, Yuanfan Guo, Weiguo Feng, Tao Huang, Cho-Jui Hsieh, Chang Xu

机构 * The University of Sydney(悉尼大学) ByteDance(字节跳动) Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出可微分高效算子搜索框架,统一解释多种token缩减算子,通过联合搜索缩减位置、保留数量和算子行为,在预算约束下优化多模态模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04733 2026-06-05 cs.AI

Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing

面向沉浸式视频角色扮演的奖励分解强化学习

Miao Wang, Yuling Shi, Yijiang Li, Yeheng Chen, Xiaodong Gu, Bin Li, Bo Gao, Jun Wang, Zengxin Han, Jingtong Wu, Yaduan Ruan

机构 * Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) University of California, San Diego(加州大学圣地亚哥分校) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Information Engineering, Beijing Institute of Graphic Communication(北京印刷学院信息工程学院) Ant International, Ant Group(蚂蚁集团国际部) Independent Researcher(独立研究者)

AI总结 提出EBM-RL框架,通过奖励分解的强化学习优化视频角色扮演中的视觉感知、推理与生成过程,提升场景一致性与角色真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04708 2026-06-05 cs.RO cs.AI

VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training

VISTA: 基于视觉和物理验证的UMI数据适配用于VLA训练

Siyuan Yang, Linzheng Guo, Ouyang Lu, Zhaxizhuoma, Daoran Zhang, Xinmiao Wang, Ting Xiao, Fangzheng Yan, Zhijun Chen, Yan Ding, Chao Yu, Chenjia Bai, Xuelong Li

机构 * Institute of AI (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Lumos Robotics(Lumos机器人) University of Science and Technology of China(中国科学技术大学) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) East China University of Science and Technology(东华大学) Harbin Engineering University(哈尔滨工程大学) Fudan University(复旦大学)

AI总结 提出VISTA框架,通过UMI-VQA数据集对齐视觉表示、物理验证流水线筛选可行轨迹以及两阶段联合训练,解决UMI数据训练VLA模型时的视觉分布偏移和物理不可行动作问题。

Comments Corrected the typing error

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16111 2026-06-05 stat.ML cs.LG math.SP

Rotation-Parameterized Graph Fractional Fourier Transform: Definition, Properties, and Optimal Filtering

旋转参数化图分数阶傅里叶变换:定义、性质和最优滤波

Feiyue Zhao, Mingzhi Wang, Yangfan He, Zhichao Zhang

机构 * School of Mathematics and Statistics, Nanjing University of Information Science and Technology(南京信息工程大学数学与统计学院) School of Communication and Artificial Intelligence, Nanjing Institute of Technology(南京理工大学通信与人工智能学院) School of Integrated Circuits, Nanjing Institute of Technology(南京理工大学集成电路学院) Jiangsu Province Engineering Research Center of IntelliSense Technology and System(江苏省智能感知技术与系统工程研究中心) Hubei Key Laboratory of Applied Mathematics, Hubei University(湖北省应用数学重点实验室) Key Laboratory of System Control and Information Processing, Ministry of Education, Shanghai Jiao Tong University(教育部系统控制与信息处理重点实验室,上海交通大学)

AI总结 本文提出旋转参数化图分数阶傅里叶变换(RP-GFRFT),通过统一分数阶和旋转参数化的谱分析,解决现有方法在旋转基控制和零角度退化方面的不足,提升图信号处理的去噪、重建和特征保留性能。

详情

展开后加载摘要…

URL PDF HTML 收藏