2608.06270 2026-08-07 cs.AI 新提交 The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images 视觉工具使用的错觉:对图像思考的因果审查 Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu 机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) 纠错 AI总结 本文通过因果审查方法,发现多模态大语言模型的视觉工具使用存在“调用而不查看”“查看而不规划”等错觉,整体准确率增益下大量场景无因果效果。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.06197 2026-08-07 cs.AI 新提交 EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning EnvACE:通过世界预演内化环境动态以实现智能体强化学习 Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu 机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Sun Yat-sen University(中山大学) ; Central South University(中南大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tencent Inc.(腾讯公司) 纠错 AI总结 本文提出 EnvACE 方法,以世界预演替代外部环境交互训练 LLM 智能体,在多基准测试中性能优于基线,可突破外部环境约束扩展 LLM 智能体训练。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.05976 2026-08-07 cs.CV 新提交 Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model Diff-VF:基于扩散模型的免训练高质量长视频生成 Haoning Yang, Xinyuan Chen, Yaohui Wang, Guo Lu 机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) 纠错 AI总结 提出免训练的Diff-VF框架,通过三种互补策略及跳跃残差引导,实现高质量长视频生成,在时间一致性与动作多样性上优于现有基线。 Comments Accepted for publication in ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM) 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.05832 2026-08-07 cs.CL 新提交 Enhancing Social Intelligence in LLMs with Hierarchical Reasoning and Utterance-Level Goal Rewarding 利用层级推理和话语级目标奖励增强大型语言模型的社交智能 Xiaofeng Wang, Kakam Chong, Shuai Xiao, DeXin Kong, Qingyuan Tian, Chen Ju, Xu Yan, Shuai Zhao, Fei Huang, Rui Wang, Shuguang Han, jufeng chen 机构 * Alibaba Group(阿里巴巴集团) ; Shanghai Jiao Tong University(上海交通大学) 纠错 AI总结 该研究针对LLMs社交互动不足的问题,提出TSR框架与LHRL-VGR算法,微调Qwen2.5-7B智能体后在SOTOPIA基准上超过GPT-4o基线7.32%,实现多智能体社交谈判的最优性能。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.05774 2026-08-07 cs.CV cs.LG 新提交 SR-JEPA: Learning Predictive Latent State in 3D Scenes SR-JEPA:在3D场景中学习预测性隐状态 Zihan Zhou, Qifu Wen, Xi Zeng 机构 * Boston University(波士顿大学) ; Shanghai Jiao Tong University(上海交通大学) 纠错 AI总结 本文提出SR-JEPA,一种面向场景级点云的原生点JEPA,通过仅使用自包含的3D EMA目标训练,在3D场景实体缺失时可查询预测隐状态,在ARKitScenes和Sr3D数据集上取得了良好的语义预测性能,揭示了可组合的3D预测状态。 Comments 17 pages, 5 figures, 9 tables 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.05704 2026-08-07 cs.CV 新提交 G$^2$ARD-GS: Geometry-Guided Anchor-Regularized Gaussian Splatting Distillation G$^2$ARD-GS:几何引导的锚点正则化高斯溅射蒸馏 Puyuan Zhang, Jianming Huang, Wenkai Ye, Wei Dong 机构 * Shanghai Jiao Tong University(上海交通大学) ; Jishu Technology Co., Ltd.(集度科技有限公司) 纠错 AI总结 针对3D高斯溅射模型基元过多导致成本高的问题,提出G$^2$ARD-GS几何引导蒸馏方法,在MatrixCity数据集上实现最优压缩性能,提升了外观适配与配准精度。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.05666 2026-08-07 cs.LG cs.NA math.NA 新提交 Potential Matching Optimal Transport: Continuous Normalizing Flows for Exact $p$-Wasserstein Dynamics 势匹配最优传输:用于精确$p$-Wasserstein动力学的连续归一化流 Lishuo Zhang, Ruizhi Huang, Yang Yu, Lei Li 机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) 纠错 AI总结 本研究提出PMOT势匹配最优传输框架,结合CNF与广义Benamou-Brenier形式,实现$p$-最优传输的精确动力学建模,在合成基准、高维表格数据及颜色变换任务中表现出良好性能。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.05728 2026-08-07 cs.CV cs.LG physics.optics 新提交 Engram-E2VID: Reference-Based Event-to-Video Reconstruction via Generative Activation of Appearance Engrams Engram-E2VID:基于外观印迹生成激活的参考式事件到视频重建方法 Feiyu Ji, Xiang Li, Hao Ma, Tianxiang Huang, Qingxin Lu, Mengqi Ji, Lei Han, Xiaokang Yang, Xiaoyun Yuan 机构 * Shanghai Jiao Tong University(上海交通大学) ; Beihang University(北京航空航天大学) ; DISCOVER Robotics(DISCOVER机器人公司) 纠错 AI总结 本研究提出Engram-E2VID框架,通过外观印迹生成激活实现参考式事件到视频重建,在三个基准测试中PSNR最高提升3.29 dB、LPIPS最高降低0.08,性能随重建间隔增加下降更慢。 Comments 9 pages, 5 figures 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图