arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-08-07 至 2026-08-07 共收录 8
2608.06270 2026-08-07 cs.AI 新提交

The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

视觉工具使用的错觉:对图像思考的因果审查

Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文通过因果审查方法,发现多模态大语言模型的视觉工具使用存在“调用而不查看”“查看而不规划”等错觉,整体准确率增益下大量场景无因果效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06197 2026-08-07 cs.AI 新提交

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

EnvACE:通过世界预演内化环境动态以实现智能体强化学习

Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学) Central South University(中南大学) The Chinese University of Hong Kong(香港中文大学) Tencent Inc.(腾讯公司)

AI总结 本文提出 EnvACE 方法,以世界预演替代外部环境交互训练 LLM 智能体,在多基准测试中性能优于基线,可突破外部环境约束扩展 LLM 智能体训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05976 2026-08-07 cs.CV 新提交

Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model

Diff-VF:基于扩散模型的免训练高质量长视频生成

Haoning Yang, Xinyuan Chen, Yaohui Wang, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 提出免训练的Diff-VF框架,通过三种互补策略及跳跃残差引导,实现高质量长视频生成,在时间一致性与动作多样性上优于现有基线。

Comments Accepted for publication in ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05832 2026-08-07 cs.CL 新提交

Enhancing Social Intelligence in LLMs with Hierarchical Reasoning and Utterance-Level Goal Rewarding

利用层级推理和话语级目标奖励增强大型语言模型的社交智能

Xiaofeng Wang, Kakam Chong, Shuai Xiao, DeXin Kong, Qingyuan Tian, Chen Ju, Xu Yan, Shuai Zhao, Fei Huang, Rui Wang, Shuguang Han, jufeng chen

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对LLMs社交互动不足的问题,提出TSR框架与LHRL-VGR算法,微调Qwen2.5-7B智能体后在SOTOPIA基准上超过GPT-4o基线7.32%,实现多智能体社交谈判的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05774 2026-08-07 cs.CV cs.LG 新提交

SR-JEPA: Learning Predictive Latent State in 3D Scenes

SR-JEPA:在3D场景中学习预测性隐状态

Zihan Zhou, Qifu Wen, Xi Zeng

机构 * Boston University(波士顿大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SR-JEPA,一种面向场景级点云的原生点JEPA,通过仅使用自包含的3D EMA目标训练,在3D场景实体缺失时可查询预测隐状态,在ARKitScenes和Sr3D数据集上取得了良好的语义预测性能,揭示了可组合的3D预测状态。

Comments 17 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05704 2026-08-07 cs.CV 新提交

G$^2$ARD-GS: Geometry-Guided Anchor-Regularized Gaussian Splatting Distillation

G$^2$ARD-GS:几何引导的锚点正则化高斯溅射蒸馏

Puyuan Zhang, Jianming Huang, Wenkai Ye, Wei Dong

机构 * Shanghai Jiao Tong University(上海交通大学) Jishu Technology Co., Ltd.(集度科技有限公司)

AI总结 针对3D高斯溅射模型基元过多导致成本高的问题,提出G$^2$ARD-GS几何引导蒸馏方法,在MatrixCity数据集上实现最优压缩性能,提升了外观适配与配准精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05666 2026-08-07 cs.LG cs.NA math.NA 新提交

Potential Matching Optimal Transport: Continuous Normalizing Flows for Exact $p$-Wasserstein Dynamics

势匹配最优传输:用于精确$p$-Wasserstein动力学的连续归一化流

Lishuo Zhang, Ruizhi Huang, Yang Yu, Lei Li

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院)

AI总结 本研究提出PMOT势匹配最优传输框架,结合CNF与广义Benamou-Brenier形式,实现$p$-最优传输的精确动力学建模,在合成基准、高维表格数据及颜色变换任务中表现出良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05728 2026-08-07 cs.CV cs.LG physics.optics 新提交

Engram-E2VID: Reference-Based Event-to-Video Reconstruction via Generative Activation of Appearance Engrams

Engram-E2VID:基于外观印迹生成激活的参考式事件到视频重建方法

Feiyu Ji, Xiang Li, Hao Ma, Tianxiang Huang, Qingxin Lu, Mengqi Ji, Lei Han, Xiaokang Yang, Xiaoyun Yuan

机构 * Shanghai Jiao Tong University(上海交通大学) Beihang University(北京航空航天大学) DISCOVER Robotics(DISCOVER机器人公司)

AI总结 本研究提出Engram-E2VID框架,通过外观印迹生成激活实现参考式事件到视频重建,在三个基准测试中PSNR最高提升3.29 dB、LPIPS最高降低0.08,性能随重建间隔增加下降更慢。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏