arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-07-21 至 2026-07-21 共收录 13
2607.18084 2026-07-21 cs.AI cs.CL cs.LG 新提交

WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting

世界杯竞技场:语言模型和深度研究代理在足球预测上的细粒度评估

Zhaokai Wang, Tianlin Gui, Jiayuan Rao, Shangzhe Di, Yihong Tang, Dingli Liang

机构 * Shanghai Jiao Tong University(上海交通大学) McGill University(麦吉尔大学) University College London(伦敦大学学院)

AI总结 介绍世界杯竞技场这一语言模型和深度研究代理的动态基准,用于足球预测。模型赛前接收证据或自行搜索信息进行多项预测,赛后与实际结果对比。通过多指标评估104场比赛和13个系统,展示不同模型表现及与基线对比情况,且新赛程可添加用于评估未来模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17956 2026-07-21 cs.RO 新提交

Does Robust VIO Need More Learning? Geometry-Verified Visual Measurements under Distribution Shift

鲁棒视觉惯性里程计需要更多学习吗?分布偏移下的几何验证视觉测量

Yangyang Ning, Shu Liang, Quanbo Ge, Tianchen Deng, Yuhua Qi, Shenghai Yuan

机构 * Tongji University(同济大学) Nanjing University of Information Science and Technology(南京信息工程大学) Shanghai Jiao Tong University(上海交通大学) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

AI总结 研究分布偏移下鲁棒视觉惯性里程计是否需更多学习,提出最小学习立体VIO框架,将学习限于视觉测量生成,结合几何验证等,实验表明该方法在多种场景下准确稳定,精心集成学习视觉测量更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17842 2026-07-21 cs.CV cs.AI 新提交

CaT-GS: Efficient 3DGS Rendering for Large Scale Scenes via Inter-frame Caching and Tile Scheduling

CaT-GS:通过帧间缓存和瓦片调度实现大规模场景的高效3DGS渲染

Tingjia Zhang, Bo Chen, Shengzhong Liu, Fan Wu, Guihai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对3DGS在大规模场景中性能下降问题,CaT-GS提出通过推测性多帧预处理、帧间缓存机制及重构光栅化任务来消除冗余与减轻负载不平衡,实验证明其显著提升渲染速度,为大规模场景高保真实时渲染建立新基准。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17767 2026-07-21 cs.RO 新提交

VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking

VLN-AVP:用于自动代客泊车的基于混合长短时记忆的零样本视觉语言导航

Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)

AI总结 研究针对自主代客泊车依赖预建地图限制可扩展性问题,提出VLN-AVP零样本导航框架,结合BEV模型与VLM,引入混合记忆系统,构建数据集和基准,实验证明该方法在模拟和实际车辆实验中均有良好效果,提升了成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17423 2026-07-21 cs.CV 新提交

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

TimeLens2:使用多模态大语言模型进行通用视频时间定位

Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li, Jun Zhang, Tianxiang Jiang, Yuandong Yang, Ziang Yan, Zikang Wang, Xinyu Chen, Haoran Chen, Shaowei Zhang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学)

AI总结 研究通用视频时间定位问题,TimeLens2将时间证据视为区间集,通过多种策略构建多跨度监督,其时间瓦瑟斯坦奖励等方法提供反馈,在多个基准测试中表现出色,不同变体均有性能提升。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17412 2026-07-21 cs.LG 新提交

CORAL: Learning Amyloid Fibril Ligand Docking with Cooperative Binding Rewards

CORAL:通过协同结合奖励学习淀粉样纤维配体对接

Yasheng Sun, Bohan Li, Youqi Tao, Jürgen Schmidhuber

机构 * Center of Excellence for Generative AI, KAUST(沙特阿卜杜拉国王科技大学生成式人工智能卓越中心) MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能教育部重点实验室) Stern Laboratory, Brigham and Women’s Hospital, Harvard University(哈佛大学布莱根妇女医院斯特恩实验室)

AI总结 研究针对淀粉样纤维配体对接面临的挑战,提出CORAL强化学习框架,通过纳入协同配体 - 配体堆叠能量及蛋白质 - 配体对接亲和力训练模型,引入评估集,实验证明其在姿态质量和结合亲和力相关性上优于现有基线。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17257 2026-07-21 cs.RO cs.AI 新提交

Asynchronous Multimodal Diffusion Policy Composition via Latency-Aware Guidance Fusion

通过延迟感知引导融合实现异步多模态扩散策略组合

Zihao He, Hongjie Fang, Shirun Tang, Cewu Lu, Haoshu Fang

机构 * Shanghai Jiao Tong University(上海交通大学) Noematrix(无矩阵) Shanghai Innovation Institute(上海创新研究院)

AI总结 研究针对多模态扩散策略在模态差异下的融合问题,提出LAG - Fusion框架,通过延迟感知引导融合实现异步策略组合,推导参考帧重定位规则,在接触丰富操纵实验中提升了策略响应性和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16742 2026-07-21 cs.CV 新提交

Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model

人工智能生成的以人为中心的视频的多维质量评估:数据集与模型

Sijing Wu, Yunhao Li, Huiyu Duan, Yucheng Zhu, Xiongkuo Min, Patrick Le Callet, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学南加州大学文化创意产业学院) Polytech Nantes, Université de Nantes(法国南特大学高等理工学院)

AI总结 研究针对AI生成的以人为中心的视频质量评估问题,提出扩展数据集HVEval+并构建MoE-Rater模型,该模型采用专家混合及三阶段训练策略,能统一多种任务,在相关数据集上性能优越,推动了视频质量评估及T2V模型优化。

Comments Accepted for publication in IEEE TCSVT, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16624 2026-07-21 cs.CV 新提交

SPARE-GS: Structural Parsimony and Resource Efficiency for 3D Gaussian Splatting

SPARE-GS:用于3D高斯点云的结构简约与资源高效性

Zhang Chen, Shuai Wan, Fuzheng Yang, Jiazhi Xia, Weiyao Lin, Junhui Hou

机构 * School of Electronics and Information, Northwestern Polytechnical University(西北工业大学电子信息学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) School of Telecommunication Engineering, Xidian University(西安电子科技大学通信工程学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Department of Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电气工程系)

AI总结 研究针对3D高斯点云训练效率和表示紧凑性问题,提出SPARE-GS框架,通过将结构演化公式化并动态调整基元分布,实现减少高斯数量、训练时间,提升PSNR及下游处理效率,证明全局结构预算调节的广泛适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16355 2026-07-21 cs.CV cs.AI 新提交

PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation

PhysAgent:用于物理上合理的视频生成的反射式智能体物理控制

Qirui Li, Jinkun Hao, Yibo Li, Ran Yi, Paul L. Rosin, Yu-Kun Lai

机构 * Shanghai Jiao Tong University(上海交通大学) Cardiff University(卡迪夫大学)

AI总结 研究物理上合理的视频生成问题,提出PhysAgent反射式智能体框架,通过闭环设计及物理控制API,改善参数控制,实现复杂轨迹等,实验证明其能生成更合理视频,有更好提示对齐及泛化效果。

Comments For project page, see https://iapple233.github.io/PhysAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16327 2026-07-21 cs.CV 新提交

Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation

用于文本引导医学图像分割的定位注入视觉语言语义融合

Songyue Han, Mingye Zou, Shuchang Ye, Lei Bi, Mingyuan Meng

机构 * Air Force Engineering University(空军工程大学) Harbin Institute of Technology(哈尔滨工业大学) University of Sydney(悉尼大学) Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

AI总结 研究针对文本引导医学图像分割,提出LoG框架,通过联合执行多尺度目标定位任务,实现三级定位注入语义融合,在三个基准数据集实验中表现出色,优于现有医学图像分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16267 2026-07-21 cs.RO 新提交

HyperDCM: Dynamic Cluster Memory Replay in Hyperbolic Space for Continual Robotic Navigation Across Scenes

HyperDCM:用于跨场景连续机器人导航的双曲空间动态集群记忆回放

Zhengfei Lu, Jian Yang, Muyu Wang, Shaowen Chen, Jinpeng Mi, Ke Li, Xiong You, Qi Wu, Xuan Tang, Xian Wei

机构 * Software Engineering Institute, East China Normal University(华东师范大学软件工程学院) School of Geospatial Information, Information Engineering University(信息工程大学地理空间信息学院) University of Shanghai for Science and Technology(上海理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对视觉导航持续学习难题,提出HyperDCM,通过场景图建模和记忆回放增强导航。利用视觉语言模型提取三元组,经R-GCN编码投影到双曲空间,采用动态聚类等策略。实验证明其在保留导航能力和泛化性上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16247 2026-07-21 cs.LG cs.CV 新提交

Self-Evolving Just-In-Time Memory for Proactive Embodied Safety

用于主动具身安全的自进化即时记忆

Bingrui Sima, Lizhong Wang, Xiaoya Lu, Kun He, Xiao Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究视觉语言模型在闭环交互中应对动态危险的问题,提出自进化即时记忆框架,含RSG、事实记忆和经验记忆,并通过自动测试-验证-写入循环完善元技能,实验证明该框架大幅提升安全成功率且不阻碍任务进展。

详情

展开后加载摘要…

URL PDF HTML 收藏