arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 427
2607.24148 2026-07-28 cs.AI 新提交

A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference

一种用于高效视觉-语言-动作推理的具有质心重用的运动感知向量量化框架

Zhuoran Song, Haozhe Jiang, Chunyu Qi, Minnan Pei, Gang Li, Xiaoyao Liang, Haibing Guan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 针对VLA模型推理延迟高问题,提出VQVLA算法-硬件协同设计框架,利用MotionVQ动态调整量化精度,采用合并质心向量量化通用矩阵乘法范式,设计加速器,实验表明其相比多种方法有显著加速且精度损失小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24082 2026-07-28 cs.AI 新提交

Towards High-Level Semantic Intelligence

迈向高级语义智能

Xiujie Song, Gefei Yang, Yining You, Jiahui Gan, Qi Jia, Shota Watanabe, Tianxi Wan, Mengyue Wu, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 综述从语义复杂性角度审视人工智能语义智能发展,系统调研高级语义任务研究,总结理解和生成的相关方法及策略,旨在推动人工智能向高级语义智能持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23615 2026-07-28 cs.LG 新提交

Restoration Flow Matching-Based Channel Refinement and Equalization Correction for MIMO Semantic Communications

基于恢复流匹配的MIMO语义通信信道细化与均衡校正

Wenkai Liu, Nan Ma, Jianqiao Chen, Xiaodong Xu, Meixia Tao, Ping Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ZGC Institute of Ubiquitous-X Innovation and Applications(中关村泛在X创新与应用研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对MIMO语义通信中信道和均衡问题,提出基于恢复流匹配的框架,含CRFM和SRFM模块,通过双锚点扰动训练策略增强鲁棒性,经ODE求解器推理,实验证明提高了相关指标且采样步骤少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23607 2026-07-28 cs.LG cs.CL 新提交

MS-GPT: Rethinking MS/MS De Novo Structure Elucidation as Spectrum-Induced Posterior Querying of a Molecule-Language Model

MS-GPT:将串联质谱的从头结构解析重新思考为分子语言模型的谱诱导后验查询

Xin Zhao, Yumin Liu, Zhuo Li, Weichu Zheng, Feng Zhu, Xiaokang Yang, Yaohui Jin, Yanyan Xu

机构 * ByteDance Inc.(字节跳动公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究针对MS/MS分子结构解析问题,提出MS-GPT方法,将指纹介导的从头解析重铸为谱诱导后验查询分子语言模型,经校准、排序等操作,在NPLIB1和MassSpecGym上达新最优水平,提升召回率且增加少量推理成本。

Comments 18 pages, 14 figures, and 9 tables, including appendices. Source code and model checkpoints are available at https://github.com/VIKI623/MS-GPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22770 2026-07-28 cs.LG cs.CV 新提交

Dementia Etiology Diagnosis via Collaborative Meta Knowledge Enhancement

通过协作元知识增强进行痴呆病因诊断

Siyuan Du, Mengxi Chen, Xinyang Jiang, Zilong Wang, Jiangchao Yao, Dongsheng Li, Ya Zhang, Lili Qiu, Yanfeng Wang

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学协同媒体网络创新中心) Microsoft Research Asia(微软亚洲研究院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 针对痴呆病因诊断中因数据异质性导致的挑战,提出协作元知识增强(COME)框架,将多中心采集语义等作为异质性感知嵌入注入Transformer架构,并设计优化方案。该方法在多队列中性能达最优,有良好泛化能力,还能与生物标志物及临床严重程度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22653 2026-07-28 cs.AI 新提交

Do Language Models Converge to Themselves? Recursive Self-Refinement as Textual Relaxation

语言模型会收敛到自身吗?递归自精炼作为文本松弛

Xuening Wu, Qianya Xu, Yanlan Kang, Zeping Chen, Yubin Liu, Shenqin Yin

机构 * Pfizer(辉瑞公司) University of California San Diego(加利福尼亚大学圣地亚哥分校) Institute for Medical Philosophy and Future Artificial Intelligence(医学哲学与未来人工智能研究所) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Institute of Humanities and Social Science Data, Fudan University(复旦大学人文社会科学数据研究所)

AI总结 研究大语言模型递归自精炼工作流程的长期动态。通过生成精炼轨迹并分析多种指标,发现轨迹迅速饱和,编辑多在前几次迭代,确定性解码表现更好,平均编辑幅度呈指数松弛,收敛摘要有多种优势,支持动态系统观点并推动停止标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22494 2026-07-27 cs.MM cs.CV 新提交

CARA: Concept-Aware Risk Attention for Interpretable Collision Anticipation

CARA:用于可解释碰撞预测的概念感知风险注意力

Zhishan Tao, Ruoyu Wang, Yucheng Wu, Enjun Du, Yilei Yuan, Sherwin Ho, Yue Su, Jinbo Su, Yi Hong

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Pennsylvania(宾夕法尼亚大学) Renmin University of China(中国人民大学)

AI总结 研究自动驾驶碰撞预测问题,提出CARA框架,从事故叙述中获取风险概念并与视频帧对齐成轨迹,将语义风险因素作为动态证据,结合可解释性与预测过程,实验证明其能提高预测准确性和预警及时性。

Comments Accepted to ACM Multimedia 2026(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21332 2026-07-24 cs.CL cs.AI 新提交

Phonetic forced alignment for low-resource language varieties: Model training and evaluation on Chengdu Mandarin

低资源语言变体的语音强制对齐:成都话的模型训练与评估

Zhiheng Qian, Aini Li, Hai Hu, Liang Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) City University of Hong Kong(香港城市大学) The Hong Kong Polytechnic University(香港理工大学) Beijing Foreign Studies University(北京外国语大学)

AI总结 针对现有语音强制对齐系统缺乏低资源语言变体专门模型的问题,利用17小时语料库和自定义词典,训练成都话依赖文本与独立文本的对齐器,显著优于标准普通话基线,建立实用自训练管道。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21267 2026-07-24 cs.AI 新提交

BasketEvent: Understanding Who Did What and When in Basketball Videos

BasketEvent:理解篮球视频中谁在何时做了什么

Yu Zhang, Jiayuan Rao, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 该研究旨在解决篮球视频理解问题,提出以球员为中心的BasketEvent数据集,引入PlayNet推理框架,通过建模多种互动并聚合时间证据进行事件预测,实验证明其在体育视频理解上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21228 2026-07-24 cs.CV 新提交

T-STAR: A Large-Scale Benchmark for Spatio-Temporal Panoptic Scene Graph Generation in Satellite Video

T-STAR:卫星视频中时空全景场景图生成的大规模基准测试

Linlin Wang, Xue Yang, Zhihuang Zhou, Zhenyu Zhong, Ruiyuan Zhang, Yansheng Li

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感信息工程学院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

AI总结 本文针对卫星视频结构化理解难题,提出时空全景场景图生成任务,构建T-STAR大规模基准数据集,含超百万实例掩码和时空三元组,还提出统一框架,经实验验证其对卫星视频理解研究的重要性和框架有效性。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21125 2026-07-24 cs.CV 新提交

Causal-AgentIR: Self-Evolving Causal Memory for Adaptive Image Restoration Agents

因果智能体图像恢复:用于自适应图像恢复智能体的自进化因果记忆

Hu Gao, Yulong Chen, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 针对图像恢复智能体知识存储局限,提出Causal-AgentIR框架,通过构建结构化因果记忆图及协作系统,支持智能体进行因果推理,依质量变化和反馈调整恢复经验,有效提升图像恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20628 2026-07-24 cs.CV cs.AI 新提交

RealVDeblur: One-Step Diffusion for Generalizable Real-World Video Deblurring

RealVDeblur:用于通用真实世界视频去模糊的一步扩散法

Renbiao Jin, Mingxin Yang, Yutian Chen, Junhao Zhuang, Xin Cai, Mulin Yu, Linning Xu, Wenxian Yu, Danping Zou, Shi Guo, Tianfan Xue

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多媒体实验室) CPII under InnoHK(创新香港研究院下的CPII) Tsinghua University(清华大学)

AI总结 针对真实世界视频去模糊难题,提出RealVDeblur框架。构建模糊合成管道提供数据,利用视频扩散先验恢复,采用逐帧编码并简化采样为一步生成器,还有时间窗口掩码稳定推理,在多方面表现出色且提升3D重建鲁棒性。

Comments Project page with code: https://rbjin.github.io/RealVDeblur/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20489 2026-07-24 cs.AI cs.DB 新提交

EvoSQL: Memory-Augmented Critic-Generator Co-Evolution for Text-to-SQL

EvoSQL:用于文本到SQL的内存增强型评论家-生成器协同进化

Jiawei Zhou, Jianwei Wang, Chenyu Zhou, Chaojian Shi, Ming Dong, Kai Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of New South Wales(新南威尔士大学) Fudan University(复旦大学) Wuhan University of Technology(武汉理工大学)

AI总结 研究文本到SQL问题,提出EvoSQL协同进化框架,通过生成器与评论家迭代交互、维护内存、验证候选及自蒸馏策略优化微调等,在Spider和BIRD实验中持续改进开源模型,证明该方法是有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20057 2026-07-23 q-bio.BM cs.LG 新提交

Antigen-specific Antibody Multi-modal Foundation Model for Functional Antibody Design

用于功能性抗体设计的抗原特异性抗体多模态基础模型

Xiaoliang Shi, Zichen Wang, Runze Ma, Zhongyue Zhang, Shuangjia Zheng

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对抗原特异性抗体设计难题,引入AAMFM多模态基础模型,通过跨模态适配器整合抗原信息,用校准直接偏好优化微调,实现抗体 - 抗原相互作用联合建模,实验证明其在功能性抗体设计中性能最优,有抗原特异性抗体工程潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20241 2026-07-23 cs.CL cs.AI 新提交

On the Systematic Challenges of Culturally Loaded Machine Translation: Dream of the Red Chamber as the Cultural Lens

论文化负载机器翻译的系统性挑战:以《红楼梦》为文化视角

Yiming Wang, Jiayuan Di

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) School of Foreign Languages, East China University of Science and Technology(华东理工大学外国语学院) Mejiro University(目白大学)

AI总结 研究以《红楼梦》构建数据集,系统探究基于大语言模型的机器翻译系统中文化负载翻译的挑战,揭示任务、人工评估及自动评估方面的问题,为文化导向的翻译研究提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19767 2026-07-23 cs.AI 新提交

Symbol and Footprint Database for Electronic Components by Agentic Recognition and Generation

基于智能识别与生成的电子元件符号与引脚封装数据库

Yichen Shi, Yuzhi Liu, Zhuofu Tao, Li Huang, Yuhao Gao, Ting-Jung Lin, Lei Hel

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院,东方理工大学) Shanghai Jiao Tong University(上海交通大学) BTD Technology(BTD科技)

AI总结 研究利用多模态大语言模型开发电子元件符号和引脚封装智能识别与生成流程SFgen,其符号生成准确率86%,引脚封装生成准确率80%,并用此创建含1000个元件的SFnet数据库,为PCB设计自动生成奠定基础。

Comments Accepted by PRCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19759 2026-07-23 cs.LG cs.AI cs.IT math.IT 新提交

Convergence-Latency-Aware Adaptive Modulation and Resource Allocation in RIS-Assisted Wireless Federated Learning

基于可重构智能表面的无线联邦学习中的收敛-延迟感知自适应调制与资源分配

Liwei Wang, Wen Chen, Jun Li, Qingqing Wu, Ming Ding, Xusheng Zhu, Qiong Wu

机构 * Broadband Access Network Laboratory, Shanghai Jiao Tong University(宽带接入网络实验室,上海交通大学) School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) Data61, CSIRO(数据61,联邦科学与工业研究组织) Department of Electronic and Electrical Engineering, University College London(电子与电气工程系,伦敦大学学院) School of Internet of Things Engineering, Jiangnan University(物联网工程学院,江南大学)

AI总结 针对无线网络联邦学习中训练延迟和收敛性问题,考虑RIS辅助阻塞链路场景,通过刻画符号错误影响得出收敛上限,将联合收敛-延迟优化问题转化为MINLP问题,用低复杂度框架求解,实验表明该方案收敛快、准确率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18658 2026-07-22 eess.AS cs.SD 新提交

Towards Array-Invariant Speech Enhancement via Geometry-Aware Dynamic Convolution

通过几何感知动态卷积实现阵列不变语音增强

Zhenglong Liu, Wangyou Zhang, Chenda Li, Yanmin Qian

机构 * Auditory Cognition and Computational Acoustics Lab(听觉认知与计算声学实验室) Shanghai Jiao Tong University(上海交通大学) VUI Labs(VUI实验室)

AI总结 研究多通道语音增强受固定阵列配置限制问题,提出几何感知动态卷积框架,利用麦克风坐标转换固定阵列SE模型为阵列不变系统,经实验验证该框架能提升模型在不同阵列拓扑下的性能。

Comments Comments: 5 pages, 1 figure, 2 tables. Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19046 2026-07-22 cs.CV 新提交

Contrastive On-Policy Distillation

对比策略蒸馏

Jiacheng Ruan, Jun Tang, Wenzhen Yuan, Ting Liu, Shuai Bai, Dayiheng Liu, Zhibo Yang, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

AI总结 研究提出对比策略蒸馏框架COPD,通过冻结教师模型在不同指令下对学生状态评分,以对数概率差为优势信号指导更新,减少推理长度,提升效率,且能集成到自蒸馏框架实现自对比监督。

Comments Work in progress. 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18084 2026-07-21 cs.AI cs.CL cs.LG 新提交

WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting

世界杯竞技场:语言模型和深度研究代理在足球预测上的细粒度评估

Zhaokai Wang, Tianlin Gui, Jiayuan Rao, Shangzhe Di, Yihong Tang, Dingli Liang

机构 * Shanghai Jiao Tong University(上海交通大学) McGill University(麦吉尔大学) University College London(伦敦大学学院)

AI总结 介绍世界杯竞技场这一语言模型和深度研究代理的动态基准,用于足球预测。模型赛前接收证据或自行搜索信息进行多项预测,赛后与实际结果对比。通过多指标评估104场比赛和13个系统,展示不同模型表现及与基线对比情况,且新赛程可添加用于评估未来模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17956 2026-07-21 cs.RO 新提交

Does Robust VIO Need More Learning? Geometry-Verified Visual Measurements under Distribution Shift

鲁棒视觉惯性里程计需要更多学习吗?分布偏移下的几何验证视觉测量

Yangyang Ning, Shu Liang, Quanbo Ge, Tianchen Deng, Yuhua Qi, Shenghai Yuan

机构 * Tongji University(同济大学) Nanjing University of Information Science and Technology(南京信息工程大学) Shanghai Jiao Tong University(上海交通大学) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

AI总结 研究分布偏移下鲁棒视觉惯性里程计是否需更多学习,提出最小学习立体VIO框架,将学习限于视觉测量生成,结合几何验证等,实验表明该方法在多种场景下准确稳定,精心集成学习视觉测量更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17842 2026-07-21 cs.CV cs.AI 新提交

CaT-GS: Efficient 3DGS Rendering for Large Scale Scenes via Inter-frame Caching and Tile Scheduling

CaT-GS:通过帧间缓存和瓦片调度实现大规模场景的高效3DGS渲染

Tingjia Zhang, Bo Chen, Shengzhong Liu, Fan Wu, Guihai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对3DGS在大规模场景中性能下降问题,CaT-GS提出通过推测性多帧预处理、帧间缓存机制及重构光栅化任务来消除冗余与减轻负载不平衡,实验证明其显著提升渲染速度,为大规模场景高保真实时渲染建立新基准。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17767 2026-07-21 cs.RO 新提交

VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking

VLN-AVP:用于自动代客泊车的基于混合长短时记忆的零样本视觉语言导航

Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)

AI总结 研究针对自主代客泊车依赖预建地图限制可扩展性问题,提出VLN-AVP零样本导航框架,结合BEV模型与VLM,引入混合记忆系统,构建数据集和基准,实验证明该方法在模拟和实际车辆实验中均有良好效果,提升了成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17423 2026-07-21 cs.CV 新提交

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

TimeLens2:使用多模态大语言模型进行通用视频时间定位

Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li, Jun Zhang, Tianxiang Jiang, Yuandong Yang, Ziang Yan, Zikang Wang, Xinyu Chen, Haoran Chen, Shaowei Zhang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学)

AI总结 研究通用视频时间定位问题,TimeLens2将时间证据视为区间集,通过多种策略构建多跨度监督,其时间瓦瑟斯坦奖励等方法提供反馈,在多个基准测试中表现出色,不同变体均有性能提升。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17412 2026-07-21 cs.LG 新提交

CORAL: Learning Amyloid Fibril Ligand Docking with Cooperative Binding Rewards

CORAL:通过协同结合奖励学习淀粉样纤维配体对接

Yasheng Sun, Bohan Li, Youqi Tao, Jürgen Schmidhuber

机构 * Center of Excellence for Generative AI, KAUST(沙特阿卜杜拉国王科技大学生成式人工智能卓越中心) MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能教育部重点实验室) Stern Laboratory, Brigham and Women’s Hospital, Harvard University(哈佛大学布莱根妇女医院斯特恩实验室)

AI总结 研究针对淀粉样纤维配体对接面临的挑战,提出CORAL强化学习框架,通过纳入协同配体 - 配体堆叠能量及蛋白质 - 配体对接亲和力训练模型,引入评估集,实验证明其在姿态质量和结合亲和力相关性上优于现有基线。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17257 2026-07-21 cs.RO cs.AI 新提交

Asynchronous Multimodal Diffusion Policy Composition via Latency-Aware Guidance Fusion

通过延迟感知引导融合实现异步多模态扩散策略组合

Zihao He, Hongjie Fang, Shirun Tang, Cewu Lu, Haoshu Fang

机构 * Shanghai Jiao Tong University(上海交通大学) Noematrix(无矩阵) Shanghai Innovation Institute(上海创新研究院)

AI总结 研究针对多模态扩散策略在模态差异下的融合问题,提出LAG - Fusion框架,通过延迟感知引导融合实现异步策略组合,推导参考帧重定位规则,在接触丰富操纵实验中提升了策略响应性和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16742 2026-07-21 cs.CV 新提交

Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model

人工智能生成的以人为中心的视频的多维质量评估:数据集与模型

Sijing Wu, Yunhao Li, Huiyu Duan, Yucheng Zhu, Xiongkuo Min, Patrick Le Callet, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学南加州大学文化创意产业学院) Polytech Nantes, Université de Nantes(法国南特大学高等理工学院)

AI总结 研究针对AI生成的以人为中心的视频质量评估问题,提出扩展数据集HVEval+并构建MoE-Rater模型,该模型采用专家混合及三阶段训练策略,能统一多种任务,在相关数据集上性能优越,推动了视频质量评估及T2V模型优化。

Comments Accepted for publication in IEEE TCSVT, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16624 2026-07-21 cs.CV 新提交

SPARE-GS: Structural Parsimony and Resource Efficiency for 3D Gaussian Splatting

SPARE-GS:用于3D高斯点云的结构简约与资源高效性

Zhang Chen, Shuai Wan, Fuzheng Yang, Jiazhi Xia, Weiyao Lin, Junhui Hou

机构 * School of Electronics and Information, Northwestern Polytechnical University(西北工业大学电子信息学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) School of Telecommunication Engineering, Xidian University(西安电子科技大学通信工程学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Department of Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电气工程系)

AI总结 研究针对3D高斯点云训练效率和表示紧凑性问题,提出SPARE-GS框架,通过将结构演化公式化并动态调整基元分布,实现减少高斯数量、训练时间,提升PSNR及下游处理效率,证明全局结构预算调节的广泛适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16355 2026-07-21 cs.CV cs.AI 新提交

PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation

PhysAgent:用于物理上合理的视频生成的反射式智能体物理控制

Qirui Li, Jinkun Hao, Yibo Li, Ran Yi, Paul L. Rosin, Yu-Kun Lai

机构 * Shanghai Jiao Tong University(上海交通大学) Cardiff University(卡迪夫大学)

AI总结 研究物理上合理的视频生成问题,提出PhysAgent反射式智能体框架,通过闭环设计及物理控制API,改善参数控制,实现复杂轨迹等,实验证明其能生成更合理视频,有更好提示对齐及泛化效果。

Comments For project page, see https://iapple233.github.io/PhysAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16327 2026-07-21 cs.CV 新提交

Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation

用于文本引导医学图像分割的定位注入视觉语言语义融合

Songyue Han, Mingye Zou, Shuchang Ye, Lei Bi, Mingyuan Meng

机构 * Air Force Engineering University(空军工程大学) Harbin Institute of Technology(哈尔滨工业大学) University of Sydney(悉尼大学) Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

AI总结 研究针对文本引导医学图像分割,提出LoG框架,通过联合执行多尺度目标定位任务,实现三级定位注入语义融合,在三个基准数据集实验中表现出色,优于现有医学图像分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏