arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Southern California(南加州大学)

2026-03-27 至 2026-03-27 共收录 8
2603.25733 2026-03-27 cs.CV

SlotVTG: Object-Centric Adapter for Generalizable Video Temporal Grounding

SlotVTG: 用于通用视频时间定位的对象中心适配器

Jiwook Han, Geo Ahn, Youngrae Kim, Jinwoo Choi

机构 * Kyung Hee University(庆熙大学) University of Southern California(南加州大学)

AI总结 SlotVTG通过引入轻量级槽适配器,使MLLMs在最小成本下实现对象中心的输入关联视觉推理,提升跨域鲁棒性的同时保持领域内性能。

Comments Accepted to GRAIL-V workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25046 2026-03-27 cs.AI cs.LG

MP-MoE: Matrix Profile-Guided Mixture of Experts for Precipitation Forecasting

基于矩阵轮廓的混合专家模型:用于降水预测

Huyen Ngoc Tran, Dung Trung Tran, Hong Nguyen, Xuan Vu Phan, Nam-Phong Nguyen

机构 * School of Electronics and Electrical Engineering, Hanoi University of Science and Technology(河内科技大学电子与电气工程学院) Department of Electrical and Computer Engineering, University of Southern California, United States(美国南加州大学电气与计算机工程系)

AI总结 本文提出MP-MoE模型,结合传统强度损失与结构感知的矩阵轮廓目标,通过子序列相似性提升专家选择可靠性,减少相位偏移带来的惩罚,实验证明在越南两个流域的降雨数据上,MP-MoE在重降水事件的CSI-M指标上优于原始NWP和基线方法,同时降低DTW值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25020 2026-03-27 cs.CV

GDPO-Listener: Expressive Interactive Head Generation via Auto-Regressive Flow Matching and Group reward-Decoupled Policy Optimization

GDPO-Listener: 通过自动回归流匹配和组奖励解耦策略优化实现表达性交互头部生成

Zhangyu Jin, Maksim Siniukov, Deuksin Kwon, Ashutosh Chaubey, Mohammad Soleymani

机构 * University of Southern California, Institute for Creative Technologies(南加州大学创意技术研究所)

AI总结 本文提出GDPO-Listener框架,通过自动回归流匹配和组奖励解耦策略优化,实现高表达性的说话和倾听动作生成,提升了长期运动变化、视觉表达性和语义可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24912 2026-03-27 cs.CV

ICTPolarReal: A Polarized Reflection and Material Dataset of Real World Objects

ICTPolarReal:真实世界物体的偏振反射与材质数据集

Jing Yang, Krithika Dharanikota, Emily Jia, Haiwei Chen, Yajie Zhao

机构 * Institute for Creative Technologies, University of Southern California(南加州大学创意技术研究所)

AI总结 本文提出一个大规模真实世界物体偏振反射与材质数据集,用于改进逆渲染和正渲染模型的材料分离与光照真实性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24897 2026-03-27 cs.CV

SurgPhase: Time efficient pituitary tumor surgery phase recognition via an interactive web platform

SurgPhase: 一种高效的垂体肿瘤手术阶段识别交互式网页平台

Yan Meng, Jack Cook, X. Y. Han, Kaan Duman, Shauna Otto, Dhiraj Pangal, Jonathan Chainey, Ruth Lau, Margaux Masson-Forsythe, Daniel A. Donoho, Danielle Levy, Gabriel Zada, Sébastien Froelich, Juan Fernandez-Miranda, Mike Chang

机构 * Children's National Hospital(儿童国家医院) Booth School of Business, University of Chicago(芝加哥大学布斯商学院) Division of Neurosurgery, Department of Surgery, University of Montreal(蒙特利尔大学外科学系神经外科) Wilson Centre for Research in Education, University Health Network(大学健康网络威尔逊教育研究中心) Department of Neurosurgery, Hospital Universitari Joan XXIII(胡安二十三世大学医院神经外科) University of Southern California(南加州大学) Stanford University School of Medicine(斯坦福大学医学院)

AI总结 本文提出SurgPhase平台,通过自监督学习和时间建模实现垂体肿瘤手术阶段识别,准确率达90%,并提供数据标注和模型优化功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24835 2026-03-27 cs.CV

DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation

DCARL:一种用于自回归长轨迹视频生成的分而治之框架

Junyi Ouyang, Wenbin Teng, Gonglin Chen, Yajie Zhao, Haiwei Chen

机构 * Institute for Creative Technologies(创意技术研究所) University of Southern California(南加州大学)

AI总结 本文提出DCARL框架,通过分而治之策略结合VDMs的高保真生成能力,解决长轨迹视频生成中的视觉漂移和可控性问题,实现高质量且稳定的生成。

Comments 29 pages, 11 figures. Project page: https://junyiouy.github.io/projects/dcarl

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16889 2026-03-27 cs.CL

Can GRPO Boost Complex Multimodal Table Understanding?

GRPO能否提升复杂多模态表格理解?

Xiaoqiang Kang, Shengen Wu, Zimu Wang, Yilin Liu, Xiaobo Jin, Kaizhu Huang, Wei Wang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) University of Southern California(南加州大学) Duke Kunshan University(杜克大学昆山分校)

AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。

Comments EMNLP 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12476 2026-03-27 cs.CL cs.LG

Retrieval-Reasoning Large Language Model-based Synthetic Clinical Trial Generation

基于检索-推理的大型语言模型合成临床试验生成

Zerui Xu, Fang Wu, Yingzhou Lu, Yuanyuan Zhang, Yue Zhao

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒实验室) University of Chicago(芝加哥大学) Stanford University(斯坦福大学) Purdue University(普渡大学) University of Southern California(南加州大学)

AI总结 本文提出基于检索-推理框架的合成临床试验生成方法,利用LLM生成标注二元结果的合成试验报告,通过检索模块和推理模块提升生成质量,实验证明合成数据可有效增强真实数据集并提升临床试验预测性能。

Comments Published in ACM BCB 2025. 9 pages, 4 figures, 5 tables (Main paper + Supplementary Materials)

Journal ref Proceedings of the 16th ACM International Conference on Bioinformatics, Computational Biology, and Health Informatics (ACM BCB 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏