arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

共收录 1288
2510.10510 2026-04-06 cs.LG cs.AI

f-INE: A Hypothesis Testing Framework for Estimating Influence under Training Randomness

f-INE:一种用于在训练随机性下估计影响的假设检验框架

Subhodip Panda, Dhruv Tarsadiya, Shashwat Sourav, Prathosh A. P, Sai Praneeth Karimireddy

机构 * Indian Institute of Science(印度科学研究所) University of Southern California(南加州大学) Washington University(华盛顿大学)

AI总结 本文提出f-influence框架,通过假设检验解决训练随机性导致的影响估计不稳定问题,并设计高效算法f-INE实现单次训练运行内的影响估计,用于数据清理和模型行为归因。

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19454 2026-04-06 cs.RO cs.AI cs.CV cs.LG

ROPA: Synthetic Robot Pose Generation for RGB-D Bimanual Data Augmentation

ROPA: 合成机器人姿态生成用于RGB-D双臂数据增强

Jason Chen, I-Chun Arthur Liu, Gaurav Sukhatme, Daniel Seita

机构 * University of Southern California(南加州大学)

AI总结 本文提出ROPA,通过微调Stable Diffusion生成RGB-D双臂任务的合成数据,提升机器人双臂操控的鲁棒性与数据增强效率。

Comments Accepted to the International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01350 2026-04-03 cs.CL cs.AI cs.CR

No Attacker Needed: Unintentional Cross-User Contamination in Shared-State LLM Agents

无需攻击者:共享状态LLM代理中的无意跨用户污染

Tiankai Yang, Jiate Li, Yi Nian, Shen Dong, Ruiyao Xu, Ryan Rossi, Kaize Ding, Yue Zhao

机构 * University of Southern California(南加州大学) Michigan State University(密歇根州立大学) Northwestern University(西北大学) Adobe Research(Adobe研究院)

AI总结 研究揭示共享状态LLM代理中因局部有效信息被错误应用导致的跨用户污染问题,提出三种污染类型并评估两种机制,发现需在文本级清洗外增加 artifact 级防护以防止静默失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04685 2026-04-03 cs.AI

Solving Generalized Grouping Problems in Cellular Manufacturing Systems Using a Network Flow Model

利用网络流模型解决细胞制造系统中的通用分组问题

Md. Kutub Uddin, Md. Saiful Islam, Md Abrar Jahin, Md. Saiful Islam Seam, M. F. Mridha

机构 * Department of Mechanical Engineering, Khulna University of Engineering & Technology(库尔纳工程技术大学机械工程系) Department of Industrial Engineering and Management, Khulna University of Engineering & Technology(库尔纳工程技术大学工业工程与管理系) Thomas Lord Department of Computer Science, Viterbi School of Engineering, University of Southern California(南加州大学维特比工程学院托马斯·洛德计算机科学系) Department of Computer Science, American International University-Bangladesh(美国国际大学-孟加拉国计算机科学系)

AI总结 本文提出利用网络流模型解决细胞制造系统中多工艺路线的分组问题,通过最小化工艺路线相似性优化分组,同时提出二次分配编程和启发式方法用于机器细胞形成。

Journal ref Journal of Intelligent Manufacturing and Special Equipment (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09031 2026-04-03 cs.LG cs.AI

A Comprehensive Graph Pooling Benchmark: Effectiveness, Robustness and Generalizability

图池化全面基准:有效性、鲁棒性和泛化性

Pengyun Wang, Junyu Luo, Yanxin Shen, Ming Zhang, Shaoen Qin, Hanwen Xing, Siyu Heng, Xiao Luo

机构 * University of Chicago(芝加哥大学) Peking University(北京大学) Nankai University(南开大学) University of Southern California(南加州大学) New York University(纽约大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文构建了包含17种图池化方法和28个图数据集的全面基准,系统评估了图池化方法在有效性、鲁棒性和泛化性三方面的性能,通过不同任务和噪声攻击实验验证其强大能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00892 2026-04-02 cs.CL

When Users Change Their Mind: Evaluating Interruptible Agents in Long-Horizon Web Navigation

当用户改变主意:在长周期网络导航中评估可中断代理

Henry Peng Zou, Chunyu Miao, Wei-Chieh Huang, Yankai Chen, Yue Zhou, Hanrong Zhang, Yaozu Wu, Liancheng Fang, Zhengyao Gu, Zhen Zhang, Kening Zheng, Fangxin Wang, Yi Nian, Shanghao Li, Wenzhe Fan, Langzhou He, Weizhi Zhang, Xue Liu, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) McGill University(麦吉尔大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of California Santa Barbara(加州大学圣塔芭芭拉分校) University of Southern California(南加州大学)

AI总结 本文首次系统研究长周期环境感知网络导航中可中断代理的表现,通过InterruptBench基准测试六种强大LLM,在单轮和多轮中断设置中分析其适应性和恢复效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00352 2026-04-02 cs.LG

Deep Learning-Accelerated Surrogate Optimization for High-Dimensional Well Control in Stress-Sensitive Reservoirs

深度学习加速的代理优化用于高维井控在应力敏感性储层中

Mahammad Valiyev, Jodel Cornelio, Behnam Jafarpour

机构 * University of Southern California(南加州大学)

AI总结 本文提出一种基于深度学习的代理优化框架,用于高维井控优化,通过问题导向的采样策略和神经网络代理,提升高维模拟器问题的计算效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21291 2026-04-02 stat.ML cs.LG physics.comp-ph

Closed-form conditional diffusion models for data assimilation

用于数据同化的闭式条件扩散模型

Brianna Binder, Agnimitra Dasgupta, Assad Oberai

机构 * University of Southern California(南加州大学) Sandia National Laboratories(桑迪亚国家实验室)

AI总结 本文提出闭式条件扩散模型用于数据同化,通过分析可 tractable 的 score 函数结合核密度估计,实现高效状态同化,优于传统滤波方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29997 2026-04-01 cs.CL cs.AI

Enhancing Structural Mapping with LLM-derived Abstractions for Analogical Reasoning in Narratives

通过LLM衍生抽象增强结构映射以提升叙事中的类比推理

Mohammadhossein Khojasteh, Yifan Jiang, Stefano De Giorgis, Frank van Harmelen, Filip Ilievski

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Southern California(南加州大学)

AI总结 本文提出YARN框架,利用LLM分解叙事并抽象单元,提升叙事类比推理能力,实验表明抽象显著提升性能,揭示了抽象层级、隐含因果关系和类比模式分类的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29429 2026-04-01 cs.CL

CounselReflect: A Toolkit for Auditing Mental-Health Dialogues

CounselReflect:用于审计心理健康对话的工具包

Yahan Li, Chaohao Du, Zeyang Li, Christopher Chun Kuizon, Shupeng Cheng, Angel Hsing-Chi Hwang, Adam C. Frank, Ruishan Liu

机构 * University of Southern California(南加州大学)

AI总结 本文提出CounselReflect工具包,通过多维报告和证据链接片段,提供透明的心理健康对话审计方法,结合模型评估指标和文献库指标,支持可理解、可操作和可信的审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29373 2026-04-01 cs.CL

Beyond Idealized Patients: Evaluating LLMs under Challenging Patient Behaviors in Medical Consultations

超越理想化患者:在医疗咨询中评估LLM在挑战性患者行为下的表现

Yahan Li, Xinyi Jie, Wanjia Ruan, Xubei Zhang, Huaijie Zhu, Yicheng Gao, Chaohao Du, Ruishan Liu

机构 * University of Southern California(南加州大学)

AI总结 本文研究了医疗咨询中常见的挑战性患者行为,定义了四种行为类别,并提出了CPB-Bench基准测试集,评估了多种LLM在处理这些行为时的表现,发现模型在处理矛盾或医学上不合理的患者信息时存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29258 2026-04-01 cs.CV cs.AI

Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding

Omni-NegCLIP:通过前层对比微调增强CLIP以实现全面否定理解

Jingqi Xu

机构 * University of Southern California(南加州大学)

AI总结 本文提出Omni-NegCLIP,通过修改CLIP的InfoNCE损失函数,改进其对存在性和缺失性否定表达的理解能力,实验显示在否定任务中性能提升显著,且不牺牲图像-文本检索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15695 2026-04-01 cs.CV cs.LG

ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models

ORIC:在大视觉-语言模型中基于情境不一致性的物体识别基准测试

Zhaoyang Li, Zhan Ling, Yuchen Zhou, Litian Gong, Erdem Bıyık, Hao Su

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) University of California, Riverside(加利福尼亚大学河滨分校) University of Southern California(南加利福尼亚大学)

AI总结 研究探讨了大视觉-语言模型在非典型场景中识别物体的困难,提出ORIC框架通过两种策略生成不一致的物体-情境对,并验证了情境不一致是不确定性的重要来源。

Comments We request withdrawal of this paper because one of the listed institutional affiliations was included without proper authorization. This issue cannot be resolved through a simple revision, and we therefore request withdrawal to prevent dissemination of incorrect or unauthorized affiliation information

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15624 2026-03-31 stat.ML cs.LG stat.ME

Trans-Glasso: A Transfer Learning Approach to Precision Matrix Estimation

Trans-Glasso:一种用于精准矩阵估计的迁移学习方法

Boxin Zhao, Cong Ma, Mladen Kolar

机构 * Booth School of Business, University of Chicago(芝加哥大学布斯商学院) Department of Statistics, University of Chicago(芝加哥大学统计系) Department of Data Sciences and Operations, Marshall School of Business, University of Southern California(南加州大学马歇尔商学院数据科学与运营系)

AI总结 Trans-Glasso通过迁移学习方法提升小样本下的精准矩阵估计精度,结合多任务学习和微分网络估计,在基因网络和蛋白质网络中验证了其有效性,并推导了微分网络估计的最优率。

Comments 58 pages, 13 figures. Accepted by the Journal of the American Statistical Association (JASA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27449 2026-03-31 cs.CV

LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model

LOME:基于动作条件的视点世界模型学习人类-物体操控

Quankai Gao, Jiawei Yang, Qiangeng Xu, Le Chen, Yue Wang

机构 * University of Southern California(南加州大学)

AI总结 LOME通过结合空间人类动作与环境上下文,生成逼真的人-物交互视频,提升动作跟随精度与泛化能力,实现物理效果如液体倒出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26975 2026-03-31 cs.LG

Probabilistic Forecasting of Localized Wildfire Spread Based on Conditional Flow Matching

基于条件流匹配的局部野火蔓延概率预报

Bryan Shaddy, Haitong Qin, Brianna Binder, James Haley, Riya Duddalwar, Kyle Hilburn, Assad Oberai

机构 * University of Southern California(南加州大学) Colorado State University(科罗拉多州立大学)

AI总结 本文提出基于条件流匹配算法的局部野火蔓延概率代理模型,通过学习火灾到达时间的条件分布,结合环境和大气输入,实现高效生成到达时间的不确定性预测,适用于子域局部预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03192 2026-03-31 cs.CV cs.CL cs.LG

MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization

MoD-DPO:通过模态解耦偏好优化缓解多模态幻觉

Ashutosh Chaubey, Jiacheng Pang, Mohammad Soleymani

机构 * University of Southern California(南加州大学)

AI总结 本文提出MoD-DPO框架,通过引入模态感知正则化项和语言先验去偏惩罚,提升多模态大模型的模态对齐能力,实验表明其在多模态幻觉基准测试中表现优异。

Comments CVPR 2026. Project Page: https://mod-dpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26837 2026-03-31 cs.RO cs.AI cs.CV

SpatialAnt: Autonomous Zero-Shot Robot Navigation via Active Scene Reconstruction and Visual Anticipation

SpatialAnt:通过主动场景重建与视觉预判实现自主零样本机器人导航

Jiwen Zhang, Xiangyu Shi, Siyuan Wang, Zerui Li, Zhongyu Wei, Qi Wu

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) Adelaide University(阿德莱德大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 SpatialAnt通过主动场景重建和视觉预判机制,解决零样本机器人导航中自建场景的不完整和噪声问题,提升导航性能。

Comments 10 pages, 4 figures, 5 tables. Homepage: https://imnearth.github.io/Spatial-X/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26078 2026-03-30 cs.CV cs.AI

When Identities Collapse: A Stress-Test Benchmark for Multi-Subject Personalization

当身份崩溃时:多主体个性化的一个压力测试基准

Zhihan Chen, Yuhuan Zhao, Yijie Zhu, Xinyu Yao

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) DeerLab LLC(DeerLab有限责任公司) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一个压力测试基准,揭示多主体生成模型在复杂场景下的身份崩溃问题,并引入新的评估指标SCR,强调未来生成架构需显式物理解耦。

Comments 10 pages, 7 figures, accepted by CVPR 2026 Workshop P13N

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14688 2026-03-30 cs.LG cs.AI cs.SE

AgentTrace: Causal Graph Tracing for Root Cause Analysis in Deployed Multi-Agent Systems

AgentTrace: 多智能体系统部署中的因果图追踪用于根本原因分析

Zhaohui Geoffrey Wang

机构 * USC Viterbi School of Engineering(南加州大学维特比工程学院)

AI总结 AgentTrace通过构建因果图追踪多智能体系统部署中的根本原因,实现高精度和低延迟的故障诊断,优于启发式和LLM基线方法。

Comments 11 pages, 1 figure, 19 tables. Published at ICLR 2026 Workshop on Agents in the Wild. Camera-ready version with revised layout and framework overview figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22025 2026-03-30 cs.CV

Olbedo: An Albedo and Shading Aerial Dataset for Large-Scale Outdoor Environments

Olbedo:一个用于大规模户外环境的反光与阴影数据集

Shuang Song, Debao Huang, Deyan Deng, Haolin Xiong, Yang Tang, Yajie Zhao, Rongjun Qin

机构 * The Ohio State University(俄亥俄州立大学) University of Southern California(南加州大学) Institute for Creative Technologies(创意技术研究所)

AI总结 Olbedo数据集通过多视角一致的反光和阴影地图等标注,使基于合成数据训练的扩散模型在真实户外场景中实现更优的内在图像分解性能,支持3D资产光照一致重映射和城市数字孪生分析。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11805 2026-03-30 eess.SY cs.NE cs.RO cs.SY

Control of a commercially available vehicle by a tetraplegic human using a brain-computer interface

通过脑机接口控制商用汽车的瘫痪人类

Xinyun Zou, Jorge Gamez, Meghna Menon, Phillip Ring, Chadwick Boulay, Likhith Chitneni, Jackson Brennecke, Shana R. Melby, Gracy Kureel, Kelsie Pejsa, Emily R. Rosario, Ausaf A. Bari, Aniruddh Ravindran, Tyson Aflalo, Spencer S. Kellis, Dimitar Filev, Florian Solzbacher, Richard A. Andersen

机构 * California Institute of Technology(加州理工学院) Ford Motor Company(福特汽车公司) Blackrock Neurotech(黑石神经技术公司) Casa Colina Hospital and Centers for Healthcare(卡萨科利纳医院与医疗中心) University of California Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) The University of Utah(犹他大学)

AI总结 研究通过脑机接口实现瘫痪患者在模拟和真实环境中的车辆操控,证明其与正常人相当的操控速度和精度,展示了BCI在驾驶控制中的可行性与创新性。

Comments 50 pages, 7 figures, 1 table. 27 supplementary pages, 9 supplementary figures, 13 supplementary tables, 9 supplementary movies available as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10971 2026-03-30 cs.CV

ERMoE: Eigen-Reparameterized Mixture-of-Experts for Stable Routing and Interpretable Specialization

ERMoE:基于特征的混合专家架构用于稳定路由和可解释的专业化

Anzhe Cheng, Shukai Duan, Shixuan Li, Chenzhong Yin, Mingxi Cheng, Heng Ping, Tamoghna Chattopadhyay, Sophia I Thomopoulos, Shahin Nazarian, Paul Thompson, Paul Bogdan

机构 * University of Southern California(南加州大学)

AI总结 ERMoE通过重新参数化专家在学习的正交特征基上,改进路由稳定性与专家专业化可解释性,无需显式平衡损失,提升ImageNet和跨模态检索任务性能。

Comments Accepted in CVPR2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25733 2026-03-27 cs.CV

SlotVTG: Object-Centric Adapter for Generalizable Video Temporal Grounding

SlotVTG: 用于通用视频时间定位的对象中心适配器

Jiwook Han, Geo Ahn, Youngrae Kim, Jinwoo Choi

机构 * Kyung Hee University(庆熙大学) University of Southern California(南加州大学)

AI总结 SlotVTG通过引入轻量级槽适配器,使MLLMs在最小成本下实现对象中心的输入关联视觉推理,提升跨域鲁棒性的同时保持领域内性能。

Comments Accepted to GRAIL-V workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25046 2026-03-27 cs.AI cs.LG

MP-MoE: Matrix Profile-Guided Mixture of Experts for Precipitation Forecasting

基于矩阵轮廓的混合专家模型:用于降水预测

Huyen Ngoc Tran, Dung Trung Tran, Hong Nguyen, Xuan Vu Phan, Nam-Phong Nguyen

机构 * School of Electronics and Electrical Engineering, Hanoi University of Science and Technology(河内科技大学电子与电气工程学院) Department of Electrical and Computer Engineering, University of Southern California, United States(美国南加州大学电气与计算机工程系)

AI总结 本文提出MP-MoE模型,结合传统强度损失与结构感知的矩阵轮廓目标,通过子序列相似性提升专家选择可靠性,减少相位偏移带来的惩罚,实验证明在越南两个流域的降雨数据上,MP-MoE在重降水事件的CSI-M指标上优于原始NWP和基线方法,同时降低DTW值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25020 2026-03-27 cs.CV

GDPO-Listener: Expressive Interactive Head Generation via Auto-Regressive Flow Matching and Group reward-Decoupled Policy Optimization

GDPO-Listener: 通过自动回归流匹配和组奖励解耦策略优化实现表达性交互头部生成

Zhangyu Jin, Maksim Siniukov, Deuksin Kwon, Ashutosh Chaubey, Mohammad Soleymani

机构 * University of Southern California, Institute for Creative Technologies(南加州大学创意技术研究所)

AI总结 本文提出GDPO-Listener框架,通过自动回归流匹配和组奖励解耦策略优化,实现高表达性的说话和倾听动作生成,提升了长期运动变化、视觉表达性和语义可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24912 2026-03-27 cs.CV

ICTPolarReal: A Polarized Reflection and Material Dataset of Real World Objects

ICTPolarReal:真实世界物体的偏振反射与材质数据集

Jing Yang, Krithika Dharanikota, Emily Jia, Haiwei Chen, Yajie Zhao

机构 * Institute for Creative Technologies, University of Southern California(南加州大学创意技术研究所)

AI总结 本文提出一个大规模真实世界物体偏振反射与材质数据集,用于改进逆渲染和正渲染模型的材料分离与光照真实性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24897 2026-03-27 cs.CV

SurgPhase: Time efficient pituitary tumor surgery phase recognition via an interactive web platform

SurgPhase: 一种高效的垂体肿瘤手术阶段识别交互式网页平台

Yan Meng, Jack Cook, X. Y. Han, Kaan Duman, Shauna Otto, Dhiraj Pangal, Jonathan Chainey, Ruth Lau, Margaux Masson-Forsythe, Daniel A. Donoho, Danielle Levy, Gabriel Zada, Sébastien Froelich, Juan Fernandez-Miranda, Mike Chang

机构 * Children's National Hospital(儿童国家医院) Booth School of Business, University of Chicago(芝加哥大学布斯商学院) Division of Neurosurgery, Department of Surgery, University of Montreal(蒙特利尔大学外科学系神经外科) Wilson Centre for Research in Education, University Health Network(大学健康网络威尔逊教育研究中心) Department of Neurosurgery, Hospital Universitari Joan XXIII(胡安二十三世大学医院神经外科) University of Southern California(南加州大学) Stanford University School of Medicine(斯坦福大学医学院)

AI总结 本文提出SurgPhase平台,通过自监督学习和时间建模实现垂体肿瘤手术阶段识别,准确率达90%,并提供数据标注和模型优化功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24835 2026-03-27 cs.CV

DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation

DCARL:一种用于自回归长轨迹视频生成的分而治之框架

Junyi Ouyang, Wenbin Teng, Gonglin Chen, Yajie Zhao, Haiwei Chen

机构 * Institute for Creative Technologies(创意技术研究所) University of Southern California(南加州大学)

AI总结 本文提出DCARL框架,通过分而治之策略结合VDMs的高保真生成能力,解决长轨迹视频生成中的视觉漂移和可控性问题,实现高质量且稳定的生成。

Comments 29 pages, 11 figures. Project page: https://junyiouy.github.io/projects/dcarl

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16889 2026-03-27 cs.CL

Can GRPO Boost Complex Multimodal Table Understanding?

GRPO能否提升复杂多模态表格理解?

Xiaoqiang Kang, Shengen Wu, Zimu Wang, Yilin Liu, Xiaobo Jin, Kaizhu Huang, Wei Wang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) University of Southern California(南加州大学) Duke Kunshan University(杜克大学昆山分校)

AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。

Comments EMNLP 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏