arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2925
2508.01330 2026-04-21 cs.AI

NaturalGAIA: A Verifiable Benchmark and Hierarchical Framework for Long-Horizon GUI Tasks

NaturalGAIA:一个可验证的基准和分层框架用于长周期GUI任务

Zihan Zheng, Tianle Cui, Taoran Wang, Fengtao Wang, Jiahui Pan, Lewei He, Qianglong Chen

机构 * South China Normal University(华南师范大学) Zhejiang University(浙江大学)

AI总结 本文提出NaturalGAIA,通过真实人类GUI交互意图构建可验证评估数据集,结合LightManus-Jarvis框架,实现复杂自然任务的宏规划与微执行,实验显示其在路径成功率、token消耗和执行时间上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11338 2026-04-21 cs.AI cs.LG

Automatic Dataset Construction (ADC): Sample Collection, Data Curation, and Beyond

自动数据集构建(ADC):样本收集、数据整理与更广泛的领域

Minghao Liu, Zonglin Di, Jiaheng Wei, Zhongruo Wang, Hengxiang Zhang, Ruixuan Xiao, Haoyu Wang, Jinlong Pang, Hao Chen, Ankit Shah, Hongxin Wei, Xinlei He, Zhaowei Zhao, Haobo Wang, Lei Feng, Jindong Wang, James Davis, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Amazon(亚马逊) SUSTech(华南理工大学) Zhejiang University(浙江大学) Yale University(耶鲁大学) Carnegie Mellon University(卡内基梅隆大学) HKUST (GZ)(香港科技大学) Nanyang Technological University(南洋理工大学) Microsoft(微软)

AI总结 本文提出自动数据集构建方法ADC,通过LLM实现高效数据集生成,减少人工标注成本,构建包含12个主类和12000个细粒度子类的Clothing-ADC数据集,降低标签噪声至10.7%,并设计三个针对标签噪声和类别不平衡的基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13004 2026-04-21 cs.CE cs.AI

A Unified Framework for Modeling Heterogeneous Financial Data via Dual-Granularity Prompting

通过双粒度提示构建异质金融数据建模的统一框架

Yu Lei, Zixuan Wang, Yiqing Feng, Junru Zhang, Yahui Li, Chu Liu, Tongyao Wang, Dongyang Li

机构 * DiDi International Business Group(滴滴国际商务集团) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

AI总结 本文提出FinLangNet框架,通过双模块架构结合表格特征提取与时间序列建模,解决工业信用评分中异质金融数据复杂性和信用worthiness演变的挑战,实验证明其在KS指标和坏账率上有显著提升。

Comments ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17082 2026-04-21 cs.CV

D-Prism: Differentiable Primitives for Structured Dynamic Modeling

D-Prism:用于结构动态建模的可微原始体

Xingyuan Yu, Yijin Li, Chong Zeng, Yuhang Ming, Hujun Bao, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Stanford University(斯坦福大学) Hangzhou Dianzi University(杭州电子科技大学)

AI总结 本文提出D-Prism框架,通过扩展可微原始体到动态领域,实现高保真的结构动态建模,结合3DGS和原始体的优势,引入变形网络和自适应控制策略,提升结构动态建模的精度和效率。

Comments Accepted to CVPR 2026. Project page: https://zju3dv.github.io/d-prism/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16972 2026-04-21 cs.AI

MCPO: Mastery-Consolidated Policy Optimization for Large Reasoning Models

MCPO:面向大推理模型的 mastery-consolidated 策略优化

Zhaokang Liao, Yingguo Gao, Yi Yang, Yongheng Hu, Jingting Ding

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

AI总结 本文提出 MCPO 算法,通过引入 hinge-KL 正则化和优先机制,解决高准确度提示下的策略漂移和巩固问题,提升大模型推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16959 2026-04-21 cs.LG cs.CV

Hyperbolic Enhanced Representation Learning for Incomplete Multi-view Clustering

双曲增强表示学习用于不完整多视图聚类

Tianyi Chen, Haobo Wang, Kai Tang, Gengyu Lyu, Tianlei Hu, Gang Chen, Hong Ma, Meixiang Xiang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Beijing Key Laboratory of Traffic Data Analysis and Mining, Beijing Jiaotong University(北京交通大学交通数据挖掘与分析重点实验室) School of Medicine, Zhejiang University(浙江大学医学院)

AI总结 本文提出HERL框架,通过双曲空间中的结构感知潜在空间,解决不完整多视图聚类中表示学习的语义模糊问题,通过角度和距离损失提升聚类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16493 2026-04-21 cs.DB cs.AI cs.CL cs.LG

NL2SQLBench: A Modular Benchmarking Framework for LLM-Enabled NL2SQL Solutions

NL2SQLBench: 一个模块化评估和基准测试框架,用于LLM驱动的NL2SQL解决方案

Shizheng Hou, Wenqi Pei, Nuo Chen, Quang-Trung Ta, Peng Lu, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

AI总结 本文提出NL2SQLBench框架,用于评估LLM驱动的NL2SQL方法,通过三个核心模块分析现有策略并提出新指标,评估十种开源方法,揭示现有方法的准确性和效率问题,为未来创新提供指导。

Comments The paper is accepted by VLDB 2026

Journal ref PVLDB, 19(5): 1001 - 1015, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19857 2026-04-21 cs.SD cs.CV

FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts

FoleyDirector: 通过结构化脚本实现视频到音频生成的细粒度时间控制

You Li, Dewei Zhou, Fan Ma, Fu Li, Dongliang He, Yi Yang

机构 * The State Key Lab of Brain-Machine Intelligence, Zhejiang University(浙江大学脑机智能State Key Lab) ReLER, CCAl, Zhejiang University(浙江大学ReLER, CCAl) Intelligent Creation, ByteDance, China(字节跳动智能创作)

AI总结 本文提出FoleyDirector框架,通过结构化时间脚本提升视频到音频生成的细粒度时间控制能力,同时保持音频质量并支持无缝切换生成与受控合成。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13684 2026-04-21 cs.CL cs.AI

HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference

HeteroCache:一种用于长上下文LLM推理的异构KV缓存压缩动态检索方法

Zhiyuan Shi, Qibo Qiu, Feng Xue, Zhonglin Jiang, Li Yu, Jian Jiang, Xiaofei He, Wenxiao Wang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) China Mobile (Zhejiang) Research & Innovation Institute(中国移动(浙江)研究院) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) Geely Automobile Research Institute (Ningbo) Co., Ltd.(吉利汽车研究院(宁波)有限公司) FABU Inc.(FABU公司)

AI总结 本文提出HeteroCache,通过动态检索方法解决KV缓存压缩问题,利用头部异质性和空间冗余性,实现高效缓存分配和存储机制,提升长上下文推理性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14410 2026-04-21 cs.AI

ORThought: Benchmarking and Automating Logistics Optimization Modeling

ORThought: 物流优化建模的基准测试与自动化

Beinuo Yang, Qishen Zhou, Junyi Li, Chenxing Su, Panagiotis Angeloudis, Simon Hu

机构 * ZJU-UIUC Institute, Zhejiang University(浙江大学浙大-伊利诺伊大学联合学院) School of Transportation, Jilin University(吉林大学交通运输学院) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究所) Department of Civil and Environmental Engineering, Imperial College London(伦敦帝国理工学院土木与环境工程系)

AI总结 本文提出ORThought框架,通过引入专家级建模原理,解决物流优化建模中的基准不足、多智能体框架不稳定及评估深度不足等问题,实验证明其在复杂约束下表现优异。

Comments The paper has been accepted by Artificial Intelligence for Transportation

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16549 2026-04-21 cs.CV

MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems

MathFlow: 提升多模态大语言模型在视觉数学问题中的感知流

Shuhang Chen, Hangjie Yuan, Yunqiu Xu, Pengwei Liu, Tao Feng, Jun Cen, Zeying Huang, Yi Yang

机构 * Zhejiang University(浙江大学) Intelligent Learning(智能学习) Tsinghua University(清华大学)

AI总结 本文提出MathFlow框架,通过分离感知与推理阶段,提升多模态大语言模型在视觉数学问题中的表现,实验表明其在不同推理模型中均有效。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15845 2026-04-21 cs.LG

Network-wide Freeway Traffic Estimation Using Sparse Sensor Data: A Dirichlet Graph Auto-Encoder Approach

基于稀疏传感器数据的网络级高速公路交通状态估计:一种Dirichlet图自编码器方法

Qishen Zhou, Yifan Zhang, Michail A. Makridis, Anastasios Kouvelas, Yibing Wang, Simon Hu

机构 * Institute of Intelligent Transportation Systems, College of Civil Engineering and Architecture, Zhejiang University(智能交通系统研究院,土木工程与建筑学院,浙江大学)

AI总结 本文提出DGAE模型,通过理论推导的DEFP4D、增强的空间表示学习和物理引导的传播机制,解决网络级交通状态估计中的方向性、空间相关性和不同模式传播规则问题。

Journal ref IEEE Transactions on Intelligent Transportation Systems, vol. 26, no. 12, pp. 22161-22177, Dec. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12281 2026-04-21 cs.LG

MoGERNN: An Inductive Traffic Predictor for Unobserved Locations

MoGERNN:一种用于未观测位置的归纳性交通预测器

Qishen Zhou, Yifan Zhang, Michail A. Makridis, Anastasios Kouvelas, Yibing Wang, Simon Hu

机构 * Institute of Intelligent Transportation Systems, College of Civil Engineering and Architecture, Zhejiang University(智能交通系统研究院,土木工程与建筑学院,浙江大学) Institute for Transport Planning and Systems, ETH Zurich(交通规划与系统研究所,苏黎世联邦理工学院) Department of Computer Science, City University of Hong Kong (Dongguan)(计算机科学系,香港城市大学(东莞)) ZJU-UIUC Institute, Zhejiang University(浙大-UIUC研究院,浙江大学)

AI总结 本文提出MoGERNN,一种结合图专家混合与图编码器-解码器的时空图模型,用于预测未观测位置的交通状态,实验显示其在观测与未观测区域均表现优异,且具备适应传感器网络变化的能力。

Journal ref Transportation Research Part C: Emerging Technologies, Volume 174, 2025, 105080, ISSN 0968-090X

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02953 2026-04-21 cs.CR cs.LG

Unraveling the Key of Machine Learning-based Android Malware Detection

解开基于机器学习的Android恶意软件检测的关键

Jiahao Liu, Jun Zeng, Fabio Pierazzi, Ziqi Yang, Lorenzo Cavallaro, Zhenkai Liang

机构 * National University of Singapore(新加坡国立大学) University College London(伦敦大学学院) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

AI总结 本文系统分析了基于机器学习的Android恶意软件检测方法,提出统一分类框架并评估了12种代表性方法,揭示了现有检测器在恶意软件演变和对抗攻击方面的挑战。

Comments Accepted by ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16217 2026-04-20 cs.CL cs.AI

Beyond Surface Statistics: Robust Conformal Prediction for LLMs via Internal Representations

超越表面统计:通过内部表示实现LLM的鲁棒置信预测

Yanli Wang, Peng Kuang, Xiaoyu Han, Kaidi Xu, Haohan Wang

机构 * Imperial College London(伦敦帝国学院) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) City University of Hong Kong(香港城市大学)

AI总结 本文提出一种基于内部表示的置信预测框架,通过层间信息评分提升LLM在分布偏移下的鲁棒性,优于文本层面基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16214 2026-04-20 cs.CV

GAViD: A Large-Scale Multimodal Dataset for Context-Aware Group Affect Recognition from Videos

GAViD:一个大规模多模态数据集,用于视频中基于情境的群体情感识别

Deepak Kumar, Abhishek Pratap Singh, Puneet Kumar, Xiaobai Li, Balasubramanian Raman

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Roorkee(计算机科学与工程系,印度理工学院Roorkee分校) Indian Institute of Technology Ropar(印度理工学院Ropar分校) Zhejiang University(浙江大学) University of Oulu(奥卢大学)

AI总结 本文提出GAViD数据集和CAGNet网络,用于视频中基于情境的群体情感识别,通过多模态数据和上下文信息提升识别性能,测试准确率达63.20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15237 2026-04-20 cs.CV

StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression

StreamCacheVGGT:具有鲁棒评分和混合缓存压缩的流式视觉几何变换

Xuanyi Liu, Chunan Yu, Deyi Ji, Qi Zhu, Lingyun Sun, Xuanfu Li, Jin Ma, Tianrun Chen, Lanyun Zhu

机构 * Peking University(北京大学) Nanjing University of Science and Technology(南京理工大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Huawei(华为) Tongji University(同济大学)

AI总结 本文提出StreamCacheVGGT框架,通过Cross-Layer Consistency-Enhanced Scoring和Hybrid Cache Compression模块,解决流式视频中稳定重建密集3D几何的问题,实现高精度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23714 2026-04-20 cs.CL

Collaboration of Fusion and Independence: Hypercomplex-driven Robust Multi-Modal Knowledge Graph Completion

融合与独立的协作:超复数驱动的鲁棒多模态知识图谱补全

Zhiqiang Liu, Yichi Zhang, Mengshu Sun, Lei Liang, Wen Zhang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-Ant Group Joint Lab of Knowledge Graph(浙大蚂蚁集团知识图谱联合实验室) Ant Group(蚂蚁集团)

AI总结 本文提出M-Hyper方法,结合融合与独立模态表示,利用四元数代数实现多模态交互,提升知识图谱补全的鲁棒性和效率。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15998 2026-04-20 cs.CL

SCHK-HTC: Sibling Contrastive Learning with Hierarchical Knowledge-Aware Prompt Tuning for Hierarchical Text Classification

SCHK-HTC:基于层次知识感知提示微调的兄弟对比学习用于层次文本分类

Ke Xiong, Qian Wu, Wangjie Gan, Yuke Li, Xuhong Zhang

机构 * School of Software Technology, Zhejiang University, China(浙江大学软件学院) NetEase Yidun AI Lab, Hangzhou, China(网易易盾人工智能实验室)

AI总结 本文提出SCHK-HTC方法,通过层次知识提取模块和兄弟对比学习机制提升少样本层次文本分类性能,优于现有最先进方法。

Comments 5pages,3 figures,ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15871 2026-04-20 cs.CV cs.AI

UniEditBench: A Unified and Cost-Effective Benchmark for Image and Video Editing via Distilled MLLMs

UniEditBench: 一种统一且成本效益高的图像和视频编辑基准,通过压缩的多模态大语言模型

Lifan Jiang, Tianrun Wu, Yuhang Pei, Chenyang Wang, Boxi Wu, Deng Cai

机构 * Zhejiang University(浙江大学)

AI总结 UniEditBench提出统一的图像和视频编辑基准,支持基于重建和指令驱动的方法,通过压缩的多模态大语言模型提供多维评分,减少部署成本并提高评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15823 2026-04-20 cs.CV

Watching Movies Like a Human: Egocentric Emotion Understanding for Embodied Companions

像人类一样看电影:面向具身陪伴的视角中心情绪理解

Ze Dong, Hao Shi, Zejia Gao, Zhonghua Yi, Kaiwei Wang, Lin Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学, 新加坡) Zhejiang University, China(浙江大学, 中国) Ant Group, China(蚂蚁集团, 中国) MirrorMe, China(MirrorMe, 中国)

AI总结 本文提出EgoScreen-Emotion基准数据集,用于视角中心电影情绪理解,通过多标签标注和长上下文模型提升跨域泛化能力,实验显示基于传统电影数据的模型在真实视角观看场景中性能显著下降。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15710 2026-04-20 cs.SD

VoxMind: An End-to-End Agentic Spoken Dialogue System

VoxMind:一个端到端的智能语音对话系统

Tianle Liang, Yifu Chen, Shengpeng Ji, Yijun Chen, Zhiyang Jia, Jingyu Lu, Fan Zhuo, Xueyi Pu, Yangzhuo Li, Zhou Zhao

机构 * Zhejiang University(浙江大学) China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) Xiamen University(厦门大学)

AI总结 本文提出VoxMind,通过引入智能代理能力,提升端到端语音对话系统在复杂任务中的表现,实验表明其任务完成率显著提高。

Comments Accepted to ACL 2026 Main Conference.Code and data available at https://github.com/MM-Speech/VoxMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13226 2026-04-20 cs.LG cs.AI

KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs

KV Packet: 无重新计算的上下文无关KV缓存用于LLMs

Chuangtao Chen, Grace Li Zhang, Xunzhao Yin, Cheng Zhuo, Bing Li, Ulf Schlichtmann

机构 * Technical University of Munich(慕尼黑技术大学) Technical University of Darmstadt(达姆施塔特技术大学) Zhejiang University(浙江大学) Technische Universität Ilmenau(伊尔梅瑙技术大学)

AI总结 KV Packet通过轻量可训练软令牌适配器实现无重新计算的上下文无关KV缓存,实验表明其在FLOPs和TTFT上优于基线方法,同时保持与完整重新计算基线相当的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02210 2026-04-20 cs.CV

HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Images

HiFi-Inpaint:迈向高保真参考基于修复生成细节保留的人-产品图像

Yichen Liu, Donghao Zhou, Jie Wang, Xin Gao, Guisheng Liu, Jiatong Li, Quanwei Zhang, Qiang Lyu, Lanqing Guo, Shilei Wen, Weiqiang Wang, Pheng-Ann Heng

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学)

AI总结 本文提出HiFi-Inpaint框架,通过Shared Enhancement Attention和Detail-Aware Loss解决人-产品图像生成中的细节保留问题,并构建了HP-Image-40K数据集,实验表明其在生成高保真图像方面表现优异。

Comments Accepted by CVPR 2026 (Project page: https://correr-zhou.github.io/HiFi-Inpaint/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04377 2026-04-20 cs.CL cs.AI cs.LG

Disco-RAG: Discourse-Aware Retrieval-Augmented Generation

Disco-RAG: 语篇意识的检索增强生成

Dongqi Liu, Hang Ding, Qiming Feng, Xurong Xie, Zhucun Xue, Chengjie Wang, Jian Li, Jiangning Zhang, Yabiao Wang

机构 * Saarland University(萨尔兰大学) Shanghai Jiaotong University(上海交通大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯优图实验室)

AI总结 Discourse-aware RAG框架通过构建篇章内结构树和跨篇章修辞图,提升知识整合能力,在问答和长文档摘要任务中取得最佳效果。

Comments ACL 2026 Main & Long Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07774 2026-04-20 cs.CL

Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards

用评分奖励模型治愈大语言模型数学推理中的奇迹步骤

Youliang Yuan, Qiuyang Mang, Jingbang Chen, Hong Wan, Xiaoyuan Liu, Junjielong Xu, Jen-tse Huang, Wenxuan Wang, Wenxiang Jiao, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院,香港中文大学(深圳)) UC Berkeley(加州大学伯克利分校) Zhejiang University(浙江大学) Johns Hopkins University(约翰霍普金斯大学) Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司)

AI总结 本文通过评分奖励模型解决大语言模型数学推理中的奇迹步骤问题,通过系统分析和人类验证建立失败模式分类,提升推理准确性和可靠性。

Comments Accepted by ACL 2026 Main, 22 pages, 10 figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04300 2026-04-20 cs.CV cs.AI

T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive Concepts

T2I-FactualBench:基于知识密集概念的文本到图像模型事实性评估基准

Ziwei Huang, Wanggui He, Quanyu Long, Yandi Wang, Haoyuan Li, Zhelun Yu, Fangxun Shu, Long Chan, Hao Jiang, Fei Wu, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学)

AI总结 本文提出T2I-FactualBench,通过知识密集概念评估文本到图像模型的事实性,揭示当前SOTA模型在事实性上的不足。

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 27501-27524, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15281 2026-04-17 cs.CV cs.RO

R3D: Revisiting 3D Policy Learning

R3D:重新审视3D策略学习

Zhengdong Hong, Shenrui Wu, Haozhe Cui, Boyi Zhao, Ran Ji, Yiyang He, Hangxing Zhang, Zundong Ke, Jun Wang, Guofeng Zhang, Jiayuan Gu

机构 * Zhejiang University(浙江大学) ShanghaiTech University(上海科技大学)

AI总结 本文针对3D策略学习中的训练不稳定和过拟合问题,提出结合可扩展的Transformer3D编码器与扩散解码器的新架构,有效提升3D模仿学习的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14932 2026-04-17 cs.AI

WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training

WavAlign:通过自适应混合后训练增强口语对话模型的智能与表达性

Yifu Chen, Shengpeng Ji, Qian Chen, Tianle Liang, Yangzhuo Li, Ziqing Wang, Wen Wang, Jingyu Lu, Haoxiao Wang, Xueyi Pu, Fan Zhuo, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tongyi Fun Team, Alibaba Group(通义实验室,阿里巴巴集团) Beijing University of Technology(北京理工大学)

AI总结 本文提出WavAlign方法,通过自适应混合后训练提升口语对话模型的智能与表达性,通过语义通道约束和显式锚定改进语音生成,避免不可靠的偏好梯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14920 2026-04-17 cs.AI

Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models

双轴生成奖励模型:面向交互口语对话模型中语义和轮流鲁棒性的研究

Yifu Chen, Shengpeng Ji, Zhengqing Liu, Qian Chen, Wen Wang, Ziqing Wang, Yangzhuo Li, Tianle Liang, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团) Beijing University of Technology(北京理工大学)

AI总结 本文提出双轴生成奖励模型,通过详细分类和标注数据集理解复杂交互动态,提供语义质量和交互时间的独立评估,提升口语对话模型的鲁棒性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏