arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4536
2604.15097 2026-06-03 cs.SE cs.CL

From Procedural Skills to Strategy Genes: Towards Experience-Driven Test-Time Evolution

从程序技能到策略基因:迈向经验驱动的测试时进化

Junjie Wang, Yiming Ren, Haoyang Zhang

机构 * Infinite Evolution Lab, EvoMap(无限进化实验室,EvoMap) Tsinghua University(清华大学)

AI总结 本文通过45个科学代码求解场景中的4590次受控试验,研究如何将经验表示为紧凑、面向控制且可迭代进化的对象(Gene),相比文档导向的Skill包,Gene在一次性控制和迭代积累中均表现更优。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07048 2026-06-03 cs.CV

PRISM: Rethinking Atmospheric Scattering Reconstruction as a Unified Understanding and Restoration Model for Real-world Dehazing

PRISM: 重新思考大气散射重建作为真实世界去雾的统一理解与恢复模型

Chengyu Fang, Chunming He, Yuelin Zhang, Chubin Chen, Chenyang Zhu, Hongqiu Wang, Longxiang Tang, Xiu Li, Sina Farsiu

机构 * Tsinghua University(清华大学) Duke University(杜克大学) CUHK(香港中文大学) HKUST(香港理工大学) HKUST(GZ)(香港理工大学(广州))

AI总结 提出基于近端散射大气重建(PSAR)的物理结构化框架,结合在线非均匀雾合成和选择性自蒸馏适应(SSDA)方案,实现真实世界图像去雾的统一理解与恢复。

Comments 21 Pages, 8 Figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17149 2026-06-03 cs.LG cs.AI

TimeOmni-VL: Unified Models for Time Series Understanding and Generation

TimeOmni-VL:统一时间序列理解与生成的模型

Tong Guan, Sheng Pan, Johan Barthelemy, Zhao Li, Yujun Cai, Cesare Alippi, Ming Jin, Shirui Pan

机构 * Tsinghua University(清华大学)

AI总结 提出TimeOmni-VL框架,通过保真双向映射和理解引导生成,首次统一时间序列的理解与生成任务。

Comments Accepted by the Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06960 2026-06-03 cs.CL cs.AI

InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning

InftyThink+:通过强化学习实现高效且有效的无限时域推理

Yuchen Yan, Liang Jiang, Jin Jiang, Shuaicheng Li, Zujie Wen, Zhiqiang Zhang, Jun Zhou, Jian Shao, Yueting Zhuang, Yongliang Shen

机构 * Tsinghua University(清华大学)

AI总结 提出InftyThink+框架,通过强化学习优化迭代推理的总结时机、保留内容和恢复策略,在DeepSeek-R1-Distill-Qwen-1.5B上提升AIME24准确率21%,并降低推理延迟。

Comments ICML 2026: https://openreview.net/forum?id=tyul8kXaJU Project Page: https://zju-real.github.io/InftyThink-Plus Code: https://github.com/ZJU-REAL/InftyThink-Plus Models: https://huggingface.co/collections/yanyc/inftythink

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07842 2026-06-03 cs.CL

Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers

评估和校准LLM在多个正确答案问题上的置信度

Yuhan Wang, Shiyu Ni, Zhikai Ding, Zihang Zhan, Yuanzi Li, Keping Bi

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

AI总结 针对多正确答案问题导致现有置信度校准方法失效的问题,提出语义置信度聚合(SCA)方法,通过聚合多个高概率采样响应的置信度,在混合答案设置下实现最优校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22599 2026-06-03 cs.SD cs.HC

A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation

用于数据高效查询式通用声音分离的语义一致数据集

Kai Li, Jintao Cheng, Chang Zeng, Zijun Yan, Helin Wang, Zixiong Su, Bo Zheng, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究所,BNRist,清华大学,北京,中国) Shanda AI Research Tokyo(莎莎人工智能研究东京) IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing, China(IDG/麦戈文脑研究 institute,清华大学,北京,中国) Johns Hopkins University(约翰霍普金斯大学) Chinese Institute for Brain Research (CIBR), Beijing, China(中国脑研究 institute(CIBR),北京,中国)

AI总结 提出自动管道通过语义一致合成协议消除事件共现,构建高质量合成数据集Hive,使模型在数据量极小的情况下达到与大规模训练模型相当的分离精度和泛化能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10055 2026-06-03 cs.CV

Physical Plausibility Reasoning via HCM-GRPO: Empowering Compact Model for Superior Performance

通过 HCM-GRPO 实现物理合理性推理:赋能紧凑模型以获得卓越性能

Zhiyuan Hu, Zheng Sun, Yi Wei, Long Yu

机构 * Tsinghua University(清华大学) Alibaba Health Information Technology Limited(阿里巴巴健康信息技术有限公司)

AI总结 针对多模态大语言模型在物理合理性推理中数据缺乏和推理能力弱的问题,提出包含大规模数据集和 HCM-GRPO 方法的完整解决方案,以紧凑模型超越大规模开源和闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19305 2026-06-03 cs.LG cs.AI eess.SP

Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning

小波傅里叶扩散器:用于强化学习的频率感知扩散模型

Yifu Luo, Yongzhe Chang, Xueqian Wang

机构 * Tsinghua University China(清华大学中国)

AI总结 针对现有扩散模型在离线强化学习中忽略频域特征导致频率偏移的问题,提出WFDiffuser,通过离散小波变换分解轨迹并利用短时傅里叶变换和交叉注意力增强频域建模,在D4RL基准上有效缓解频率偏移,提升轨迹稳定性和决策性能。

Comments IJCNN 2025

Journal ref IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14636 2026-06-03 cs.RO

BEV-ODOM2: Enhanced BEV-based Monocular Visual Odometry with PV-BEV Fusion and Dense Flow Supervision for Ground Robots

BEV-ODOM2: 基于PV-BEV融合与密集光流监督的增强型BEV单目视觉里程计用于地面机器人

Yufei Wei, Chenxiao Hu, Wangtao Lu, Sha Lu, Yuxiang Cui, Fuzhang Han, Rong Xiong, Yue Wang

机构 * Tsinghua University(清华大学)

AI总结 针对现有BEV方法中位姿训练稀疏监督和透视投影信息丢失的问题,提出BEV-ODOM2框架,通过密集BEV光流监督和PV-BEV融合,在四个数据集上实现40%的RTE提升,并支持边缘实时部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02568 2026-06-02 cs.AI cs.CL cs.ET cs.MA

ClinEnv: An Interactive Multi-Stage Long Horizon EHR Environment for Agents

ClinEnv:面向智能体的交互式多阶段长时程电子健康记录环境

Yuxing Lu, Yushuhong Lin, Wenqi Shi, J. Ben Tamo, Xukai Zhao, Jinzhuo Wang, May Dongmei Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Peking University(北京大学) University of Texas Southwestern Medical Center(德克萨斯西南医学中心) Tsinghua University(清华大学)

AI总结 提出ClinEnv,一个基于真实住院患者数据的交互式基准,通过多阶段决策序列评估大语言模型在不确定性下逐步收集信息并做出不可逆决策的能力,发现模型决策质量与过程质量严重脱节。

Comments 20 pages, 6 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02470 2026-06-02 cs.AI

MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation

MCP-Persona:通过环境模拟在真实个人应用上基准测试LLM智能体

Wenhao Wang, Peizhi Niu, Gongyi Zou, Xiyuan Yang, Jingxing Wang, Haoting Shi, Yaxin Du, Jingyi Chai, Xianghe Pang, Shuo Tang, Yanfeng Wang, Siheng Chen

机构 * Tsinghua University(清华大学)

AI总结 针对现有基准忽略个人社交应用中工具与个人账户或本地数据库交互的挑战,提出MCP-Persona基准,通过模拟真实个性化MCP工具评估LLM智能体性能,实验表明现有智能体在个性化工具使用上存在显著困难。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02443 2026-06-02 cs.CL cs.AI cs.CV

PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

PaSBench-Video: 面向主动安全预警的流式视频基准

Yusong Zhao, Yuejin Xie, Youliang Yuan, Junjie Hu, Jitian Guo, Yujiu Yang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

AI总结 提出PaSBench-Video基准,包含740个视频,评估多模态大模型在危险发生前及时发出预警的能力,发现现有模型在时序精度和低误报率上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02436 2026-06-02 cs.CV

Geometry-Aware Implicit Memory for Video World Models

几何感知隐式记忆用于视频世界模型

Zhengxuan Wei, Xu Guo, Xinghui Li, Xunzhi Xiang, Min Wei, Yiran Zhu, Qiulin Wang, Xintao Wang, Pengfei Wan, Xiangwang Hou, Qi Fan

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Tsinghua University(清华大学)

AI总结 提出GIM-World框架,通过轻量级Transformer编码器将可变长度历史压缩为固定大小的记忆令牌,并利用相机可查询的几何头在训练期间从冻结的基础模型中蒸馏3D场景结构,从而在长时程视频生成中保持几何和视觉一致性。

Comments Project page: https://gim-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02221 2026-06-02 cs.CV cs.LG

CORE-MTL: Rethinking Gradient Balancing via Causal Orthogonal Representations

CORE-MTL: 通过因果正交表示重新思考梯度平衡

Chengfeng Wu, Tao Zou, Yanru Wu, Jingge Wang

机构 * Tsinghua University(清华大学)

AI总结 提出CORE-MTL框架,通过因果正交表示将共享表示分解为语义流和残差流,以分离任务相关结构与虚假上下文,从而减少负迁移并提升泛化能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01923 2026-06-02 cs.CL cs.LG

Resonant Context Anchoring: Decoupling Attention Routing and Signal Gain at Inference Time

共振上下文锚定:推理时解耦注意力路由与信号增益

Mingkuan Zhao, Yide Gao, Wentao Hu, Suquan Chen, Tianchen Huang, Zhenhua An, Zetao Chang, Xiayu Sun, Yuheng Min

机构 * Xi’an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学) Tongji University(同济大学) Tsinghua University(清华大学)

AI总结 提出共振上下文锚定(RCA)方法,通过解耦自注意力中的路由逻辑与信息幅度,在推理时动态增强上下文令牌的信号,有效抑制大语言模型的参数化幻觉,提升事实一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01858 2026-06-02 cs.CV

Polaris: Scaling Up Instruction-Guided Image Generation Towards Millions of Personalized Style Needs

Polaris: 将指令引导的图像生成扩展到数百万个性化风格需求

Zhi-Kai Chen, Jun-Peng Jiang, Jun-Jie Tao, De-Chuan Zhan, Han-Jia Ye

机构 * Tsinghua University(清华大学)

AI总结 提出Polaris智能检索框架,通过索引和检索超过6500个检查点和75000个适配器,自动选择和集成最相关的模型组件,实现无需额外训练的可扩展、可控且对齐的指令驱动图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01810 2026-06-02 cs.AI

Token Predictors Are Not Planners: Building Physically Grounded Causal Reasoners

Token 预测器不是规划器:构建物理基础的因果推理器

Zheng Lu, Mingqi Gao, Qinlei Xie, Wanqi Zhong, Hanwen Cui, Heng Cao, Zirui Song, Yifan Yang, Chong Luo, Bei Liu, Yiming Li

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) MBZUAI

AI总结 针对具身视觉-语言规划中模型依赖语言统计先验而非因果推理的问题,提出 Causal-Plan-Bench 基准和 Causal-Plan-1M 数据集,并训练 Causal Planner 模型,实现从 token 预测到物理因果推理的转变。

Comments 77 pages, appendices included. Code: https://github.com/THUSI-Lab/Causal-Reasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01779 2026-06-02 cs.CL

HarnessForge: Joint Harness and Policy Evolution for Adaptive Agent Systems

HarnessForge:面向自适应智能体系统的协同框架与策略进化

Mingju Chen, Can Lv, Guibin Zhang, Heng Chang, Shiji Zhou

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北京航空航天大学) Tsinghua University(清华大学)

AI总结 提出HarnessForge元自适应框架,通过框架-策略协同进化实现LLM智能体系统的全系统自适应,在多个基准上显著提升性能。

Comments 25 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01698 2026-06-02 cs.CV

Learning Label-Efficient Interpretable Medical Image Diagnosis via Semi-supervised Hypergraph Concept Bottleneck Model

通过半监督超图概念瓶颈模型实现标签高效的医学图像可解释诊断

Yijun Yang, Ruiqiang Xiao, Lijie Hu, Angelica I Aviles-Rivero, Yunzhu Wu, Jing Qin, Lei Zhu

机构 * HKUST(GZ)(香港科技大学(广州)) Joy Future Academy(京东探索研究院) MBZUAI(穆罕默德·本·拉希德智能研究院) Tsinghua University(清华大学) Sichuan University(四川大学) PolyU

AI总结 提出一种半监督超图概念瓶颈模型,利用双层超图学习建模高阶概念依赖并生成领域自适应伪标签,在胎盘植入谱系等医学图像诊断中实现高可解释性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01640 2026-06-02 cs.AI cs.CL

MobEvolve: An Agentic Self-Evolving Heuristic System for Interpretable Human Mobility Generation

MobEvolve:用于可解释人类移动性生成的智能体自进化启发式系统

Junlin He, Yihong Tang, Tong Nie, Ao Qu, Yuebing Liang, Hamzeh Alizadeh, Bang Liu, Wei Ma, Lijun Sun

机构 * The Hong Kong Polytechnic University(香港理工大学) McGill University(麦吉尔大学) MIT(麻省理工学院) Tsinghua University(清华大学) Autorité régionale de transport métropolitain(大都会交通地区管理局) Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

AI总结 提出MobEvolve,首个智能体自进化启发式框架,通过LLM代理迭代演化内部逻辑,在保持可解释性和推理效率的同时,在个体轨迹保真度、群体分布对齐和行为合理性上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01604 2026-06-02 cs.CV

Paving the Way for Point Cloud Video Representation Learning Using A PDE Model

使用PDE模型为点云视频表示学习铺平道路

Zhuoxu Huang, Zhenkun Fan, Jungong Han, Josef Kittler

机构 * Department of Computer Science, Aberystwyth University(阿伯里斯يث大学计算机科学系) Department of Automation, Beijing National Research Center for Information Science and Technology, Tsinghua University(自动化系、北京信息科学与技术国家研究中心、清华大学) Department of Electrical Engineering, Surrey University(Surrey大学电子工程系)

AI总结 提出MotionPDE方法,通过将时空相关性学习建模为可解的偏微分方程(PDE),并利用对比学习结构优化,作为即插即用模块提升点云视频表示学习性能。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (T-PAMI) in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01528 2026-06-02 cs.AI

Joint Agent Memory and Exploration Learning via Novelty Signals

通过新颖性信号实现联合智能体记忆与探索学习

Shizuo Tian, Xiaohong Weng, Rui Kong, Yuxuan Chen, Guohong Liu, Yuebing Song, Jiacheng Liu, Yuchen Li, Dawei Yin, Ting Cao, Yunxin Liu, Yuanchun Li

机构 * Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Baidu Inc.(百度公司) Tongji University(同济大学) Peking University(北京大学)

AI总结 提出JAMEL框架,利用新颖性信号联合训练智能体记忆与探索策略,在开放环境中实现高效探索并泛化到未见环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01481 2026-06-02 cs.CV

SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation

SafeGen-Bench: 图像条件文本到视频生成中的安全性基准测试

Yingzi Ma, Xiaogeng Liu, Yawen Zheng, Chaowei Xiao

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Tsinghua University(清华大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 针对图像条件文本到视频生成中安全文本和图像组合仍可能产生有害内容的问题,提出SafeGen-Bench基准,定义10个恶意类别并评估现有模型,发现当前模型难以避免生成恶意内容,且单模态护栏防御不足。

Comments 8 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01313 2026-06-02 cs.RO cs.AI

PSG-Nav: Probabilistic Scene Graph Navigation via Multiverse Decision Making

PSG-Nav: 通过多元宇宙决策的概率场景图导航

Rufeng Chen, Yue Chang, Xiaqiang Tang, Hechang Chen, Sihong Xie

机构 * Tsinghua University(清华大学)

AI总结 提出PSG-Nav方法,通过构建3D概率场景图并利用多元宇宙决策从联合分布中采样最可能的世界设置,以处理开放词汇导航中的感知不确定性,并引入证据经验校准器实现在线终身适应,在多个基准上取得最新最优结果。

Comments 21 pages, 7 figures. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01286 2026-06-02 cs.SE cs.AI cs.CL cs.LG

BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution

BenchEvolver: 通过以解决方案为中心的进化进行前沿任务合成

Yangzhen Wu, Aaron J. Li, Wenjie Ma, Li Cao, Ziheng Zhou, Mert Cemri, Shu Liu, Yuran Xiu, Chenxiao Yan, Haikun Zhao, Bin Yu, Ion Stoica, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

AI总结 提出BenchEvolver框架,通过进化参考解决方案自动生成更难的编程问题,以解决基准饱和问题,并在LiveCodeBench和SciCode上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01281 2026-06-02 cs.LG cs.AI

RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning

RLVR 无需无效样本:面向 LLM 推理的群体优先级离策略优化

Yixiu Mao, Yun Qu, Qi Wang, Heming Zou, Xiangyang Ji

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 针对强化学习中无效样本导致学习信号不足的问题,提出群体优先级离策略优化(POPO),通过优先级群体重放和解耦重要性采样,在不增加额外采样开销的情况下提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01149 2026-06-02 cs.CV

CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection

CoSTL:面向时刻检索与高亮检测的综合时空表征学习

Xin Dong, Wenjia Geng, Wenfeng Deng, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室)

AI总结 提出综合时空表征学习框架CoSTL,通过文本驱动的渐进细粒度图像编码器和多尺度时间感知模块,联合学习空间细节与时间动态,在时刻检索和高亮检测任务上达到最优性能。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01135 2026-06-02 cs.NE cs.SD

Spiking and Event-driven Neuromorphic Mamba Models for Efficient Speech Recognition

用于高效语音识别的脉冲与事件驱动神经形态Mamba模型

Tauseef Ahmed, Tao Sun, Jeronimo Castrillon, Kanishkan Vadivel, Guangzhi Tang

机构 * University of California, Berkeley(加州大学伯克利分校) Tsinghua University(清华大学)

AI总结 提出脉冲和事件驱动的神经形态Mamba模型,通过激活稀疏性提升语音识别效率,在LibriSpeech上实现超过60%的激活稀疏性且精度损失小于1%,并开发周期精确的事件驱动模拟器实现算法-硬件协同优化。

Comments Accepted at IJCNN2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01062 2026-06-02 cs.AI

DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts

DAG-MoE:从简单混合到专家混合中的结构聚合

Jiarui Feng, Hanqing Zeng, Karish Grover, Ruizhong Qiu, Yinglong Xia, Qiang Zhang, Qifan Wang, Ren Chen, Dongqi Fu, Jiayi Liu, Zhoukai Zhao, Xiangjun Fan, Benyu Zhang, Yixin Chen

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

AI总结 本文提出DAG-MoE框架,通过轻量级模块自动学习选定专家之间的最优聚合结构,以替代标准加权求和聚合,从而在不改变专家或路由器的情况下扩展专家组合空间并实现单层多步推理,在预训练和微调中均优于传统MoE基线。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01016 2026-06-02 cs.CL cs.AI eess.AS

PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects

PolySpeech-100:面向100多种语言和方言的大规模语音理解基准

Sicheng Yang, Shulan Ruan, Shiwei Wu, Yu Liu, Lu Fan, Zhi Li, You He

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) JD AI Research(京东人工智能研究院)

AI总结 为解决现有语音评估基准在资源丰富语言偏向、缺乏语义推理和忽视方言的问题,提出PolySpeech-100基准,通过混合构建管道覆盖110种语言变体,并评估22个模型,发现开源端到端模型在重方言上优于级联系统,而思维链提示在零样本设置下会降低性能。

Comments 19 pages, 13 figures, KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏