arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4547
2604.10189 2026-04-14 cs.CL

FAITH: Factuality Alignment through Integrating Trustworthiness and Honestness

FAITH:通过整合可信度和诚实度实现事实一致性

Xiaoning Dong, Chengyan Wu, Yajie Wen, Yu Chen, Yun Xue, Jing Zhang, Wei Xu, Bolei Ma

机构 * Tsinghua University, Institute for Interdisciplinary Information Sciences(清华大学,交叉信息研究院) Shanghai Qi Zhi Institute(上海期智研究院) South China Normal University, School of Electronic Science and Engineering(华南师范大学,电子科学与工程学院) Guangzhou Richstone Data Technologies Co., Ltd.(广州瑞驰数据技术有限公司) LMU Munich & Munich Center for Machine Learning(慕尼黑大学 & 慕尼黑机器学习中心)

AI总结 FAITH通过整合可信度和诚实度信号,提升大语言模型的事实准确性。采用PPO算法优化奖励函数,并结合检索增强模块增强内外知识一致性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10057 2026-04-14 cs.RO

Natural Gradient Gaussian Approximation Filter on Lie Groups for Robot State Estimation

在李群上的自然梯度高斯近似滤波器用于机器人状态估计

Tianyi Zhang, Wenhan Cao, Chang Liu, Yao Lyu, Shengbo Eben Li

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) College of Engineering, Peking University(北京大学工学院) College of Artificial Intelligence, Tsinghua University(清华大学人工智能学院) Tsinghua-Efort Joint Research Center for EAI Computation and Perception(清华大学-埃夫特EAI计算与感知联合研究中心)

AI总结 本文提出在李群上基于自然梯度优化的高斯近似滤波器,用于解决机器人系统在李群流形上状态估计的非线性问题,通过避免局部线性化提高估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09817 2026-04-14 cs.LG

NeuroFlow: Toward Unified Visual Encoding and Decoding from Neural Activity

NeuroFlow:迈向从神经活动统一的视觉编码和解码

Weijian Mai, Mu Nan, Yu Zhu, Jiahang Cao, Rui Zhang, Yuqin Dai, Chunfeng Song, Andrew F. Luo, Jiamin Wu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Tsinghua University(清华大学) Chinese University of Hong Kong(香港中文大学)

AI总结 NeuroFlow首次提出统一框架,通过单一流模型联合建模视觉和神经活动的编码解码,提升效率与一致性。

Comments Accepted to CVPR 2026. Project page: https://michaelmaiii.github.io/NeuroFlow-S

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09587 2026-04-14 cs.AI cs.LG cs.SE

MobiFlow: Real-World Mobile Agent Benchmarking through Trajectory Fusion

MobiFlow: 通过轨迹融合实现真实世界移动代理基准测试

Yunfei Feng, Xi Zhao, Cheng Zhang, Dahu Feng, Daolin Cheng, Jianqi Yu, Yubin Xia, Erhu Feng

机构 * Institute of Parallel and Distributed Systems (IPADS), Shanghai Jiao Tong University(上海交通大学并行与分布式系统研究所(IPADS)) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) National Innovation Institute of High-end Smart Appliances(国家高端智能家电创新研究院)

AI总结 MobiFlow通过轨迹融合算法构建任务,覆盖20个常用第三方应用,提供240种真实任务,提升模型在真实负载下的评估精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01064 2026-04-14 cs.CL

Exploring Knowledge Purification in Multi-Teacher Knowledge Distillation for LLMs

探索多教师知识蒸馏中知识净化

Ruihan Jin, Pengpeng Shao, Zhengqi Wen, Jinyang Wu, Mingkuan Feng, Shuo Yang, Chu Yuan Zhang, Jianhua Tao

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

AI总结 本文提出知识净化方法,通过整合多个教师模型的推理以减少冲突并提升效率,实验表明其在知识蒸馏中提升性能并促进轻量模型部署。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22055 2026-04-14 cs.CL

RedNote-Vibe: A Dataset for Capturing Temporal Dynamics of AI-Generated Text in Lifestyle Social Media

RedNote-Vibe:一种捕捉生活方式社交媒体中AI生成文本时间动态的数据集

Yudong Li, Yufei Sun, Peiru Yang, Yuhan Yao, Wanyue Li, Jiajun Zou, Haoyang Yang, Haotian Gan, Linlin Shen, Yongfeng Huang

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong Metropolitan University(香港都会大学) Shenzhen University(深圳大学)

AI总结 本文提出RedNote-Vibe数据集,用于研究AI生成文本在生活方式社交媒体中的时间动态,并提出PLAD框架以检测AI生成内容,发现人类内容在情感领域仍占优,AI内容同质化但能通过高互动性内容缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09165 2026-04-14 cs.LG cs.CV

Masked Training for Robust Arrhythmia Detection from Digitalized Multiple Layout ECG Images

掩码训练用于从数字化多布局ECG图像中鲁棒性心律失常检测

Shanwei Zhang, Deyun Zhang, Yirao Tao, Kexin Wang, Shijia Geng, Jun Li, Qinghao Zhao, Xingpeng Liu, Xingliang Wu, Shengyong Chen, Yuxi Zhou, Shenda Hong

机构 * Tianjin University of Technology(天津理工大学) Peking University(北京大学) HeartVoice Medical Technology(心语医疗科技) Capital Medical University(首都医科大学) Tianjin Medical University(天津医科大学) Tsinghua University(清华大学)

AI总结 本文提出PatchECG模型,通过自适应变量块计数缺失学习机制和掩码训练策略,解决ECG图像中时间不同步和部分黑屏问题,实现跨导联和时间依赖的鲁棒检测。

Comments 28 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09511 2026-04-13 cs.CV

RIRF: Reasoning Image Restoration Framework

RIRF:图像修复推理框架

Wending Yan, Rongkai Zhang, Kaihua Tang, Yu Cheng, Qiankun Liu

机构 * Southwest Jiaotong University(西南交通大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 本文提出RIRF框架,通过整合结构化推理流程提升图像修复的可解释性与修复质量,结合推理与修复任务实现统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09473 2026-04-13 cs.CV

Realizing Immersive Volumetric Video: A Multimodal Framework for 6-DoF VR Engagement

实现沉浸式体积分量视频:一种多模态框架用于6自由度VR互动

Zhengxian Yang, Shengqi Wang, Shi Pan, Hongshuai Li, Haoxiang Wang, Lin Li, Guanjun Li, Zhengqi Wen, Borong Lin, Jianhua Tao, Tao Yu

机构 * Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Migu Beijing Research Institute(咪咕北京研究院) School of Architecture, Tsinghua University(清华大学建筑学院) Department of Automation, Tsinghua University(清华大学自动化系) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

AI总结 本文提出了一种多模态框架,用于构建沉浸式体积分量视频,通过多视角多模态数据集和动态光场重建框架,实现高分辨率、高帧率的动态内容,支持6自由度VR交互。

Comments Journal extension of CVPR 2025. See also arXiv:2503.14359 . Project page and code: https://github.com/Metaverse-AI-Lab-THU/ImViD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09309 2026-04-13 stat.ML cs.LG stat.CO

Iterative Identification Closure: Amplifying Causal Identifiability in Linear SEMs

迭代识别闭合:在线性SEM中放大因果可识别性

Ziyi Ding, Xiao-Ping Zhang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 本文提出迭代识别闭合框架,通过迭代反馈机制提升线性SEM中因果效应系数的可识别性,有效解决传统HTC方法无法处理的' inconclusive'因果效应问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09285 2026-04-13 cs.AI

SAGE: A Service Agent Graph-guided Evaluation Benchmark

SAGE:基于服务代理图的评估基准

Ling Shi, Yuqin Dai, Ziyin Wang, Ning Gao, Wei Zhang, Chaozheng Wang, Yujie Wang, Wei He, Jinpeng Wang, Deiyi Xiong

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) Independent Researcher(独立研究员)

AI总结 本文提出SAGE基准,通过动态对话图验证逻辑合规性,解决现有基准无法评估多维度用户行为和SOP的问题,揭示模型在意图分类与后续动作推导间的执行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06734 2026-04-13 cs.CL

TEC: A Collection of Human Trial-and-error Trajectories for Problem Solving

TEC:一个问题解决过程中的人类试错轨迹集合

Xinkai Zhang, Jingtao Zhan, Yiqun Liu, Qingyao Ai

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Quancheng Laboratory(泉城实验室) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Institute of Data and Information, Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院数据与信息研究院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出TEC数据集,通过记录人类在问题解决中的试错轨迹和反思,展示了人类在试错任务中优于LLM的准确性,为理解人类试错行为和开发更强大的AI系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09206 2026-04-13 cs.CV

Long-SCOPE: Fully Sparse Long-Range Cooperative 3D Perception

Long-SCOPE:完全稀疏的长距离协作3D感知

Jiahao Wang, Zikun Xu, Yuner Zhang, Zhongwei Jiang, Chenyang Lu, Shuocheng Yang, Yuxuan Wang, Jiaru Zhong, Chuang Zhang, Shaobing Xu, Jianqiang Wang

机构 * Tsinghua University(清华大学) University of Pennsylvania(宾夕法尼亚大学) Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出Long-SCOPE框架,通过几何引导查询生成模块和上下文感知关联模块,解决远距离协作3D感知中的计算复杂性和特征关联问题,实现高精度低开销的长距离感知。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09167 2026-04-13 cs.CV cs.MA

MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding

MAG-3D:多智能体基础推理用于3D理解

Henry Zheng, Chenyue Fang, Rui Huang, Siyuan Wei, Xiao Liu, Gao Huang

机构 * Tsinghua University(清华大学) Pico, ByteDance(字节跳动Pico)

AI总结 本文提出MAG-3D,一种无需训练的多智能体框架,通过动态协调专家代理实现灵活的3D基础推理,解决复杂场景中的空间和几何关系推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09038 2026-04-13 cs.RO cs.CV cs.LG

Towards Lifelong Aerial Autonomy: Geometric Memory Management for Continual Visual Place Recognition in Dynamic Environments

迈向终身空中自主:面向动态环境的几何记忆管理用于连续视觉地点识别

Xingyu Shao, Zhiqiang Yan, Liangzheng Sun, Mengfan He, Chao Chen, Jinhui Zhang, Chunyu Li, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) College of Instrument Science and Opto-electronics Engineering, Beijing Information Science and Technology University(北京信息科技大学仪器科学与光电工程学院) Key Laboratory of Complex System Intelligent Control and Decision Making, Beijing Institute of Technology(北京理工大学复杂系统智能控制与决策重点实验室) School of Aerospace Engineering, Beijing Institute of Technology(北京理工大学宇航学院)

AI总结 本文提出一种异构记忆框架,通过静态卫星锚点和动态经验回放缓冲区,提升动态环境中连续视觉地点识别的鲁棒性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09023 2026-04-13 cs.CV

CAD 100K: A Comprehensive Multi-Task Dataset for Car Related Visual Anomaly Detection

CAD 100K:一个全面的多任务数据集用于汽车相关视觉异常检测

Jiahua Pang, Ying Li, Dongpu Cao, Jingcai Luo, Yanuo Zheng, Bao Yunfan, Yujie Lei, Rui Yuan, Yuxi Tian, Guojin Yuan, Hongchang Chen, Zhi Zheng, Yongchun Liu

机构 * Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) China Agricultural University(中国农业大学) Beijing Jiaotong University(北京交通大学) The Hong Kong Polytechnic University(香港理工大学) Li Auto(理想汽车)

AI总结 本文提出CAD 100K数据集,用于汽车相关多任务视觉异常检测,包含100万张图像,涵盖7个车辆领域和3个任务,通过合成数据增强实现少样本异常检测,验证了多任务学习在任务交互和知识迁移中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08945 2026-04-13 cs.CV cs.RO

TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches

TouchAnything: 从稀疏机器人触碰引导的3D重建

Langzhe Gu, Hung-Jui Huang, Mohamad Qadri, Michael Kaess, Wenzhen Yuan

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出TouchAnything框架,利用预训练的2D视觉扩散模型作为语义和几何先验,从稀疏触觉测量中实现准确的3D重建,优于现有基线方法,支持开放世界中未见过的物体实例重建。

Comments Project Page: https://grange007.github.io/touchanything

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08926 2026-04-13 cs.LG

Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning

弥合SFT与RL:面向鲁棒推理的动态策略优化

Taojie Zhu, Dongyang Xu, Ding Zou, Sen Zhao, Qiaobo Hao, Zhiguo Yang, Yonghong He

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司智能系统部) Institute of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学前沿交叉研究院)

AI总结 本文提出DYPO框架,通过组对齐损失、多教师蒸馏和动态探索-利用门控机制,解决SFT与RL间的偏倚-方差权衡问题,提升复杂推理和分布外任务性能。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08865 2026-04-13 cs.AI

SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks

SPPO:用于长时间 horizon 推理任务的序列级 PPO

Tianyi Wang, Yixia Li, Long Li, Yibiao Chen, Shaohan Huang, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) INFLY TECH Beijing University of Posts and Telecommunications(北京邮电大学) Microsoft Research Asia(微软亚洲研究院) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学)

AI总结 本文提出 SPPO,一种结合 PPO 的样本效率与结果稳定性的序列级算法,通过将推理过程转化为序列级上下文老虎机问题,实现低方差优势信号生成,提升推理 LLM 的对齐性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08669 2026-04-13 cond-mat.quant-gas cs.LG quant-ph

An Algorithm for Fast Assembling Large-Scale Defect-Free Atom Arrays

一种快速组装大规模无缺陷原子阵列的算法

Tao Zhang, Xiaodi Li, Hui Zhai, Linghui Chen

机构 * Institute for Advanced Study, Tsinghua University(清华大学高等研究院) Intelligent Quantum Inception Inc.(智能量子启创公司) iFLYTEK Research(科大讯飞研究院)

AI总结 本文提出一种统一框架,通过监督学习和改进的拍卖解码器进行路径规划,结合相位和轮廓感知的加权Gerchberg-Saxton算法,实现快速组装10^4个量子比特的无缺陷原子阵列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05529 2026-04-13 cs.AI

ActivityEditor: Learning to Synthesize Physically Valid Human Mobility

ActivityEditor: 学习合成物理有效的行人移动

Chenjie Yang, Yutian Jiang, Anqi Liang, Wei Qi, Chenyu Wu, Junbo Zhang

机构 * Southwest Jiaotong University(西南交通大学) HKUST (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) JD Technology(京东科技)

AI总结 本文提出ActivityEditor,一种双LLM代理框架,用于零样本跨区域轨迹生成。通过意图生成代理和编辑代理协同工作,结合强化学习和物理约束,实现高保真轨迹生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01400 2026-04-13 cs.CV

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models

通过局部和全局上下文优化实现高效视频大语言模型的token缩减

Jinlong Li, Liyuan Jiang, Haonan Zhang, Nicu Sebe

机构 * University of Trento(特伦托大学) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 本文提出AOT方法,通过局部-全局最优传输优化视频大语言模型中的token,实现高效的token缩减,保持时间与视觉保真度。

Comments CVPR2026, Project webpage: https://tyroneli.github.io/AOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03107 2026-04-13 cs.CL

The Mask of Civility: Benchmarking Chinese Mock Politeness Comprehension in Large Language Models

礼貌的面具:在大型语言模型中基准测试中文虚伪礼貌理解

Yitong Zhang, Yuhan Xiang, Mingxuan Liu

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文从语用学角度评估大型语言模型在识别中文礼貌、不礼貌和虚伪礼貌现象中的表现差异,构建了结合真实和模拟中文话语的三类数据集,并通过六种代表性模型在四种提示条件下进行测试。

Comments Preprint

Journal ref International Conference in Applied Language Sciences (ALS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14756 2026-04-13 cs.LG cs.AI

Task-Distributionally Robust Data-Free Meta-Learning

任务分布鲁棒数据免费元学习

Zixuan Hu, Yongxian Wei, Li Shen, Zhenyi Wang, Baoyuan Wu, Chun Yuan, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Computer Science and AI Institute, University of Central Florida(中佛罗里达大学计算机科学系与人工智能研究所) School of Data Science, the Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen) and Secure Computing Lab of Big Data, Shenzhen Research Institute of Big Data (SBRID)(香港中文大学(深圳)数据科学学院与深圳市大数据研究院大数据安全计算实验室)

AI总结 本文研究数据免费元学习的鲁棒性,发现任务分布偏移和任务分布污染两种漏洞,并提出可信DFML框架以缓解这些问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08370 2026-04-10 cs.CV

SurfelSplat: Learning Efficient and Generalizable Gaussian Surfel Representations for Sparse-View Surface Reconstruction

SurfelSplat: 学习高效且可泛化的高斯Surfel表示以进行稀疏视图表面重建

Chensheng Dai, Shengjun Zhang, Min Chen, Yueqi Duan

机构 * Tsinghua University(清华大学)

AI总结 本文提出SurfelSplat框架,通过稀疏视图图像生成高效且可泛化的高斯Surfel表示,利用Nyquist采样定理解决传统方法在几何属性恢复中的不足,实验表明其在DTU基准上表现优异且速度提升显著。

Comments Code is available at https://github.com/Simon-Dcs/Surfel_Splat

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08333 2026-04-10 cs.CV cs.AI cs.LG

Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification

迷失在喧嚣中:揭示并剖析医学多模态大语言模型在图像分类中的性能退化

Xun Zhu, Fanbin Mo, Xi Chen, Kaili Zheng, Shaoshuai Yang, Yiming Shi, Jian Gao, Miao Li, Ji Wu

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 本文研究了医学多模态大语言模型在图像分类中的性能退化问题,通过实验和特征探查揭示了四个失败模式,并提出了量化评分用于评估特征演变的健康状况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08301 2026-04-10 cs.CV

GroundingAnomaly: Spatially-Grounded Diffusion for Few-Shot Anomaly Synthesis

GroundingAnomaly: 基于空间的扩散用于少样本异常合成

Yishen Liu, Hongcang Chen, Pengcheng Zhao, Yunfan Bao, Yuxi Tian, Jieming Zhang, Hao Chen, Zheng Zhi, Yongchun Liu, Ying Li, Dongpu Cao

机构 * Beijing Institute of Technology(北京理工大学) Beijing Jiaotong University(北京交通大学) Li Auto(理想汽车) Tsinghua University(清华大学)

AI总结 本文提出GroundingAnomaly框架,通过空间条件模块和门控自注意力模块实现精准异常合成,提升少样本异常检测性能。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08258 2026-04-10 cs.RO

EvoGymCM: Harnessing Continuous Material Stiffness for Soft Robot Co-Design

EvoGymCM:利用连续材料刚度进行软机器人协同设计

Le Shen, Kangyao Huang, Wentao Zhao, Huaping Liu

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出EvoGymCM平台,通过将连续材料刚度作为第一类设计变量,解决传统平台对材料维度的离散化限制,提升软机器人性能与协同效应。

Comments 8 pages, 11 figures. Preprint. Under review at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08203 2026-04-10 cs.CV cs.AI

MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning

MedVR:通过代理强化学习实现无标注的医学视觉推理

Zheng Jiang, Heng Guo, Chengyu Fang, Changchen Xiao, Xinyang Hu, Lifeng Sun, Minfeng Xu

机构 * Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室) Zhejiang University(浙江大学)

AI总结 MedVR通过代理强化学习实现无标注的医学视觉推理,利用熵引导的视觉重定位和基于共识的信用分配机制,在多个公开医学VQA基准上取得最佳性能,提升医疗AI的鲁棒性和透明度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23727 2026-04-10 cs.SD cs.AI

AudioMoG: Guiding Audio Generation with Mixture-of-Guidance

AudioMoG:通过混合指导引导音频生成

Junyou Wang, Zehua Chen, Binjie Yuan, Kaiwen Zheng, Chang Li, Yuxuan Jiang, Jun Zhu

机构 * Tsinghua University(清华大学) Shengshu AI(生数科技) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出AudioMoG,一种改进的采样方法,在无需大量训练资源的情况下提升文本到音频和视频到音频生成质量,同时在多样性保持和生成质量上优于单一指导方法。

Comments Accepted at ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏