arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-06-16 至 2026-06-16 共收录 63
2606.15207 2026-06-16 cs.LG cs.AI cs.NE 新提交

Controlled Dynamics Attractor Transformer

受控动力学吸引子Transformer

Cheng Zhang, Minnan Luo, Zesheng Yang, Ming Li, Yong-Jin Liu, Qinghua Zheng

机构 * Xi'an Jiaotong University(西安交通大学) Tsinghua University(清华大学)

AI总结 提出受控动力学吸引子Transformer(CDAT),通过耦合混合von Mises-Fisher注意力能量与Hopfield精炼能量,并引入CANN启发的兴奋-抑制调制,实现拓扑约束的动力学系统,在图异常检测和图分类任务上达到最优性能。

Comments 20pages,3 figures

Journal ref Forty-Third International Conference on Machine Learning(ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15186 2026-06-16 cs.SD cs.AI eess.AS 新提交

FreeSonic: Training-Free Temporal-Aware Decoupled Attention for Precise Audio Editing

FreeSonic: 无需训练的时序感知解耦注意力用于精确音频编辑

Yuxuan Jiang, Mingyang Han, Yusheng Dai, Andong Wang, Tianhong Zhou, Jiaxin Ye, Dongxiao Wang, Haoxiang Shi, Boyu Li, Jun Song, Cheng Yu, Bo Zheng, Weibei Dou, Zehua Chen, Jun Zhu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Monash University(蒙纳士大学) Renmin University of China(中国人民大学) Fudan University(复旦大学)

AI总结 提出FreeSonic,一种无需训练的框架,利用基于Rectified Flow的TangoFlux模型,通过优化反转-逆过程、联合文本-音频注意力图以及调度注意力解耦,实现精确且一致的音频编辑,同时保持背景保真度。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15160 2026-06-16 cs.CV cs.LG 新提交

DLWM: Diverse Latent World Models for Efficient Multimodal Reasoning

DLWM: 多样化潜在世界模型用于高效多模态推理

David Huang, Lianlei Shan

机构 * University of Toronto(多伦多大学) Tsinghua University(清华大学)

AI总结 提出DLWM框架,结合潜在空间推理与强化学习,通过多样化潜在假设和资源感知策略提升多模态推理效率,准确率提升2-5%,内存减少24%。

Comments Preprint. 9 pages main text, 15 pages total including appendix, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15129 2026-06-16 cs.CV cs.AI 新提交

EyeMVP: OCT-Informed Fundus Representation Learning via Paired CFP--OCT Pretraining

EyeMVP: 通过配对CFP-OCT预训练实现OCT启发的眼底表征学习

Zhuo Deng, Ruiheng Zhang, Ziheng Zhang, Weihao Gao, Yitong Li, Qian Wang, Lei Shao, Jiaoyue Dong, Zhixi Zeng, Lijian Fang, Haibo Wang, Xiaobin Lin, Tao Liu, Zhicheng Du, Zhengwei Zhang, Lin Yang, Zheng Gong, Xinyu Zhao, Zhenquan Wu, Fang Li, Zhiguang Zhou, Guoming Zhang, Sun Jing, Han Lv, Wenbin We, Lan Ma

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Beijing Tongren Eye Center, Beijing Tongren Hospital, Capital Medical University(首都医科大学附属北京同仁医院北京同仁眼科中心) Liangxiang Hospital of Beijing Fangshan District, Capital Medical University(首都医科大学北京市房山区良乡医院) The Third People's Hospital of Dalian(大连市第三人民医院) National Clinical Research Center for Endocrine and Metabolic Diseases, The Second Xiangya Hospital of Central South University(中南大学湘雅二医院国家内分泌代谢病临床医学研究中心) The Central Hospital of Baoji City(宝鸡市中心医院) Wuxi No.2 People's Hospital, Affiliated Wuxi Clinical College of Nantong University(南通大学附属无锡临床学院无锡市第二人民医院) Shenzhen Eye Hospital, Southern Medical University(南方医科大学深圳眼科医院) Beijing Friendship Hospital, Capital Medical University(首都医科大学附属北京友谊医院)

AI总结 提出跨模态视网膜基础模型EyeMVP,利用配对CFP-OCT预训练,通过跨模态掩码重建将OCT结构信息注入CFP表征,在16项下游任务中优于现有模型,尤其对黄斑疾病诊断有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15099 2026-06-16 cs.CV cs.LG cs.RO 新提交

Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models

少思考,早行动:视觉-语言-动作模型中带早退的强化潜在推理

Dianqiao Lei, Lianlei Shan

机构 * Tsinghua University, Beijing, China(清华大学)

AI总结 提出AVA-VLA框架,通过强化学习去噪和早退策略优化潜在推理轨迹,在LIBERO上实现6倍推理加速和98.3%平均成功率。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15037 2026-06-16 cs.CL cs.CV 新提交

ReportQA: QA-Based Radiology Report Evaluation

ReportQA: 基于问答的放射学报告评估

Yiming Shi, Shaoshuai Yang, Xi Chen, Haolin Li, Hengyu Zhang, Che Jiang, Kaiwen Wang, Xun Zhu, Dong Xie, Fei Wang, Dejing Dou, Miao Li, Ji Wu

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) College of AI, Tsinghua University(清华大学人工智能学院) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) Beijing Electronic Digital & Intelligence(北京电子数字与智能)

AI总结 提出ReportQA框架,利用知识树和LLM从报告中提取结构化信息生成QA对,以问答准确率作为评估指标,比现有指标更符合放射科医生判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14832 2026-06-16 cs.CL 新提交

PhoneHarness: Harnessing Phone-Use Agents through Mixed GUI, CLI, and Tool Actions

PhoneHarness: 通过混合GUI、CLI和工具操作利用手机使用代理

Chenxin Li, Zhengyao Fang, Zhengyang Tang, Pengyuan Lyu, Xingran Zhou, Xin Lai, Fei Tang, Liang Wu, Yiduo Guo, Weinong Wang, Junyi Li, Yi Zhang, Yang Ding, Huawen Shen, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu

机构 * Tencent Hunyuan(腾讯混元) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

AI总结 提出PhoneHarness,一个混合动作基准和执行框架,用于评估手机代理在可验证移动工作流中的表现,通过GUI、CLI和工具动作的组合,达到75.0%通过率,比最强基线高12.9个百分点。

Comments Project Page: https://phoneharness.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14752 2026-06-16 cs.CV cs.AI cs.LG cs.RO 新提交

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

X-Tokenizer: 一种用于视觉-语言-动作预训练的多模态动作分词器

Miracle Kang, Lights Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Sylas Chen, Shawn Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

机构 * Square Robot City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

AI总结 提出X-Tokenizer,通过语义残差量化(SRQ)和掩码动作建模(MAM)将动作离散化为语义接口,在2.4M轨迹上预训练后提升VLA模型的多模态接地和长程任务性能。

Comments Project page: https://x-square-robot.github.io/X-Tokenizer_projectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13782 2026-06-16 cs.AI 新提交

MA-ProofBench: A Two-Tiered Evaluation of LLMs for Theorem Proving in Mathematical Analysis

MA-ProofBench: 数学分析中定理证明的大语言模型双层评估基准

Lushi Pu, Weiming Zhang, Xinheng Xie, Zixuan Fu, Bingxiang He, Hongya Lyu, Xin Li, Jie Zhou, Yudong Wang

机构 * ModelBest Inc. Tsinghua University(清华大学)

AI总结 提出首个面向数学分析的形式化定理证明基准MA-ProofBench,包含200个定理,覆盖6个核心主题和27个子类别,分为本科和博士资格两级难度,评估发现当前模型表现不佳,GPT-5.5在Level I上仅达16% Pass@8。

Comments 19 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09669 2026-06-16 cs.AI cs.CL 新提交

SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

SpatialWorld: 在多模态智能体真实世界任务中基准测试交互式空间推理

Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang Qiao, Shihong Huang, Junming Yang, Yi Li, Hongyixuan Yuan, Wenjie Li, Bohan Zeng, Wenbo Li, Bo Wang, Jianhui Liu, Olive Huang, Haoyang Huang, Wentao Zhang, Guoqing Huang, Nan Duan, Yinpeng Dong

机构 * Tsinghua University(清华大学) Chongqing University(重庆大学) Peking University(北京大学) ZenoMind AI Xi’an Jiaotong University(西安交通大学) Beijing Institute of Technology(北京理工大学) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Joy Future Academy(京东探索研究院) The University of Hong Kong(香港大学)

AI总结 提出SpatialWorld基准,集成8种异构模拟后端,通过760个人工标注任务评估多模态智能体在视觉部分可观测环境中的交互式空间理解,发现最强模型GPT-5任务成功率仅17.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08525 2026-06-16 cs.CV 新提交

DriveReward: A Comprehensive Dataset and Generative Vision-Language Reward Model for Autonomous Driving

DriveReward:面向自动驾驶的综合数据集与生成式视觉语言奖励模型

Qimao Chen, Fang Li, Yuechen Luo, Zehan Zhang, Haiyang Sun, Fangzhen Li, Bing Wang, Guang Chen, Yang Ji, Jiong Deng, Hongwei Xie, Hangjun Ye, Long Chen, Yi Zhang

机构 * Tsinghua University(清华大学) Xiaomi EV(小米汽车)

AI总结 提出DriveReward数据集和专用视觉语言奖励模型,通过反事实标注和时序视觉引导,解决自动驾驶中奖励获取的泛化问题,在强化学习和轨迹选择中取得与基于规则方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05742 2026-06-16 cs.CL 版本更新

AdaPLD: Adaptive Retrieval and Reuse for Efficient Model-Free Speculative Decoding

AdaPLD: 自适应检索与重用实现高效无模型推测解码

Runheng Liu, Jincheng Xie, Wen Hu, Xingchen Xiao, Heyan Huang

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Department of Mathematical Sciences, Tsinghua University(清华大学数学科学部) JDT AI Infra(京东AI基础设施)

AI总结 针对现有基于重用的推测解码方法在词汇匹配失败时召回率低和确定性复制脆弱的问题,提出无需训练的自适应方法AdaPLD,通过语义相似性恢复重用机会并构建分支假设,实现最高3.10倍解码加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04907 2026-06-16 cs.RO 版本更新

WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation

WAM-Nav:面向统一视觉导航的非对称潜在世界-动作建模

Ning Yang, Yan Huang, Kaiwen Peng, Ziheng He, Kai Wang, Cui Miao, Kailin Lyu, Guo Li, Xiaofeng Wang, Zheng Zhu, Jing Liu, Nianfeng Liu

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) FiveAges National University of Defense Technology(国防科技大学) Tsinghua University(清华大学) GigaAI

AI总结 提出WAM-Nav,一种联合学习动作生成与潜在视觉预测的非对称扩散Transformer模型,通过共享扩散Transformer实现长时程动作与短时程视觉预测的联合扩散,并引入双流上下文条件机制和目标对齐模块,在统一策略下支持图像目标、点目标和无目标导航,在ClutterScenes和InternScenes基准上分别提升15.7%和3.3%的成功率,并在真实环境中实现85%的任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00558 2026-06-16 cs.LG 版本更新

Semi-Supervised Noise Adaptation: Transferring Knowledge from Noise Domain

半监督噪声适应:从噪声域迁移知识

Yuan Yao, Jin Song, Huixia Li, Tongtong Yuan, Jiaqi Wu, Yu Zhang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东人工智能与数字经济实验室) Nanjing University of Posts and Telecommunications(南京邮电大学) Beijing Jiaotong University(北京交通大学) Beijing University of Technology(北京工业大学) Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学)

AI总结 提出半监督噪声适应(SSNA)问题,利用合成噪声域作为源域,通过噪声适应框架(NAF)改善目标域的泛化性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22183 2026-06-16 cs.RO cs.AI 版本更新

Action with Visual Primitives

基于视觉基元的动作生成

Weilong Guo, Yuchen Wang, Renping Zhou, Yunfeng Zhang, Rui Fang, Yuyang Pang, Wenda Xu, Gao Huang

机构 * Anyverse Dynamics Tsinghua University(清华大学)

AI总结 提出AVP架构,通过视觉语言模型推断下一阶段目标并生成视觉基元令牌,条件化流匹配动作专家,在通用拾放任务中成功率比pi_0.5提升27.61%。

Comments 9 pages, 6 figures. Project page: https://kingdroper.github.io/AVP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03447 2026-06-16 cs.CV 版本更新

Proact-VL: A Proactive VideoLLM for Real-Time AI Companions

Proact-VL:用于实时AI伴侣的主动式视频大语言模型

Weicai Yan, Yuhong Dai, Qi Ran, Haodong Li, Wang Lin, Tao Jin, Xing Xie, Hao Liao, Jianxun Lian

机构 * Tsinghua University(清华大学)

AI总结 本文提出Proact-VL框架,通过游戏场景中的评论和引导任务,解决实时AI伴侣在低延迟推理、自主响应决策和内容质量控制方面的挑战,实现了主动式实时交互。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15796 2026-06-16 cs.CV 版本更新

Cross-Modal Registration Between 3D and 2D Fingerprints via Pose-Aware Unwrapping and Point-Cloud Fusion

通过姿态感知解缠和点云融合实现3D与2D指纹的跨模态注册

Xiongjun Guan, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

AI总结 本文提出统一框架,实现3D指纹预处理与跨接触式和非接触式2D指纹的注册,结合非参数可视化解缠、点云融合、姿态归一化和姿态感知注册策略,提升3D与2D指纹兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21714 2026-06-16 cs.AI 版本更新

E-mem: Multi-agent based Episodic Context Reconstruction for LLM Agent Memory

E-mem:基于多智能体的事件上下文重建用于LLM智能体记忆

Kaixiang Wang, Yidan Lin, Jiong Lou, Zhaojiacheng Zhou, Bunyod Suvonov, Jie Li

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 E-mem通过多智能体协同重建事件上下文,提升LLM在长时序任务中的推理能力,实现54%的F1分数,优于现有方法7.75%,并降低70%的token成本。

Comments This paper has been accepted by ICML 2026. If you find our project helpful, please consider giving it a star: https://github.com/dog-last/E-mem

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00591 2026-06-16 cs.CV 版本更新

Intrinsic Gradient Suppression for Label-Noise Prompt Tuning in Vision-Language Models

视觉语言模型中标签噪声提示调优的内在梯度抑制

Jiayu Li, Jiaxin Qi, Sheng Zhou, Jiaqiang Huang, Xiansheng Hua

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 提出双Softmax提示调优(DSPT),通过内在梯度抑制机制自适应压制高错误噪声样本的梯度,实现标签噪声下的鲁棒提示调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28185 2026-06-16 cs.CV 版本更新

Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling

新时代的视觉生成:从原子映射到智能世界建模的演进

Keming Wu, Zuhao Yang, Kaichen Zhang, Shizun Wang, Haowei Zhu, Sicong Leng, Zhongyu Yang, Qijie Wang, Sudong Wang, Ziting Wang, Zili Wang, Hui Zhang, Haonan Wang, Hang Zhou, Yifan Pu, Xingxuan Li, Fangneng Zhan, Bo Li, Lidong Bing, Yuxin Song, Ziwei Liu, Wenhu Chen, Jingdong Wang, Xinchao Wang, Xiaojuan Qi, Shijian Lu, Bin Wang

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) University of Waterloo(滑铁卢大学) StepFun MiroMind Baidu(百度) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) LMMs-Lab(LMMs实验室)

AI总结 提出五级分类法(原子生成、条件生成、上下文生成、智能生成、世界建模生成),分析流匹配、统一理解与生成模型等关键技术,并指出现有评估高估感知质量而忽视结构、时序和因果缺陷。

Comments Project Page: https://github.com/EvolvingLMMs-Lab/Evolving-Visual-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08577 2026-06-16 cs.CL cs.AI cs.LG cs.PF 版本更新

Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models

Think-at-Hard: 选择性潜在迭代以改进推理语言模型

Tianyu Fu, Yichen You, Zekai Chen, Guohao Dai, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对循环变压器中潜在过思考问题,提出Think-at-Hard方法,通过轻量级决策器选择性地在困难令牌上触发潜在迭代,并采用深度感知LoRA和双因果注意力机制,在数学、问答和编码任务上一致提升性能。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04212 2026-06-16 cs.LG cs.AI 版本更新

Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention

低精度Transformer训练失败的原因:对Flash Attention的分析

Haiquan Qiu, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) State Key laboratory of Space Network and Communications(空间网络与通信国家重点实验室)

AI总结 本文首次从机制上解释了低精度下Flash Attention导致训练崩溃的原因,揭示了相似低秩表示与有偏舍入误差的恶性循环,并通过最小化修改稳定训练。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00680 2026-06-16 cs.AI 版本更新

MemPO: Self-Memory Policy Optimization for Long-Horizon Agents

MemPO:面向长时程智能体的自我记忆策略优化

Ruoran Li, Xinghua Zhang, Haiyang Yu, Shitong Duan, Xiang Li, Wenxin Xiang, Chonghua Liao, Xudong Guo, Yongbin Li, Jinli Suo

机构 * Tsinghua University(清华大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

AI总结 提出自我记忆策略优化算法(MemPO),让智能体自主管理记忆,通过基于记忆有效性的信用分配机制选择性保留关键信息,在减少令牌消耗的同时提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19595 2026-06-16 cs.IR cs.CL 版本更新

All-Mem: Agentic Lifelong Memory via Dynamic Topology Evolution

All-Mem: 通过动态拓扑演化实现智能体终身记忆

Can Lv, Heng Chang, Shengyu Tao, Mingju Chen, Zhaoxin Fan, Ziwei Zhang, Yuchen Guo, Shiji Zhou

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) Beihang University(北航) Tsinghua University(清华大学) Chalmers University of Technology(查尔姆斯理工大学)

AI总结 提出All-Mem框架,通过在线/离线结合的非破坏性拓扑结构记忆库,解决终身交互代理中历史增长导致的检索冗余和噪声问题,在LoCoMo和LongMemEval-s上提升检索与问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17997 2026-06-16 cs.LG cs.RO 版本更新

Whole-Brain Connectomic Graph Model Enables Whole-Body Locomotion Control in Fruit Fly

全脑连接组图模型实现果蝇全身运动控制

Zehao Jin, Yaoye Zhu, Chen Zhang, Yanan Sui

机构 * Tsinghua University(清华大学)

AI总结 提出Fly-connectomic Graph Model,将果蝇全脑连接组作为图结构控制器,通过深度强化学习驱动仿真果蝇运动,在多种任务中表现稳定且样本效率优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11219 2026-06-16 cs.LG cs.AI 版本更新

SDFLoRA: Selective Decoupled Federated LoRA for Privacy-preserving Fine-tuning with Heterogeneous Clients

SDFLoRA: 面向异构客户隐私保护微调的选择性解耦联邦LoRA

Zhikang Shen, Jianrong Lu, Haiyuan Wan, Jianhai Chen

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 提出SDFLoRA,通过将LoRA更新解耦为共享和私有组件,仅聚合共享部分并注入差分隐私噪声,解决联邦微调中的秩异构和数据异构问题,提升隐私-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04061 2026-06-16 cs.RO cs.CV 版本更新

CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos

CLAP: 从人类视频中学习视觉-语言-动作模型的对比潜在动作预训练

Chubin Zhang, Jianan Wang, Zifeng Gao, Yue Su, Tianru Dai, Cai Zhou, Jiwen Lu, Yansong Tang

机构 * Tsinghua University(清华大学) Astribot University of Hong Kong(香港大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 提出CLAP框架,通过对比学习将人类视频与机器人动作词汇对齐,利用伪标签训练VLA模型,实现从人类视频到机器人执行的有效技能迁移。

Comments The code is available at: https://github.com/LinShan-Bin/OpenCLAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12560 2026-06-16 cs.CV cs.LG cs.RO 版本更新

CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving

CoIRL-AD:面向自动驾驶的潜在世界模型中的协作-竞争模仿-强化学习

Xiaoji Zheng, Ziyuan Yang, Yanhao Chen, Yuhang Peng, Yuanrong Tang, Gengyuan Liu, Bokui Chen, Jiangtao Gong

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 提出CoIRL-AD框架,通过解耦模仿学习与强化学习、利用潜在世界模型进行长时程奖励估计以及引入竞争机制,在离线训练中提升自动驾驶的鲁棒性,尤其在跨城市泛化和长尾场景中表现优异。

Comments 19 pages, 22 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07742 2026-06-16 cs.CV

Efficient 3D Perception on Multi-Sweep Point Cloud with Gumbel Spatial Pruning

多扫点云上的高效3D感知与Gumbel空间修剪

Tianyu Sun, Jianhao Li, Xueqian Zhang, Zhongdao Wang, Bailan Feng, Hengshuang Zhao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Department of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Noah’s Ark Lab(诺亚实验室) Department of Computer Science, University of Hong Kong(香港大学计算机科学系)

AI总结 本文研究了户外环境中点云感知问题,通过累积多个连续点云扫描以提高感知精度,引入Gumbel空间修剪层有效减少冗余点,提升3D感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23688 2026-06-16 cs.CL cs.HC 版本更新

Mapping Geopolitical Bias in 11 Large Language Models: A Bilingual, Dual-Framing Analysis of U.S.-China Tensions

映射11个大语言模型中的地缘政治偏见:美中紧张局势的双语、双框架分析

William Guey, Wei Zhang, Pierrick Bougault, Vitor D. de Moura, José O. Gomes

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) School of Social Sciences, Tsinghua University(清华大学社会科学部) Department of Industrial Engineering, Federal University of Rio de Janeiro(里约热内卢联邦大学工业工程系)

AI总结 通过引入调查心理测量学的平衡键控方法,量化11个模型在2种语言中对美中地缘政治问题的立场,发现开发者起源、查询语言和议题领域是三个近等加性因素,所有模型在中文下更亲华。

Comments 37 pages, 6 main-text figures, 12 supplementary figures, 5 supplementary tables; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏