arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4547
2509.22578 2026-03-31 cs.RO

EgoDemoGen: Egocentric Demonstration Generation for Viewpoint Generalization in Robotic Manipulation

EgoDemoGen:用于机器人操作中视角泛化的眼动演示生成

Yuan Xu, Jiabing Yang, Xiaofeng Wang, Yixiang Chen, Zheng Zhu, Bowen Fang, Guan Huang, Xinze Chen, Yun Ye, Qiang Zhang, Peiyan Li, Xiangnan Wu, Kai Wang, Bing Zhan, Shuo Lu, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) GigaAI Tsinghua University(清华大学) X-Humanoid FiveAges

AI总结 本文提出EgoDemoGen框架,通过EgoTrajTransfer和EgoViewTransfer生成新型眼动视角下的观察-动作演示,提升机器人操作在视角变化下的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28565 2026-03-31 cs.RO cs.CV

StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation

StreamingVLA: 流式视觉-语言-动作模型与动作流匹配及自适应早期观察

Yiran Shi, Dongqi Guo, Tianchen Zhao, Feng Gao, Liangzhi Shi, Chao Yu, ZhiJian Mo, Qihua Xiao, XiaoShuai Peng, Qingmin Liao, Yu Wang

机构 * Tsinghua University(清华大学) Lenovo Group Ltd.(联想集团有限公司)

AI总结 本文提出StreamingVLA模型,通过异步并行化视觉-语言-动作阶段,减少延迟和中断,实现2.4倍的延迟提升和6.5倍的执行中断减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28512 2026-03-31 cs.CL

TIEG-Youpu Solution for NeurIPS 2022 WikiKG90Mv2-LSC

NeurIPS 2022 WikiKG90Mv2-LSC 的 TIEG-Youpu 解决方案

Feng Nie, Zhixiu Ye, Sifa Xie, Shuang Wu, Xin Yuan, Liang Yao, Jiazhen Peng, Xu Cheng

机构 * TIEG-Youpu Tencent, Shenzhen China(腾讯TIEG-优谱,中国深圳) Tsinghua University, Beijing China(清华大学,中国北京)

AI总结 本文提出 TIEG-Youpu 方法,通过检索与重排序流程提升大规模知识图谱嵌入效果,实验显示在验证集上 MRR 从 0.2342 提升至 0.2839。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28366 2026-03-31 cs.CV

AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

AutoCut:基于多模态离散化和可控生成的端到端广告视频编辑

Milton Zhou, Sizhong Qin, Yongzhi Li, Quan Chen, Peng Jiang

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

AI总结 本文提出AutoCut框架,通过多模态离散化和可控生成实现广告视频编辑,提升一致性和可控性,降低生产成本和迭代时间。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28105 2026-03-31 cs.CV

RAWIC: Bit-Depth Adaptive Lossless Raw Image Compression

RAWIC:位深度自适应无损RAW图像压缩

Chunhang Zheng, Tongda Xu, Mingli Xie, Yan Wang, Dou Li

机构 * School of Electronics, Peking University(北京大学电子学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 RAWIC提出一种位深度自适应的无损RAW图像压缩框架,通过转换Bayer数据并自适应位深度估计,实现对不同相机和位深度的高效压缩,实验表明其在JPEG-XL基础上平均提升7.7%的压缩率。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25741 2026-03-31 cs.CV cs.AI cs.RO

Vega: Learning to Drive with Natural Language Instructions

Vega:通过自然语言指令学习驾驶

Sicheng Zuo, Yuxuan Li, Wenzhao Zheng, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) GigaAI

AI总结 本文提出Vega模型,通过自然语言指令生成和规划,提升自动驾驶的灵活性和个性化水平,基于大规模驾驶数据集InstructScene进行实验验证。

Comments Code is available at https://github.com/zuosc19/Vega

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25706 2026-03-31 cs.CV

Wan-Weaver: Interleaved Multi-modal Generation via Decoupled Training

Wan-Weaver:通过解耦训练实现交错多模态生成

Jinbo Xing, Zeyinzi Jiang, Yuxiang Tuo, Chaojie Mao, Xiaotang Gai, Xi Chen, Jingfeng Zhang, Yulin Pan, Zhen Han, Jie Xiao, Keyu Yan, Chenwei Xie, Chongyang Zhong, Kai Zhu, Tong Shen, Lianghua Huang, Yu Liu, Yujiu Yang

机构 * Tongyi Lab(通义实验室) Tsinghua University(清华大学)

AI总结 本文提出Wan-Weaver,通过解耦训练实现交错多模态生成,利用文本规划和视觉一致性建模,生成长文本连贯性和视觉一致性。

Comments CVPR 2026 Camera-ready, Webpage: https://doubiiu.github.io/projects/WanWeaver

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19582 2026-03-31 cs.CV

ScenePilot-4K: A Large-Scale First-Person Dataset and Benchmark for Vision-Language Models in Autonomous Driving

ScenePilot-4K:一个大规模第一视角数据集和基准,用于自动驾驶中视觉-语言模型的安全感知学习与评估

Yujin Wang, Yutong Zheng, Wenxian Fan, Tianyi Wang, Hongqing Chu, Li Zhang, Bingzhao Gao, Daxin Tian, Jianqiang Wang, Hong Chen

机构 * Tongji University(同济大学) UT Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

AI总结 本文提出ScenePilot-4K数据集,包含3847小时视频和27.7亿帧图像,用于评估视觉-语言模型在自动驾驶中的场景理解、空间感知、运动规划和语义对齐能力,揭示模型在几何感知和规划推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23919 2026-03-31 cs.RO

Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-shot Robot Manipulation

Goal-VLA: 图像生成视觉语言模型作为对象中心世界模型,赋能零样本机器人操作

Haonan Chen, Jingxiang Guo, Bangjun Wang, Tianrui Zhang, Xuchuan Huang, Boren Zheng, Yiwen Hou, Chenrui Tie, Jiajun Deng, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) The HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学数据科学研究院) Yuanpei College, Peking University(北京大学元培学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出Goal-VLA框架,利用图像生成视觉语言模型生成目标状态,通过对象状态表示分离高阶与低阶策略,提升机器人操作的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05207 2026-03-31 cs.CV

Follow-Your-Motion: Video Motion Transfer via Efficient Spatial-Temporal Decoupled Finetuning

跟随你的动作:通过高效的时空解耦微调实现视频动作迁移

Yue Ma, Yulong Liu, Qiyuan Zhu, Ayden Yang, Kunyu Feng, Xinhua Zhang, Zexuan Yan, Zhifeng Li, Sirui Han, Chenyang Qi, Qifeng Chen

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Tsinghua University(清华大学) XIntelligence Technology Co., Limited(星云科技股份有限公司) SJTU(上海交通大学)

AI总结 本文提出Follow-Your-Motion框架,通过高效的时空解耦微调方法,解决视频扩散变换器在动作迁移中的不一致性和效率问题,并引入MotionBench基准进行验证。

Comments Accepted by ICLR 2026, project page: https://follow-your-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12772 2026-03-31 cs.CV

P$^2$HCT: Plug-and-Play Hierarchical C2F Transformer for Multi-Scale Feature Fusion

P²HCT:插件式分层C2F变换器用于多尺度特征融合

Junyi Hu, Tian Bai, Fengyi Wu, Zhenming Peng, Yi Zhang

机构 * Department of Automation Tsinghua University Beijing, China Department of R\&D Linsulabs Chengdu, China School of Information Communication Engineering University of Electronic Science

AI总结 本文提出P²HCT模块,通过粗到细的token选择与共享注意力参数实现轻量级多尺度特征融合,提升检测与分类任务性能。

Comments 12 pages, 6 figures, ICME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27482 2026-03-31 cs.CV cs.AI

Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning

差分反馈:为视觉语言模型强化学习生成多模态过程级监督

Feiding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Chunzheng Zhu, Yaozong Zheng, Yafei Liu, Yeling Peng, Youwei Wang, Sibo Wang, Huiming Yang, Linglin Liao, Shunzhi Yang

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)

AI总结 本文提出差分反馈方法,通过修复错误推理轨迹自动构建token/步骤级监督掩码,实现多模态推理中的过程级视觉对齐,实验显示在MMMStar和MathVista基准上平均提升3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27460 2026-03-31 cs.CV cs.AI

Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development

Project Imaging-X:1000多个开放访问医学影像数据集的调查

Zhongying Deng, Cheng Tang, Ziyan Huang, Jiashi Lin, Ying Chen, Junzhi Ning, Chenglong Ma, Jiyao Liu, Wei Li, Yinghao Zhu, Shujian Gao, Yanyan Huang, Sibo Ju, Yanzhou Su, Pengcheng Chen, Wenhao Tang, Tianbin Li, Haoyu Wang, Yuanfeng Ji, Hui Sun, Shaobo Min, Liang Peng, Feilong Tang, Haochen Xue, Rulin Zhou, Chaoyang Zhang, Wenjie Li, Shaohao Rui, Weijie Ma, Xingyue Zhao, Yibin Wang, Kun Yuan, Zhaohui Lu, Shujun Wang, Jinjie Wei, Lihao Liu, Dingkang Yang, Lin Wang, Yulong Li, Haolin Yang, Yiqing Shen, Lequan Yu, Xiaowei Hu, Yun Gu, Yicheng Wu, Benyou Wang, Minghui Zhang, Angelica I. Aviles-Rivero, Qi Gao, Hongming Shan, Xiaoyu Ren, Fang Yan, Hongyu Zhou, Haodong Duan, Maosong Cao, Shanshan Wang, Bin Fu, Xiaomeng Li, Zhi Hou, Chunfeng Song, Lei Bai, Yuan Cheng, Yuandong Pu, Xiang Li, Wenhai Wang, Hao Chen, Jiaxin Zhuang, Songyang Zhang, Huiguang He, Mengzhang Li, Bohan Zhuang, Zhian Bai, Rongshan Yu, Liansheng Wang, Yukun Zhou, Xiaosong Wang, Xin Guo, Guanbin Li, Xiangru Lin, Dakai Jin, Mianxin Liu, Wenlong Zhang, Qi Qin, Conghui He, Yuqiang Li, Ye Luo, Nanqing Dong, Jie Xu, Wenqi Shao, Bo Zhang, Qiujuan Yan, Yihao Liu, Jun Ma, Zhi Lu, Yuewen Cao, Zongwei Zhou, Jianming Liang, Shixiang Tang, Qi Duan, Dongzhan Zhou, Chen Jiang, Yuyin Zhou, Yanwu Xu, Jiancheng Yang, Shaoting Zhang, Xiaohong Liu, Siqi Luo, Yi Xin, Chaoyu Liu, Haochen Wen, Xin Chen, Alejandro Lozano, Min Woo Sun, Yuhui Zhang, Yue Yao, Xiaoxiao Sun, Serena Yeung-Levy, Xia Li, Jing Ke, Chunhui Zhang, Zongyuan Ge, Ming Hu, Jin Ye, Zhifeng Li, Yirong Chen, Yu Qiao, Junjun He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Institute of Optics and Fine Mechanics(上海光学精密机械研究所) Fudan University(复旦大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Fuzhou University(福州大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Incept Labs Monash University(莫纳什大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Alibaba DAMO Academy(阿里巴巴达摩院) The Hong Kong Polytechnic University(香港理工大学) South China University of Technology(华南理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与产业研究院) Shanghai Academy of Artificial Intelligence for Science(上海科学智能研究院) Nankai University(南开大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) School of Informatics, Xiamen University(厦门大学信息学院) University College London(伦敦大学学院) Sun Yat-sen University(中山大学) Alibaba Group, DAMO Academy, New York, NY, USA(阿里巴巴集团达摩院(纽约)) Tongji University(同济大学) University of Toronto(多伦多大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) Johns Hopkins University(约翰霍普金斯大学) Arizona State University(亚利桑那州立大学) Academy for Clinical Innovation and Translation of Shanghai(上海临床创新转化研究院) University of California, Santa Cruz(加州大学圣克鲁兹分校) ELLIS Institute Finland(芬兰ELLIS研究所) Aalto University(阿尔托大学) Shandong University(山东大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文调查了1000多个开放访问医学影像数据集,揭示了其规模小、任务碎片化和分布不均的问题,并提出元数据驱动融合方法和交互发现门户,为医学影像数据集的整合和基础模型发展提供路线图。

Comments 157 pages, 19 figures, 26 tables. Project repo: \url{https://github.com/uni-medical/Project-Imaging-X}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27300 2026-03-31 cs.CV

Complet4R: Geometric Complete 4D Reconstruction

Complet4R:几何完整4D重建

Weibang Wang, Kenan Li, Zhuoguang Chen, Yijun Yuan, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学交叉信息研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Qi Zhi Institute(上海期智研究院)

AI总结 Complet4R提出一种端到端框架,通过全局处理视频输入实现动态场景的时空一致且几何完整的4D重建,解决了传统方法依赖配对重建和局部运动估计的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27189 2026-03-31 stat.ME cs.LG stat.ML

Conformal Prediction Assessment: A Framework for Conditional Coverage Evaluation and Selection

符合预测评估:一种条件覆盖评估和选择的框架

Zheng Zhou, Xiangfei Zhang, Chongguang Tao, Yuhong Yang

机构 * Qiuzhen College, Tsinghua University(清华大学求真书院) Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心)

AI总结 本文提出CPA框架,通过训练可靠性估计器评估条件覆盖,引入CVI指数分解可靠性并证明其一致性,实验表明CPA能有效诊断局部失效模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27083 2026-03-31 cs.CV

LightCtrl: Training-free Controllable Video Relighting

LightCtrl: 不需要训练的可控视频重照明

Yizuo Peng, Xuelin Chen, Kai Zhang, Xiaodong Cun

机构 * Tsinghua University(清华大学) GVC Lab, Great Bay University(大湾区大学GVC实验室) Adobe Research(Adobe研究院)

AI总结 LightCtrl是首个无需训练的可控视频重照明方法,通过用户提供的光照轨迹实现对视频光照的显式控制,结合预训练扩散模型提升时间一致性,实验显示其在光照变化多样性和可控性上优于基线方法。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21956 2026-03-31 cs.LG

Uncertainty-Aware Data-Based Method for Fast and Reliable Shape Optimization

基于不确定性的数据优化方法:快速且可靠的形状优化

Yunjia Yang, Runze Li, Yufei Zhang, Haixin Chen

机构 * School of Aerospace Engineering, Tsinghua University(清华大学航天航空学院)

AI总结 本文提出一种考虑不确定性的数据优化框架,通过概率编码器-解码器模型预测不确定性,并在优化过程中减少预测误差,提升优化效果和速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01331 2026-03-31 cs.CY cs.CL cs.LG

AppellateGen: A Benchmark for Appellate Legal Judgment Generation

AppellateGen:上诉法律判决生成的基准测试

Hongkun Yang, Lionel Z. Wang, Wei Fan, Yiran Hu, Lixu Wang, Chenyu Liu, Yu Zeng, Shenghong Fu, Lei Gong, Zhengxin Zhang, Haoyang Li, Jiexin Zheng, Xin Xu

机构 * Nanyang Technological University(南洋理工大学) Ocean University of China(中国海洋大学) The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学)

AI总结 本文提出AppellateGen基准测试,包含7351个案例对,用于生成上诉阶段的法律判决,通过模拟司法流程验证模型在上诉推理中的逻辑一致性与挑战。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22065 2026-03-31 cs.CV cs.AI cs.HC

StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars

StreamAvatar:用于实时交互人类分身的流式扩散模型

Zhiyao Sun, Ziqiao Peng, Yifeng Ma, Yi Chen, Zhengguang Zhou, Zixiang Zhou, Guozhen Zhang, Youliang Zhang, Yuan Zhou, Qinglin Lu, Yong-Jin Liu

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) Tencent Hunyuan(腾讯混元) Nanjing University(南京大学)

AI总结 本文提出一种两阶段自回归适应与加速框架,通过自回归蒸馏和对抗性细化,使高保真人类视频扩散模型适用于实时交互流式生成,实现自然对话与倾听行为。

Comments Accepted by CVPR 2026. Project page: https://streamavatar.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14139 2026-03-31 cs.RO

FlexiCup: Wireless Multimodal Suction Cup with Dual-Zone Vision-Tactile Sensing

FlexiCup: 无线多模态吸盘 with 双区视觉-触觉感知

Junhao Gong, Shoujie Li, Kit-Wa Sou, Changqing Guo, Hourong Huang, Tong Wu, Yifan Xie, Chenxin Liang, Chuqiao Lyu, Xiaojun Liang, Wenbo Ding

机构 * Shenzhen Ubiquitous Data Enabling Key Lab, Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,深圳泛在数据赋能重点实验室) Peng Cheng Laboratory(鹏城实验室)

AI总结 FlexiCup通过无线电子集成双区视觉-触觉传感,实现接触感知操控,验证了传感与驱动解耦的有效性,同时在不同气动原理下均表现出色。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26794 2026-03-31 cs.CV

The Quest for Generalizable Motion Generation: Data, Model, and Evaluation

可泛化动作生成的探索:数据、模型与评估

Jing Lin, Ruisi Wang, Junzhe Lu, Ziqi Huang, Guorui Song, Ailing Zeng, Xian Liu, Chen Wei, Wanqi Yin, Qingping Sun, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) NVIDIA Research(英伟达研究院)

AI总结 本文提出一个综合框架,通过数据、建模和评估三大支柱将视频生成知识迁移至动作生成,引入大规模数据集和改进模型,提升动作生成的泛化能力。

Comments Homepage: https://motrixlab.github.io/2026_iclr_vimogen

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05352 2026-03-31 cs.LG cs.AI

Recent Advances of Multimodal Continual Learning: A Comprehensive Survey

多模态持续学习的最新进展:综合性综述

Dianzhi Yu, Xinni Zhang, Yankai Chen, Aiwei Liu, Yifei Zhang, Philip S. Yu, Irwin King

机构 * Tsinghua University(清华大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 本文综述了多模态持续学习的最新进展,分析了其核心挑战与方法分类,提出四种主要方法类别,并讨论了未来研究方向和开放资源。

Comments Accepted by IEEE Transactions on Neural Networks and Learning Systems (TNNLS). DOI: 10.1109/TNNLS.2026.3658485. Copyright 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26831 2026-03-31 cs.CV cs.AI

Envisioning global urban development with satellite imagery and generative AI

用卫星影像和生成式AI展望全球城市发展

Kailai Sun, Yuebing Liang, Mingyi He, Yunhan Zheng, Alok Prakash, Shenhao Wang, Jinhua Zhao, Alex "Sandy'' Pentland

机构 * Singapore–MIT Alliance for Research and Technology Centre (SMART)(新加坡-麻省理工学院研究与技术联盟中心) Department of Urban Planning, Tsinghua University(清华大学城市规划系) Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系) College of Urban and Environmental Sciences, Peking University(北京大学城市与环境学院) Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系) Stanford Institute for Human-Centered Artificial Intelligence, Stanford University(斯坦福大学以人为本人工智能研究所)

AI总结 本文提出一种多模态生成式AI框架,通过整合提示和地理空间控制,生成全球500个最大都会区的高保真城市卫星影像,支持可持续城市发展和场景规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26801 2026-03-31 cs.LG cs.AI

Sparse-by-Design Cross-Modality Prediction: L0-Gated Representations for Reliable and Efficient Learning

为可靠和高效学习设计的稀疏性跨模态预测:L0门控表示

Filippo Cenacchi

机构 * School of Computing, Macquarie University(麦考瑞大学计算学院) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(法国国家信息与自动化研究所巴黎-罗康库尔中心) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室)

AI总结 本文提出L0-Gated Cross-Modality Learning方法,通过统一的稀疏化机制实现跨模态的准确率与效率平衡,减少表示维度并提升校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26800 2026-03-31 cs.LG cs.AI physics.flu-dyn

DSO: Dual-Scale Neural Operators for Stable Long-term Fluid Dynamics Forecasting

DSO:双尺度神经算子用于稳定长期流体动力学预测

Huanshuo Dong, Hao Wu, Hong Wang, Qin-Yi Zhang, Zhezheng Hao

机构 * Institute for Clarity in Documentation(文档清晰度研究所) Inria Paris-Rocquencourt(法国国家信息与自动化研究所巴黎-罗康库尔) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhejiang University(浙江大学)

AI总结 本文提出DSO双尺度神经算子,通过分离局部细节和全局趋势处理,提升长期流体预测的稳定性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26690 2026-03-31 cs.RO cs.AI cs.CV

SpatialPoint: Spatial-aware Point Prediction for Embodied Localization

SpatialPoint: 体感-aware 点预测用于具身定位

Qiming Zhu, Zhirui Fang, Tianming Zhang, Chuanxiu Liu, Xiaoke Jiang, Lei Zhang

机构 * Visincept Research(Visincept 研究院) Tsinghua University(清华大学) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA))

AI总结 本文提出SpatialPoint框架,通过整合结构化深度信息提升具身定位性能,采用260万样本RGB-D数据集进行训练与评估,在真实机器人部署中验证了其在抓取、放置和导航任务中的有效性。

Comments 19 pages, 12 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26664 2026-03-30 cs.SE cs.CL

Learning to Commit: Generating Organic Pull Requests via Online Repository Memory

学习承诺:通过在线仓库记忆生成有机的拉取请求

Mo Li, L. H. Xu, Qitai Tan, Ting Cao, Yunxin Liu

机构 * Tsinghua University(清华大学)

AI总结 本文提出Learning to Commit框架,通过在线仓库记忆提升生成拉取请求的有机性,通过对比历史提交改进代码风格和架构约束。

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26653 2026-03-30 cs.CV cs.AI cs.CL cs.LG

PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning

PerceptionComp:一个复杂感知导向推理的视频基准测试

Shaoxuan Li, Zhixuan Zhao, Hanze Deng, Zirun Ma, Shulin Tian, Zuyan Liu, Yushi Hu, Haoning Wu, Yuhao Dong, Benlin Liu, Ziwei Liu, Ranjay Krishna

机构 * Tsinghua University(清华大学) University of Washington(华盛顿大学) Nanyang Technological University(南洋理工大学)

AI总结 PerceptionComp是一个手动标注的复杂长时景视频推理基准测试,要求多时间片段的视觉证据和逻辑约束,涉及多个感知子任务,测试人类和模型在感知推理中的性能瓶颈。

Comments Project Page: https://perceptioncomp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26646 2026-03-30 cs.CV

Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision

超越语言:基于手部指向的自我中心视觉指称表达定位

Ling Li, Bowen Liu, Zinuo Zhan, Peng Jie, Jianhui Zhong, Kenglun Chang, Zhidong Deng

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Northwestern Polytechnical University(西北工业大学) Apple(苹果公司)

AI总结 本文提出EgoPoint-Ground数据集,通过手部指向与语音结合的指称机制,改进视觉指称表达的定位方法,并提出SV-CoT框架提升多模态理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26465 2026-03-30 cs.LG cs.AI

A Boltzmann-machine-enhanced Transformer For DNA Sequence Classification

一种增强型变换器用于DNA序列分类

Zhixuan Cao, Yishu Xu, Xuang WU

机构 * Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种结合玻尔兹曼机和变换器的模型,用于DNA序列分类,通过引入结构化的二进制门控变量和能量函数约束,提升对潜在相互作用和高阶依赖的建模能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏