arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4536
2604.13088 2026-05-26 cs.LG cs.AI

Design Conditions for Intra-Group Learning of Sequence-Level Rewards: Token Gradient Cancellation

序列级奖励的组内学习设计条件:令牌梯度消除

Fei Ding, Yongkang Zhang, youwei wang, Zijian Zeng

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

AI总结 针对大语言模型多步推理中稀疏终端奖励导致的信用分配问题,提出反事实比较框架和隐式行为策略优化(IBPO),通过轨迹差异近似替代决策,将稀疏奖励转化为步骤敏感信号,提升训练稳定性和推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22973 2026-05-26 cs.CV

Scaling Up Occupancy-centric Driving Scene Generation: Dataset and Method

扩展以占据为中心的驾驶场景生成:数据集与方法

Bohan Li, Xin Jin, Hu Zhu, Hongsi Liu, Ruikai Li, Jiazhe Guo, Kaiwen Cai, Chao Ma, Yueming Jin, Hao Zhao, Xiaokang Yang, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究院) School of Electronic Information and Electrical Engineering(电子信息与电气工程学院) Li Auto(力汽车) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生实验室) Ningbo Institute of Digital Twin(宁波数字孪生研究院)

AI总结 针对占据数据稀缺问题,构建最大语义占据数据集Nuplan-Occ,并提出统一框架联合生成高质量语义占据、多视角视频和LiDAR点云,采用时空解耦架构及高斯泼溅稀疏点图渲染和传感器感知嵌入策略,实现高保真生成。

Comments IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10054 2026-05-26 cs.LG cs.AI cs.CL cs.CV

Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs

Uni-DPO:大语言模型动态偏好优化的统一范式

Shangpin Peng, Weinong Wang, Zhuotao Tian, Senqiao Yang, Xing Wu, Haotian Xu, Chengquan Zhang, Takashi Isobe, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Xi’an Jiaotong University(西安交通大学) The Chinese University of Hong Kong(香港中文大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 针对现有DPO方法忽略数据质量和学习难度差异的问题,提出Uni-DPO统一框架,通过自适应重加权偏好对实现更有效的数据利用和更优性能。

Comments Accepted by ICLR 2026. Code & models: https://github.com/pspdada/Uni-DPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23764 2026-05-26 cs.CV cs.CL

MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence

MMSI-Bench:多图像空间智能基准

Sihan Yang, Runsen Xu, Yiman Xie, Sizhe Yang, Mo Li, Jingli Lin, Chenming Zhu, Xiaochen Chen, Haodong Duan, Xiangyu Yue, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Shanghai Jiaotong University(上海交通大学) University of Hong Kong(香港大学) Beijing Normal University(北京师范大学)

AI总结 提出MMSI-Bench基准,通过1000道精心设计的VQA问题评估多图像空间推理能力,发现现有模型准确率远低于人类。

Comments ICLR 2026 Camera ready. 38 pages. Project page: https://runsenxu.com/projects/MMSI_Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18363 2026-05-26 cs.CL cs.AI cs.LG

PowerFlow: Unlocking the Dual Nature of LLMs via Principled Distribution Matching

PowerFlow: 通过原则性分布匹配释放LLMs的双重特性

Ruishuo Chen, Yu Chen, Zhuoran Li, Longbo Huang

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China(清华大学交叉信息研究院)

AI总结 提出PowerFlow框架,将无监督微调重构成分布匹配问题,利用GFlowNet和长度感知轨迹平衡目标,通过调整α-幂分布方向性激发LLMs的逻辑推理或创造性。

Comments Camera-ready version accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20110 2026-05-26 cs.LG cs.AI

Beyond the Proxy: Trajectory-Distilled Guidance for Offline GFlowNet Training

超越代理:用于离线GFlowNet训练的轨迹蒸馏指导

Ruishuo Chen, Xun Wang, Rui Hu, Zhuoran Li, Longbo Huang

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China(清华大学交叉信息研究院)

AI总结 提出轨迹蒸馏GFlowNet(TD-GFN),利用逆强化学习从离线轨迹中提取稠密边奖励,通过DAG剪枝和优先反向采样指导策略,避免代理模型,提升离线GFlowNet训练的收敛速度和样本质量。

Comments Camera-ready version accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23887 2026-05-25 cs.DB cs.AI cs.CR cs.LG cs.MA

CHRONOS: Temporally-Aware Multi-Agent Coordination for Evolving Data Marketplaces

CHRONOS:面向演化数据市场的时态感知多智能体协调

Joydeep Chandra

机构 * BNRIST, Tsinghua University(北京清华大学智能机器人系统研究院)

AI总结 提出CHRONOS三层架构,通过神经ODE时间衰减、基于变点的Shapley估值和EXP3-IX差分隐私协调,解决时态知识图谱数据市场中索引陈旧、定价偏差和隐私预算过度消耗问题,在四个基准上实现0.937召回率、2.74 qps和4.25总隐私预算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23565 2026-05-25 cs.LG cs.AI

Safe Reinforcement Learning with Preference-based Constraint Inference

基于偏好的约束推断的安全强化学习

Chenglin Li, Grant Ruan, Hua Geng

机构 * Department of Automation, Tsinghua University, Beijing, China Laboratory for Information \& Decision Systems, Massachusetts Institute of Technology, Cambridge, MA, USA

AI总结 提出偏好约束强化学习(PbCRL),通过引入死区机制和信噪比损失,从人类偏好中推断安全约束,实现更好的约束对齐和策略学习。

Comments Accepted by the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11146 2026-05-25 cs.CV cs.AI

Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling

超越基于VLM的奖励:扩散原生潜在奖励建模

Gongye Liu, Bo Yang, Yida Zhi, Zhizhou Zhong, Lei Ke, Didan Deng, Han Gao, Yongxiang Huang, Kaihao Zhang, Hongbo Fu, Wenhan Luo

机构 * The Hong Kong University of Science Huawei Hong Kong AI Framework \& Data Technologies Lab Tsinghua University The Australian National University

AI总结 提出扩散原生潜在奖励模型DiNa-LRM,直接在噪声扩散状态上进行偏好学习,通过噪声校准Thurstone似然和推理时噪声集成,实现高效且鲁棒的奖励建模。

Comments Accepted by ICML 2026. Code: https://github.com/HKUST-C4G/diffusion-rm

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20901 2026-05-25 cs.CV

Benchmarking and Enhancing VLM for Compressed Image Understanding

基准测试与增强VLM对压缩图像的理解

Zifu Zhang, Tongda Xu, Siqi Li, Shengxi Li, Yue Zhang, Mai Xu, Yan Wang

机构 * Institute for AI Industry Research, Tsinghua University, Beijing, China(清华人工智能产业研究院) Beihang University, Beijing, China(北京航空航天大学) Beijing University of Technology, Beijing, China(北京理工大学)

AI总结 本文提出首个全面基准测试评估VLM对压缩图像的理解能力,分析性能差距来源,并设计通用适配器提升模型性能10%-30%。

Comments The paper is accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14135 2026-05-25 cs.RO cs.CV

GAF: Gaussian Action Field as a 4D Representation for Dynamic World Modeling in Robotic Manipulation

GAF: 高斯动作场作为机器人操作中动态世界建模的4D表示

Ying Chai, Litao Deng, Ruizhi Shao, Jiajun Zhang, Kangchen Lv, Liangjun Xing, Xiang Li, Hongwen Zhang, Yebin Liu

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学) Shadow AI

AI总结 提出GAF,通过扩展3D高斯溅射引入可学习运动属性,实现动态场景的4D建模,并利用动作-视觉对齐去噪框架提升机器人操作成功率。

Comments https://ChaiYing1.github.io/projects/GAF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23458 2026-05-25 cs.CV cs.AI

One-Forcing: Towards Stable One-Step Autoregressive Video Generation

One-Forcing: 迈向稳定的一步自回归视频生成

Jiaqi Feng, Justin Cui, Yuanhao Ban, Cho-Jui Hsieh

机构 * Tsinghua University(清华大学) UCLA(加州大学洛杉矶分校)

AI总结 针对现有少步自回归视频生成方法在一步设置下质量严重下降的问题,提出One-Forcing方法,通过向DMD目标添加辅助GAN损失,实现高质量高效的一步视频生成,在VBench上达到83.76总分,成为一步因果视频生成中的最优方法。

Comments Work in Progress. Project Page: https://aurora-edu.github.io/one-forcing/, Code: https://github.com/Aurora-edu/One-Forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23426 2026-05-25 cs.HC cs.AI

Socially fluent AI decouples conversational signals from source identity in online interaction

社交流畅的AI在在线互动中解耦对话信号与来源身份

Lixiang Yan, Yueqiao Jin, Xibin Han, Dragan Gašević

机构 * School of Education, Tsinghua University(清华大学教育学院) Faculty of Information Technology, Monash University(墨尔本大学信息技术学院) Faculty of Education, The University of Hong Kong(香港大学教育学院)

AI总结 本研究通过同步文本群组交互实验,发现社交流畅的AI代理使人类无法高于随机水平区分AI与人类队友,且这种失败源于参与者依赖与真实身份弱相关的怀疑启发式,而非缺乏身份相关信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23341 2026-05-25 cs.RO cs.AI

Sparse Compositional Flow Matching by geometric assembly from motion primitives

基于运动基元的几何组装的稀疏组合流匹配

Yan Tang, Yuanbo Tang, Tingyu Cao, Shaolun Huang, Yang Li

机构 * Tsinghua Shenzhen Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳研究生院,清华大学,深圳,中国) School of AI, Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)人工智能学院)

AI总结 提出一种通过运动基元字典学习和几何约束的稀疏流匹配框架,直接在物理轨迹空间进行组合生成,实现状态最优精度并显著降低FDE/ADE比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23323 2026-05-25 eess.IV cs.CV

Efficient Learned Image Compression without Entropy Coding

无需熵编码的高效学习图像压缩

Hao Cao, Wenqi Guo, Zhijin Qin, Jungong Han

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Department of Automation, Tsinghua University(清华大学自动化系) State Key Laboratory of Space Network(空间网络与通信国家重点实验室) Beijing National Research Center for Information Science(北京信息科学国家研究中心)

AI总结 提出一种无需熵编码的多速率学习图像压缩框架EF-LIC,通过无约束向量量化和上下文条件自回归变换消除统计与相关冗余,在保持压缩性能的同时显著降低编码延迟。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23287 2026-05-25 cs.CV

LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images

LangFlash: 基于前馈的3D语言高斯泼溅从稀疏无位姿图像

Yilong Liu, Wanhua Li, Chen Zhu-Tian, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) University of Minnesota - Twin Cities(明尼苏达大学-双城分校)

AI总结 提出LangFlash,一种前馈框架,从稀疏无位姿多视图图像直接预测3D高斯原语及其语言对齐语义特征,实现低延迟3D重建和语义一致场景理解。

Comments CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23271 2026-05-25 cs.CV cs.AI

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

EvalVerse:面向专业电影级视频生成的流水线感知与专家校准基准测试

Songlin Yang, Haobin Zhong, Ruilin Zhang, Xiaotong Zhao, Shuai Li, Kai Zheng, Xuyi Yang, Zhe Wang, Zhenchen Tang, Yang Li, Bohai Gu, Zhengwei Peng, Yidan Huang, Mengzhou Luo, Yihang Bo, Dalu Feng, Yujia Zhang, Juntao Ma, Ruiqi Wang, Lvmin Zhang, Yuwei Guo, Frank Guan, Maneesh Agrawala, Hongbo Fu, Alan Zhao, Anyi Rao

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tencent(腾讯) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Film Academy(北京电影学院) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学) Singapore Institute of Technology(新加坡理工学院)

AI总结 提出EvalVerse框架,通过将电影制作专业知识系统化为评估分类法、构建专家标注数据集并微调视觉语言模型进行链式推理,解决了现有基准忽视电影质量、缺乏领域特异性指标的问题,实现了对生成视频“正确性”与“优良性”的全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23261 2026-05-25 eess.AS cs.SD

UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment

UniSRM:一种用于基于推理的细粒度评估的统一语音奖励模型

Yuanyuan Wang, Dongchao Yang, Yayue Deng, Zhiyong Wu, Yiwen Guo, Helen Meng, Xixin Wu

机构 * The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Independent Researcher(独立研究者)

AI总结 提出UniSRM统一语音奖励模型,通过两阶段流水线和推理一致性奖励机制,实现多维度、可解释的语音质量评估,在多种任务上优于现有方法。

Comments Accepted by ACL 2026(Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23204 2026-05-25 cs.AI

AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery

AutoResearch AI:迈向人工智能驱动的科研自动化以实现科学发现

Guiyao Tie, Jiawen Shi, Dingjie Song, Yixiao Huang, Ziji Sheng, Xueyang Zhou, Daizong Liu, Pan Zhou, Yongchao Chen, Ran Xu, Lifang He, Qingsong Wen, Manling Li, Cong Lu, Shuai Li, Pengtao Xie, Yixuan Yuan, Rui Meng, Lei Xing, Lichao Sun, Caiming Xiong, Philip S. Yu, Jianfeng Gao

机构 * Huazhong University of Science and Technology(华中科技大学) Lehigh University(莱斯大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Salesforce Research(Salesforce研究) Squirrel AI Learning(Squirrel AI学习) Northwestern University(西北大学) Independent(独立) Shanghai Jiao Tong University(上海交通大学) University of California San Diego(加州大学圣地亚哥分校) Chinese University of Hong Kong(香港中文大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Stanford University(斯坦福大学) Google Cloud AI Research(谷歌云AI研究) Recursive Superintelligence(递归超级智能) Microsoft Research(微软研究院)

AI总结 本文综述了AI驱动的科研工作流自动化(AutoResearch)的发展,分析了从任务级AI到工作流级研究自动化的转变,并提出了五个评估维度(新颖性、有效性、影响力、可靠性和溯源),指出自主性受领域条件限制。

Comments 49 pages, 12 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11596 2026-05-25 cs.CV

HorizonDrive: Self-Corrective Autoregressive World Model for Long-horizon Driving Simulation

HorizonDrive: 用于长时域驾驶仿真的自纠正自回归世界模型

Conglang Zhang, Yifan Zhan, Qingjie Wang, Zhanpeng Ouyang, Yu Li, Zihao Yang, Xiaoyang Guo, Weiqiang Ren, Qian Zhang, Zhen Dong, Yinqiang Zheng, Wei Yin, Zhengqing Chen

机构 * Wuhan University(武汉大学) The University of Tokyo(东京大学) Horizon Robotics Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对自回归驾驶仿真中教师模型因自身预测漂移导致监督退化的问题,提出HorizonDrive框架,通过计划性滚转恢复(SRR)训练抗漂移教师模型,并利用教师滚转分布匹配蒸馏(TRD)实现长时域监督下的高效学生模型部署。

Comments Comments: 22 pages, 14 figures. Project page: https://zcliangyue.github.io/HorizonDrive Code: https://github.com/zcliangyue/HorizonDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06094 2026-05-25 cs.CV cs.AI

VISD: Enhancing Video Reasoning via Structured Self-Distillation

VISD: 通过结构化自蒸馏增强视频推理

Hao Lin, Kunyang Lv, Xu Jiang, Jingqi Tian, Zhongjing Du, Jiayu Ding, Qiaoman Zhang, Hongbo Jin

机构 * HUST(华中科技大学) Wuhan University(武汉大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 提出VISD框架,利用结构化自蒸馏和方向-幅度解耦机制,实现细粒度信用分配,提升视频推理准确性和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05997 2026-05-25 cs.CV

4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding

4DThinker: 用4D图像进行动态空间理解的思考

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xiang An, Bo Li, Xin Xie, ZiDong Wang, Mingze Sun, Shuang Chen, Hongyu Li, Xiaobin Hu, Ruqi Huang

机构 * Tsinghua University, SIGS(清华大学 SIGS) Meituan(美团) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) LMMs-Lab(LMMs实验室) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出4DThinker框架,通过动态潜在心理图像(在连续隐藏空间中模拟场景演化)增强视觉语言模型的动态空间推理能力,并引入无标注数据生成、动态图像微调及4D强化学习,在多个基准上超越强基线。

Comments 21 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03244 2026-05-25 cs.AI cs.CY cs.DB

AI Evaluation Should Require Standardized Item-Level Data Releases

AI评估应要求标准化的项目级数据发布

Han Jiang, Susu Zhang, Dongyao Zhu, Yuzhuo Bai, Sang T. Truong, Xiaoyuan Yi, Sanmi Koyejo, Xing Xie, Ziang Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research Asia(微软亚洲研究院) Stanford University(斯坦福大学) North Carolina State University(北卡罗来纳州立大学) Tsinghua University(清华大学)

AI总结 本文主张AI评估应标准化发布项目级数据,以解决当前评估中项目选择不明确、构造错位和泛化能力差的问题,并通过OpenEval项目展示其可行性和价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02897 2026-05-25 cs.CV

ProGIC: Progressive and Lightweight Generative Image Compression with Residual Vector Quantization

ProGIC:基于残差向量量化的渐进式轻量级生成图像压缩

Hao Cao, Chengbin Liang, Wenqi Guo, Zhijin Qin, Jungong Han

机构 * Tsinghua University(清华大学) State Key Laboratory of Space Network and Communications(空间网络与通信国家重点实验室)

AI总结 提出一种基于残差向量量化的轻量级渐进式生成图像压缩方法ProGIC,通过逐级量化残差实现粗到细重建和渐进比特流,在保持感知质量的同时显著提升编码解码速度。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18176 2026-05-25 cs.CL

Improving Sampling for Masked Diffusion Models via Information Gain

通过信息增益改进掩码扩散模型的采样

Kaisen Yang, Jayden Teoh, Kaicheng Yang, Yitong Zhang, Alex Lamb

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Massachusetts Institute of Technology(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) Beihang University(北航) College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 提出一种无需训练的Info-Gain采样器,利用掩码扩散模型的双向结构平衡即时不确定性与剩余掩码位置的信息增益,在推理、编码、创意写作和图像生成任务中优于现有采样器。

Comments https://github.com/yks23/Information-Gain-Sampler Accepted by ICML2026 Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03260 2026-05-25 cs.CE cs.CL

SciNet: Evaluating AI Agents in Relation-Aware Scientific Literature Retrieval

SciNet: 评估关系感知科学文献检索中的AI代理

Chenyang Shao, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University, Beijing, China(电子工程系、BNRist、清华大学、北京、中国) Zhongguancun Academy(中关村学院)

AI总结 针对现有检索代理难以理解论文间复杂关系网络的问题,提出首个关系感知数据集SciNet,通过三类任务系统评估代理,发现准确率低于20%,但下游综述质量提升25.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22597 2026-05-25 cs.LG physics.chem-ph

Energy-Guided Generative Modeling for Low-Energy Molecular Structure Discovery

能量引导的生成式建模用于低能分子结构发现

Guikun Xu, Xiaohan Yi, Ziqiao Meng, Peilin Zhao, Yatao Bian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 提出EnFlow,一种结合流生成模型与显式能量景观建模的能量引导框架,用于联合生成构象集合和识别基态结构,在极少采样步数下实现高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07813 2026-05-25 cs.AI cs.HC

Agentivism: a learning theory for the age of artificial intelligence

Agentivism:人工智能时代的学习理论

Lixiang Yan, Dragan Gašević

机构 * School of Education, Tsinghua University(清华大学教育学院) Faculty of Education and School of Computing & Data Science, The University of Hong Kong(香港大学教育学院及计算与数据科学学院) Faculty of Information Technology, Monash University(墨尔本大学信息技术学院)

AI总结 针对AI辅助下成功表现不等于学习的问题,提出Agentivism学习理论,通过选择性委托、认知监控、重构内化和迁移学习来解释人机交互中的学习机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22816 2026-05-22 cs.RO cs.CV

AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation

AwareVLN: 基于自感知的视觉语言导航推理

Wenxuan Guo, Xiuwei Xu, Yichen Liu, Xiangyu Li, Hang Yin, Huangxing Chen, Wenzhao Zheng, Jianjiang Feng, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

AI总结 本文提出AwareVLN框架,通过自感知推理机制实现端到端的视觉语言导航,解决了传统方法在理解代理、指令和场景关系上的不足,并在多个数据集上实现了优于现有方法的性能。

Comments Accepted to CVPR 2026. Project page: https://gwxuan.github.io/AwareVLN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22812 2026-05-22 cs.RO cs.CV

GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations

GesVLA: 一种具有手势感知能力的视觉-语言-动作模型嵌入表示

Wenxuan Guo, Ziyuan Li, Meng Zhang, Yichen Liu, Yimeng Dong, Chuxi Xu, Yunfei Wei, Ze Chen, Erjin Zhou, Jianjiang Feng

机构 * Tsinghua University(清华大学) Dexmal

AI总结 本文提出GesVLA模型,通过引入手势作为平行指令模态,解决现有VLA系统在复杂场景中空间模糊问题,采用双VLM架构实现手势表示与动作策略的紧密耦合,并通过手势数据生成管道和两阶段训练策略提升目标定位准确性和人机交互效率。

Comments Project page: https://gwxuan.github.io/GesVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏