arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4536
2605.16966 2026-05-19 cs.AI

Harnessing AI for Inverse Partial Differential Equation Problems: Past, Present, and Prospects

利用人工智能解决逆偏微分方程问题:过去、现在与展望

Zhentao Tan, Yuze Hao, Boyi Zou, Mingsheng Long, Yi Yang, Gang Bao

机构 * Collaborative Innovation Center of Artificial Intelligence (CCAI), Zhejiang University(人工智能协同创新中心(CCAI),浙江大学) School of Mathematical Sciences, Zhejiang University(浙江大学数学科学学院) Tsinghua University(清华大学) Center for Interdisciplinary Applied Mathematics, School of Mathematical Sciences, Zhejiang University(浙江大学数学科学学院交叉应用数学中心)

AI总结 本文综述了利用人工智能解决逆偏微分方程问题的最新进展,涵盖了逆问题、逆设计和控制问题三大类,总结了科学和工业领域中的典型应用,并讨论了开放挑战和未来前景。

Comments 35 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16786 2026-05-19 cs.LG

Lever: Speculative LLM Inference on Smartphones

Lever:智能手机上的推测LLM推理

Tuowei Wang, Fengzu Li, Yanfan Sun, Wei Gao, Ju Ren

机构 * Tsinghua University(清华大学) Beihang University(北航) University of Pittsburgh(匹兹堡大学)

AI总结 本文提出Lever系统,通过联合优化推测解码的三个阶段,在智能手机上实现高效的闪存支持的LLM推理,显著降低了推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12070 2026-05-19 cs.LG cs.AI

Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction

异步代理强化学习中缺失旧日志:语义不匹配及用于离线策略修正的修复方法

Zhong Guan, Yongjian Guo, Haoran Sun, Wen Huang, Shuai Di, Likang Wu, Xiong Jun Wu, Hongke Zhao

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Peking University(北京大学) JDT AI Infra(京东AI基础设施)

AI总结 本文研究了异步代理强化学习中因缺失旧日志导致的语义不匹配问题,提出三种精确获取旧日志的策略及近似修正方法,改进了PPO-EWMA方法,提升了训练速度和优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11871 2026-05-19 cs.CV

$h$-control: Training-Free Camera Control via Block-Conditional Gibbs Refinement

$h$-control: 无需训练的相机控制 via 块条件吉布斯细化

Yuzhu Wang, Xi Ye, Duo Su, Yangyang Xu, Jun Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) South China University of Technology(华南理工大学)

AI总结 本文提出$h$-control,通过改进采样器结构,解决免训练视频生成中相机控制的逆向问题,提升轨迹一致性与视觉质量的平衡,实现在多个数据集上的最佳表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07501 2026-05-19 cs.LG cs.CL

ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression

ExpThink:基于经验的强化学习用于自适应思路链压缩

Tingcheng Bian, Yuzhe Zhang, Jing Jin, Jinchang Luo, MingQuan Cheng, Haiwei Wang, Wenyuan Jiang, Miaohui Wang

机构 * Baidu Inc.(百度公司) Shenzhen University(深圳大学) Peking University(北京大学) Tsinghua University(清华大学) D-INFK, ETH Zürich(ETH Zürich 计算机科学与技术研究所)

AI总结 本文提出ExpThink框架,通过经验引导奖励塑造和难度自适应优势机制,实现思路链压缩的准确优先、压缩次之的训练目标,实验表明其在多个数学推理基准上显著提升压缩效率和准确性。

Comments 39 pages, 18 figures. Code and model checkpoints will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12766 2026-05-19 cs.CL

NaviRAG: Towards Active Knowledge Navigation for Retrieval-Augmented Generation

NaviRAG:迈向检索增强生成的主动知识导航

Jihao Dai, Dingjun Wu, Yuxuan Chen, Zheni Zeng, Yukun Yan, Zhenghao Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Nanjing University(南京大学) Northeastern University(东北大学)

AI总结 NaviRAG通过主动知识导航框架提升检索增强生成的复杂任务处理能力,通过分层知识组织和动态信息检索提高检索准确率和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11043 2026-05-19 cs.AI

EmergentBridge: Improving Zero-Shot Cross-Modal Transfer in Unified Multimodal Embedding Models

EmergentBridge: 提升统一多模态嵌入模型中的零样本跨模态迁移

Jincheng Xie, Xingchen Xiao, Runheng Liu, Zhongyi Huang, Yu Zheng, Heyan Huang

机构 * Tsinghua University(清华大学) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) JD iCity, JD Technology, JD Intelligent Cities Research(京东i城、京东科技、京东智能城市研究院)

AI总结 本文提出EmergentBridge框架,通过学习噪声桥梁锚点和子空间对齐,提升未配对模态对的零样本迁移性能,无需 exhaustive pairwise 监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22801 2026-05-19 cs.RO cs.AI cs.LG

Unleashing the Potential of Diffusion Models for End-to-End Autonomous Driving

释放扩散模型在端到端自动驾驶中的潜力

Yinan Zheng, Tianyi Tan, Bin Huang, Enguang Liu, Ruiming Liang, Jianlin Zhang, Jianwei Cui, Guang Chen, Kun Ma, Hangjun Ye, Long Chen, Ya-Qin Zhang, Xianyuan Zhan, Jingjing Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

AI总结 本文通过大规模实车数据和道路测试,系统研究了扩散模型在端到端自动驾驶中的规划能力,提出Hyper Diffusion Planner框架,实现10倍性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22664 2026-05-19 cs.AI

Real-Time Aligned Reward Model beyond Semantics

实时对齐奖励模型超越语义

Zixuan Huang, Xin Xia, Yuxi Ren, Jianbin Zheng, Xuefeng Xiao, Hongyan Xie, Li Huaqiu, Songshi Liang, Zhongxiang Dai, Fuzhen Zhuang, Jianxin Li, Yikun Ban, Deqing Wang

机构 * Beihang University(北京航空航天大学) Tsinghua University(清华大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出R2M框架,通过实时利用策略模型反馈来对齐策略分布偏移,解决RLHF中奖励过拟合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16527 2026-05-19 cs.LG cs.AI cs.CL cs.CV

Beyond Superficial Unlearning: Sharpness-Aware Robust Erasure of Hallucinations in Multimodal LLMs

超越表面遗忘:多模态大语言模型中Hallucinations的锐度感知鲁棒擦除

Xianya Fang, Feiyang Ren, Xiang Chen, Yu Tian, Zhen Bi, Haiyang Yu, Sheng-Jun Huang

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) Institute for AI, Tsinghua University(清华大学人工智能研究院) Huzhou University(湖州大学) Institute of Dataspace, Hefei Comprehensive National Science Center(合肥综合性国家科学中心数据空间研究院) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出SARE方法,通过目标导向的min-max优化和Targeted-SAM机制,解决多模态大语言模型中 hallucinations 的鲁棒擦除问题,提升模型稳定性与擦除效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08013 2026-05-19 cs.LG

Beyond the Next Port: A Multi-Task Transformer for Forecasting Future Voyage Segment Durations

超越下一个港口:一种用于预测未来航行段持续时间的多任务Transformer

Nairui Liu, Fang He, Xindi Tang, Yineng Wang

机构 * Department of Industrial Engineering, Tsinghua University, Beijing 100084, P.R. China(清华大学工业工程系) School of Management Science and Engineering, Central University of Finance and Economics, Beijing 100081, P.R. China(中央财经大学管理科学与工程学院) Department of Logistics and Maritime Studies, The Hong Kong Polytechnic University, Hong Kong, P.R. China(香港理工大学物流与海运研究部)

AI总结 本文提出一种多任务Transformer模型,用于预测未来航行段持续时间,通过整合历史航行时间、目的地港口拥堵代理和静态船舶描述符,提升港口操作的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23180 2026-05-19 cs.CV

GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation

GaussianDWM: 基于3D高斯场景表示的统一场景理解和多模态生成驱动世界模型

Tianchen Deng, Xuefeng Chen, Yi Chen, Qu Chen, Yuyao Xu, Lijin Yang, Le Xu, Yu Zhang, Bo Zhang, Wuxiong Huang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) MEGVII Technology(商汤科技) Mach Drive

AI总结 本文提出基于3D高斯表示的统一驱动世界模型框架,实现3D场景理解和多模态生成,并通过语言引导采样策略和双条件生成模型提升生成效果,实验验证其在nuScenes和NuInteract数据集上的优越性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04006 2026-05-19 cs.LG nlin.CD physics.ao-ph

Learning more physically realistic dynamics in machine-learning based weather forecasting with latent-space constraints

在基于机器学习的天气预报中通过隐空间约束学习更符合物理现实的动力学

Hang Fan, Yi Xiao, Yongquan Qu, Juan Nathaniel, Fenghua Ling, Ben Fei, Lei Bai, Pierre Gentine

机构 * Department of Earth and Environmental Engineering, Columbia University(哥伦比亚大学地球与环境工程系) Learning the Earth with Artificial Intelligence and Physics (LEAP) Center, Columbia University(人工智能与物理联合地球学习中心(LEAP), 哥伦比亚大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出通过隐空间约束改进天气预报模型,以捕捉多变量依赖关系,提升长期预报能力并保持物理真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16438 2026-05-19 cs.IR cs.AI

OPERA: A Reinforcement Learning--Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop Retrieval

OPERA: 一种增强强化学习的协调规划-执行架构用于面向推理的多跳检索

Yu Liu, Yanbing Liu, Fangfang Yuan, Cong Cao, Youbang Sun, Kun Peng, Weizhuo Chen, Jianjun Li, Zhiyuan Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 OPERA通过协调规划-执行架构解决多跳检索中推理规划、检索和过滤的不足,采用MAPGRPO方法提升复杂任务性能。

Comments Accepted by AAAI 2026. Extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03018 2026-05-19 cs.AI cs.RO

Beyond Policy Optimization: A Data Curation Flywheel for Sparse-Reward Long-Horizon Planning

超越策略优化:一种数据整理飞轮用于稀疏奖励长周期规划

Yutong Wang, Pengliang Ji, Kaixin Li, Baolong Bi, Tao Feng, Guillaume Sartoretti

机构 * Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) School of Computing, National University of Singapore(新加坡国立大学计算机科学学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出BPO框架,通过自改进的数据飞轮开发鲁棒推理模型,解决多轮代理规划中稀疏奖励长周期问题,实现高效推理和显著的token效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10102 2026-05-19 cs.IR cs.AI cs.CL

Trustworthiness in Retrieval-Augmented Generation Systems: A Survey

检索增强生成系统中的可信度:综述

Yujia Zhou, Wenbo Zhang, Jingying Shao, Yan Liu, Xiaoxi Li, Jiajie Jin, Hongjin Qian, Zheng Liu, Chaozhuo Li, Jason Chen Zhang, Zhicheng Dou, Philip S. Yu, Jiaxin Mao

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Hong Kong Polytechnic University(香港理工大学) Microsoft Research Asia(微软亚洲研究院) University of Illinois(伊利诺伊大学)

AI总结 本文综述了检索增强生成系统中可信度的关键维度,提出Trust-RAG Compass框架,评估事实性、鲁棒性等六个方面,并建立评估基准,揭示不同LLM在可信度方面的性能差异,指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02428 2026-05-19 cs.LG cs.AI cs.CL cs.SY eess.SY

Language Models as Efficient Reward Function Searchers for Custom-Environment Multi-Objective Reinforcement

语言模型作为定制环境多目标强化学习的高效奖励函数搜索器

Guanwen Xie, Jingzehua Xu, Yiyuan Yang, Yimian Ding, Shuai Zhang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院,清华大学,中国) Department of Computer Science, University of Oxford, United Kingdom(英国牛津大学计算机科学系) Department of Data Science, New Jersey Institute of Technology, USA(美国新泽西理工学院数据科学系)

AI总结 本文提出ERFSL,利用语言模型高效搜索奖励函数,通过生成奖励组件和使用奖励批评者修正代码,实现多目标强化学习任务中零样本学习的高效奖励函数设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16419 2026-05-19 cs.CV cs.AI cs.RO

Agentic Pipeline for Self-Synchronized Multiview Joint Angle Monitoring in Uncalibrated Environments

基于代理的自同步多视角关节角度监控管道:在无标定环境中

Juncheng Yu, Lusi A, Haoxuan Xie, Weiming Wang

机构 * National Engineering Research Center of Neuromodulation, School of Aerospace Engineering, Tsinghua University(神经调制国家工程研究中心,航空航天工程学院,清华大学)

AI总结 本文提出了一种基于代理的自同步多视角关节角度监控方法,利用两台摄像头在无标定环境下实现自动视频同步和自验证,通过多模态大语言模型和先进单目2D姿态估计模型提取候选姿态,并通过代理选择机制自动识别和跟踪目标个体,以在多人和遮挡情况下产生一致的2D姿态,从而估计关节角度。

Comments Accepted by EMBC 2026. 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16416 2026-05-19 cs.CV cs.AI

CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning

CAVE:一种用于碎片化视觉证据推理的结构化信用分配方法

Tengda Guo, Jie Leng, Hanlei Li, Yaoyuan Liang, Qingyue Zhang, Dian Yang, Mingyu Zhang, Yuhua Fu, Shao-Lun Huang

机构 * Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University of Technology(浙江工业大学)

AI总结 CAVE通过结构化过程-奖励机制提升碎片化视觉推理能力,引入三个互补信号优化推理步骤,提升模型可靠性与鲁棒性。

Comments 24 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16355 2026-05-19 cs.GR cs.CV

Generative 3D Gaussians with Learned Density Control

具有学习密度控制的生成3D高斯

Runjie Yan, Yan-Pei Cao, Peng Wang, Ding Liang, Yuan-Chen Guo

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

AI总结 本文提出Density-Sampled Gaussians (DeG),通过学习概率密度函数实现3D表示的自适应密度控制,结合渲染监督优化空间密度和高斯属性,提升单图到3D生成的质量。

Comments 19 pages, 16 figures, SIGGRAPH Conference Papers '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16297 2026-05-19 cs.CY cs.AI cs.HC cs.SE

Task-Level AI Readiness Assessment for Business Process Management:The T-IPO Model and LARA Matrix in Financial-Services IT Operations

面向业务流程管理的任务级AI准备性评估:T-IPO模型与LARA矩阵在金融服务IT运营中的应用

Mingjun Li, Xiaojun Ye

机构 * Tsinghua University(清华大学)

AI总结 本文提出T-IPO模型和LARA矩阵,用于评估任务级AI代理的适用性,通过认知执行复杂度和治理合规强度的两因素结构提升预测效用。

Comments 19 pages, 7 figures, 8 tables, 50 references. A shortened workshop version has been submitted to the BPM 2026 Workshop. This preprint is the complete version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28005 2026-05-19 cs.LG stat.ML

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning

核化优势估计:从非参数统计到大语言模型推理

Shijin Gong, Kai Ye, Jin Zhu, Xinyu Zhang, Hongyi Zhou, Chengchun Shi

机构 * School of Management, University of Science and Technology of China(中国科学技术大学管理学院) Department of Statistics, London School of Economics and Political Science(伦敦政治经济学院统计系) School of Mathematics, University of Birmingham(伯明翰大学数学学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Department of Mathematics, Tsinghua University(清华大学数学系)

AI总结 本文提出利用非参数统计方法提升大语言模型推理中的优势估计,通过核平滑技术实现高效的价值函数估计与策略优化,提升政策学习质量。

Comments 45 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15964 2026-05-18 cs.RO cs.CV

WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation

WorldVLN: 用于空域视觉-语言导航的自回归世界动作模型

Baining Zhao, Jiacheng Xu, Weicheng Feng, Xin Zhang, Zhaolu Wang, Haoyang Wang, Shilong Ji, Ziyou Wang, Jianjie Fang, Zhiheng Zheng, Weichen Zhang, Yu Shang, Wei Wu, Chen Gao, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) Shandong University(山东大学) Manifold AI Beijing Institute of Technology(北京理工大学) Northeastern University(东北大学)

AI总结 WorldVLN提出一种自回归世界动作模型,通过预测潜在世界演变并生成可执行的航点动作,提升空域视觉-语言导航性能,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15937 2026-05-18 cs.LG

A Retrieval-Enhanced Transformer for Multi-Step Port-of-Call Sequence Prediction in Global Liner Shipping

一种增强检索的变压器用于全球集装箱航运多步骤港口序列预测

Yanzhao Su, Fang He, Yineng Wang

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) Department of Logistics and Maritime Studies, The Hong Kong Polytechnic University(香港理工大学物流与海运研究系)

AI总结 本文提出CCRE框架,通过检索增强的历史编码器和Transformer轨迹编码器,提升多步骤港口序列预测的准确性和稳定性,实验结果显示其在第一目的地和三步预测上的准确率显著高于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15855 2026-05-18 cs.CV

Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?

少即是多:我们是否需要为扩散模型的强化学习微调进行每一步优化?

Renye Yan, Jikang Cheng, Shikun Sun, Yi Sun, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Junliang Xing, Yimao Cai

机构 * Peking University(北京大学) Tsinghua University(清华大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

AI总结 本文研究了扩散模型强化学习微调中优化步骤的影响,提出AdaScope方法通过动态控制训练时机提升生成质量并降低计算成本。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15803 2026-05-18 cs.CV cs.LG

Embedding-perturbed Exploration Preference Optimization for Flow Models

嵌入扰动探索偏好优化用于流模型

Sujie Hu, Chubin Chen, Jiashu Zhu, Jiahong Wu, Xiangxiang Chu, Xiu Li

机构 * Tsinghua University(清华大学) AMAP, Alibaba Group(阿里集团AMAP)

AI总结 本文提出E²PO框架,通过嵌入层面扰动维持优化稳定性,提升生成模型对人类偏好的对齐效果。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15793 2026-05-18 cs.LG

AOT-POT: Adaptive Operator Transformation for Large-Scale PDE Pre-training

AOT-POT:面向大规模PDE预训练的自适应算子变换

Qitan Lv, Hong Wang, Zhongkai Hao, Wen Wu, Xuenan Xu, Bowen Zhou, Feng Wu, Chao Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Department of Electronic Engineering, Tsinghua University, China(清华大学电子工程系)

AI总结 本文提出AOT-POT方法,通过自适应算子变换将复杂多样的PDE解算子转化为统一形式,提升预训练效果,实验表明其在12个PDE基准上表现优异,参数仅增加3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15120 2026-05-18 cs.RO cs.AI cs.CV

CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning

CLOVER:端到端自动驾驶规划的闭环价值估计与排序

Sining Ang, Yuguang Yang, Canyu Chen, Yan Wang

机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) School of Electronic Information Engineering, Beihang University(北航电子信息技术学院) National College for Excellent Engineers, Beihang University(北航卓越工程师学院)

AI总结 CLOVER通过闭环价值估计与排序框架,解决端到端自动驾驶规划中训练与评估不匹配的问题,通过生成器和评分器的轻量级架构提升规划器性能,实现更准确的候选轨迹排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14344 2026-05-18 cs.AI

CrystalReasoner: Reasoning and RL for Property-Conditioned Crystal Structure Generation

CrystalReasoner: 基于推理和强化学习的性质条件晶体结构生成

Yuyang Wu, Stefano Falletta, Delia McGrath, Sherry Yang

机构 * Tsinghua University(清华大学) Radical AI New York University(纽约大学)

AI总结 CrystalReasoner通过引入物理先验和强化学习,实现从自然语言指令生成稳定且具有特定性质的晶体结构,提升了生成精度和科学合理性。

Comments Our work is available at https://crystalreasoner.github.io/, with code at https://github.com/wyy603/CrystalReasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28111 2026-05-18 cs.RO

GSDrive: Reinforcing Driving Policies by Multi-mode Future Trajectory Probing with 3D Gaussian Splatting Environment

GSDrive: 通过多模式未来轨迹探查与3D高斯点散布环境强化驾驶策略

Ziang Guo, Chen Min, Xuefeng Zhang, Yixiao Zhou, Shuo Wang, Sifa Zheng, Dzmitry Tsetserukou, Zufeng Zhang

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(斯克尔科维科学与技术研究院智能空间机器人实验室) Research Center for Intelligent Computing Systems, SKLP, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所智能计算系统研究中心,SKLP) Department of Electrical and Electronic Engineering, The University of Hong Kong, China(香港大学电子与电气工程系) SuZhou Automotive Research Institute, Tsinghua University(清华大学苏州汽车研究院) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院)

AI总结 GSDrive通过多模式轨迹探查和3D高斯点散布环境,结合模仿学习与强化学习,提升端到端自动驾驶的训练效果与鲁棒性。

Comments 2nd version

详情

展开后加载摘要…

URL PDF HTML 收藏