arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-04-24 至 2026-04-24 共收录 10
2604.21489 2026-04-24 cs.RO cs.AI

MISTY: High-Throughput Motion Planning via Mixer-based Single-step Drifting

MISTY:基于混合器的单步漂移高吞吐量运动规划

Yining Xing, Zehong Ke, Yiqian Tu, Zhiyuan Liu, Wenhao Yu, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与移动系统国家重点实验室)

AI总结 MISTY通过混合器单步漂移方法实现高吞吐量运动规划,利用变分自编码器和轻量级MLP-Mixer解码器,结合隐空间漂移损失,提升轨迹生成效率与鲁棒性。

Comments 8 pages, 4 figures, 3 tables. Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21461 2026-04-24 cs.CV cs.HC

Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision

多模态大语言模型理解指认吗?在自我中心视觉中的基准测试与增强指认推理

Chentao Li, Zirui Gao, Mingze Gao, Yinglian Ren, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Academy of Art & Design, Tsinghua University(清华大学艺术与设计学院)

AI总结 本文提出EgoPoint-Bench基准测试,用于评估和提升自我中心视角下的多模态指认推理能力,通过11k高质量样本展示细调合成数据能显著提升性能和现实迁移能力。

Comments 20 pages, 14 figures. Committed to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21450 2026-04-24 cs.CV cs.AI cs.LG

VARestorer: One-Step VAR Distillation for Real-World Image Super-Resolution

VARestorer: 一种一步式VAR蒸馏用于现实世界图像超分辨率

Yixuan Zhu, Shilin Ma, Haolin Wang, Ao Li, Yanzhe Jing, Yansong Tang, Lei Chen, Jiwen Lu, Jie Zhou

机构 * Tsinghua University(清华大学)

AI总结 本文提出VARestorer,通过蒸馏预训练的文本到图像VAR模型,实现一步式图像超分辨率,解决迭代预测中的误差累积问题,提升效率与质量。

Comments Accepted in ICLR 2026. Code is available at https://github.com/EternalEvan/VARestorer

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21357 2026-04-24 cs.AI cs.CL

ReaGeo: Reasoning-Enhanced End-to-End Geocoding with LLMs

ReaGeo:基于大语言模型的推理增强端到端地名编码

Jian Cui, Zhiyuan Ren, Desheng Weng, Yongqi Zhao, Gong Wenbin, Yu Lei, Zhenning Dong

机构 * Amap, Alibaba Group(阿里巴巴集团阿地图) Tsinghua University(清华大学)

AI总结 ReaGeo利用大语言模型解决传统多阶段方法在地理数据库中依赖文本或向量相似性检索的局限性,通过将坐标转换为geohash序列,引入链式推理机制提升空间关系推理能力,并通过距离偏差奖励的强化学习优化生成精度。

Comments 12 pages, 8 figures, submitted to ACM SIGSPATIAL 2024 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21160 2026-04-24 cs.CV

Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

通过几何奖励信用分配强化点-视觉-语言模型的3D理解

Jingkun Chen, Ruoshi Xu, Mingqi Gao, Shengda Luo, Jungong Han

机构 * Northwestern Polytechnical University(西北工业大学) Southern University of Science and Technology(南方科技大学) The University of Sheffield(谢菲尔德大学) Hengqin Laboratory(横琴实验室) Tsinghua University(清华大学)

AI总结 本文提出几何奖励信用分配框架,通过分离整体监督信号并定向反馈,提升点-视觉-语言模型的3D结构对齐能力,同时引入重投影一致性项约束物理可行性,从而提升3D KPA和重投影一致性评分。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12710 2026-04-24 cs.LG cs.AI cs.CL

LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety

LASA:语言无关的语义对齐在语义瓶颈处用于LLM安全性

Junxiao Yang, Haoran Liu, Jinzhe Tu, Jiale Cheng, Zhexin Zhang, Shiyao Cui, Jiaqi Weng, Jialing Tao, Hui Xue, Hongning Wang, Han Qiu, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学对话人工智能(CoAI)组,DCST,清华大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

AI总结 本文提出LASA方法,通过在语义瓶颈层对齐安全理解,提升LLM在所有语言中的安全性,实验显示攻击成功率显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23408 2026-04-24 cs.RO cs.CV

Demystifying Action Space Design for Robotic Manipulation Policies

解开机器人操作策略中动作空间设计的谜团

Yuchun Feng, Jinliang Zheng, Zhihao Wang, Dongxiu Liu, Jianxiong Li, Jiangmiao Pang, Tai Wang, Xianyuan Zhan

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Shanghai AI Lab(上海人工智能实验室) Peking University(北京大学)

AI总结 本文通过大规模实验研究,揭示动作空间设计对机器人策略学习的显著影响,分析了时间与空间轴上的动作设计对策略可学习性和控制稳定性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05591 2026-04-24 cs.LG cs.CL

Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning

熵比裁剪作为稳定强化学习的软全局约束

Zhenpeng Su, Leiyu Pan, Minxuan Lv, Tiehua Mei, Zijia Lin, Yuntao Li, Wenping Hu, Ruiming Tang, Kun Gai, Guorui Zhou

机构 * Kuaishou Technology(快手科技) Tsinghua University(清华大学) Independent(独立)

AI总结 本文提出熵比裁剪机制,通过量化策略探索的相对变化,缓解强化学习中的分布偏移问题,提升训练稳定性。

Comments This paper has been accepted by ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20697 2026-04-24 cs.SD cs.AI

Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores

音乐乐谱理解基准:评估大型语言模型对完整乐谱的理解能力

Congren Dai, Yue Yang, Krinos Li, Huichi Zhou, Shijie Liang, Bo Zhang, Enyang Liu, Ge Jin, Hongran An, Haosen Zhang, Peiyuan Jing, Kinhei Lee, Z henxuan Zhang, Xiaobing Li, Maosong Sun

机构 * Central Conservatory of Music(中央音乐学院) Imperial College London(帝国理工学院) Tsinghua University(清华大学)

AI总结 本文提出MSU-Bench基准,评估大型语言模型和视觉-语言模型对完整乐谱的理解能力,发现模型在模态间存在显著差距,通过微调可提升多层级正确性,为多模态推理研究提供基础。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18264 2026-04-24 cs.CV

SatSAM2: Motion-Constrained Video Object Tracking in Satellite Imagery using Promptable SAM2 and Kalman Priors

SatSAM2:基于可提示SAM2和卡尔曼先验的卫星图像视频物体跟踪

Ruijie Fan, Junyan Ye, Huan Chen, Zilong Huang, Xiaolei Wang, Weijia Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Geospatial Engineering and Science, Sun Yat-sen University(中山大学测绘工程与科学学院)

AI总结 本文提出SatSAM2,一种基于SAM2的零样本卫星视频跟踪器,通过引入卡尔曼滤波约束运动模块和运动约束状态机,提升跟踪鲁棒性,并在MatrixCity视频物体跟踪基准上验证了其优越性。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏