arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-08-19 至 2026-08-19 共收录 17
2608.18035 2026-08-19 cs.CV 新提交

Plug-and-Play Traffic Element Awareness for End-to-End Autonomous Driving

用于端到端自动驾驶的即插即用交通元素感知

Zongzheng Zhang, Jijun Wang, Saining Zhang, Shuo Wang, Yiru Wang, Hai Yang, Yang Chen, Yuwen Heng, Hao Sun, Anqing Jiang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Bosch Corporate Research(博世企业研究中心)

AI总结 该研究首次系统探究端到端自动驾驶的交通元素感知,通过补充标注构建统一基础设施,以即插即用方式集成信号,在多范式多数据集上提升性能,在NAVSIM-v2上达到新SOTA。

Comments Accepted by ECCV 2026; Project Page: this https URL (https://zzongzheng0918.github.io/TE-Aware-E2E-AD/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18025 2026-08-19 cs.LG cs.AI cs.SD 新提交

Why GPT-Style Models Do Not Directly Transfer to Symbolic Music: Compression in the Wrong Coordinate System

为何GPT风格模型无法直接迁移到符号音乐:错误坐标系中的压缩

Yi Wang

机构 * Tsinghua University(清华大学)

AI总结 该研究针对GPT风格模型无法直接迁移到符号音乐的问题,提出有效性-无损性框架,通过构建预测有效且关系无损的坐标系优化标记化,实验验证了相关边界,揭示了跨模态迁移的关键在于标记化接口而非架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17731 2026-08-19 cs.AI 新提交

Evaluating the Diversity of AI-Generated Content with Diversity Profiles

用多样性轮廓评估AI生成内容的多样性

Xiuyuan Hu, Xuege Hou, Guoqing Liu, Yang Zhao, Jieran Li, Dongbiao Sun, José Miguel Hernández-Lobato, Hao Zhang, Xue Liu

机构 * Tsinghua University(清华大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Microsoft Research(微软研究院) University of Cambridge(剑桥大学) McGill University(麦吉尔大学)

AI总结 针对现有AI生成内容多样性评估标量指标的矛盾性与局限性,提出曲线值的多样性轮廓框架,为生成式AI评估提供更透明、感知分辨率的多样性比较方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17707 2026-08-19 cs.CV cs.MM 新提交

DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation

DynaForcing:克服流式化身生成中自强制蒸馏的动态崩溃问题

Yubo Huang, Sirui Zhao, Xinchen Yao, Zhengye Zhang, Jinyang Huang, Fengqi Cui, Shiwei Wu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学)

AI总结 针对流式化身生成中自强制蒸馏的动态崩溃问题,提出DynaForcing框架,通过三种策略及优化技术恢复动态、提升视觉质量,解决了质量与动态的权衡问题。

Comments Accepted at ACM International Conference on Multimedia (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17487 2026-08-19 cs.CV 新提交

NeuroPath: Brain-Inspired Dual-Pathway Graph Convolutional Networks for Skeleton-Based Action Recognition

NeuroPath:用于基于骨骼的动作识别的类脑双通路图卷积网络

Kanglei Zhou, Ruizhi Cai, Hubert P. H. Shum, Frederick W. B. Li, Xiaohui Liang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Durham University(杜伦大学) Zhongguancun Laboratory(中关村实验室)

AI总结 NeuroPath受人类感知通路启发,采用双通路图卷积网络架构,通过分组图卷积块和通路间融合模块提升基于骨骼的动作识别性能,在三个公开数据集上取得一致效果提升。

Comments Accepted to Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17432 2026-08-19 cs.RO 新提交

UniReflex: Plug-and-Play Force Control for Pretrained Generative Policies via Fast-Slow Reflex

UniReflex:基于快慢反射的预训练生成策略的即插即用力控制

Yan Huang, Shoujie Li, Ziwu Song, Wenbo Ding

机构 * Tsinghua University(清华大学) Shenzhen International Graduate School(深圳国际研究生院) Nanyang Technological University(南洋理工大学) X Square Robot(X Square机器人公司) Xspark AI(Xspark人工智能公司)

AI总结 UniReflex是一种即插即用框架,通过快速反射网络和解耦的可变阻抗控制,为冻结的生成策略提升接触稳定性与成功率,同时保留位置精度且延迟大幅降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17420 2026-08-19 cs.CV 新提交

SPVC: Structured and Panoptic Video Fixing for Cross-Dataset Driving Scene Rendering

SPVC:面向跨数据集驾驶场景渲染的结构化全景视频修复

Gen Li, Shu Han, Yun Xi Qiao, Hua Chen, Xuyang Dai, Bohan Li, Hao Zhao, Chaojian Li

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Zhejiang University(浙江大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Great Wall Motor Company Limited(长城汽车股份有限公司) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出SPVC框架,通过结构化、全景、视频及跨数据集修复原则,训练两阶段可控视频扩散模型,解决驾驶场景渲染的伪影问题,实现跨数据集的高效修复。

Comments Project page: this https URL (https://li00147.github.io/SPVC-Project-Page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17337 2026-08-19 cs.CV cs.ET 新提交

Learning latent progression states from spatial heterogeneity in uterine histopathology

从子宫组织病理学的空间异质性中学习潜在进展状态

Qiming He, Yan Liu, Shuang Ge, Fan Yang, Yuxiang Wang, Ieng Man Zhang, Jing Yang, Zihao Jia, Ajin Hu, Yexing Zhang, Zixiu Song, Qiang Huang, Xiaoya Zhao, Zihan Wang, Xianjing Zheng, Yijun Zheng, Liling Lin, Shuxing Liu, Bin Bao, Yue Xie, Tian Guan, Yonghong He, Congrong Liu

机构 * Fuzhou University(福州大学) Fuzhou University Affiliated Provincial Hospital(福州大学附属省立医院) Interdisciplinary Institute for Medical Engineering, Fuzhou University(福州大学医学工程交叉研究院) Medical Optical Technology R&D Center, Research Institute of Tsinghua, Pearl River Delta(清华珠三角研究院医学光学技术研发中心) Peking University Health Science Center(北京大学医学部) Third Hospital, School of Basic Medical Sciences, Peking University Health Science Center(北京大学医学部基础医学院第三医院) Institute of Biopharmaceutical and Health Engineering, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院生物医药与健康工程研究院) Tsinghua University(清华大学) Peng Cheng Laboratory(鹏城实验室) Jinfeng Laboratory(金凤实验室)

AI总结 本研究开发子宫特异性计算病理学框架SpaTIE,从子宫组织病理学空间异质性中学习形态感知表征,推断与肿瘤进展相关的空间连贯状态,关联多组学特征并支持临床预测任务,为肿瘤状态发现提供新工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17271 2026-08-19 cs.AI 新提交

ASI-Bench: At the Dawn of Artificial Superintelligence

ASI-Bench:人工智能超级智能的黎明

Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan, Hengyu Wang, Honghe Ren, Xiaohan Jia, Xueyang Zhou, Xiaoyu Cao, Yongchao Chen, Yuanning Feng, Junhao Wu, Cheng Zhang, Sijia Chen, Haoyu Xue, Chengsong You, Huan Wang, Koutian Wu, Peigan Gao, Jiakun Wu, Wenzhe Li, Ergan Shang, Qingyuan Zheng, Jingjing Zhou, Ruixuan Jia, Yan Xu, Hongrui Zhang, Xiao-Han Ma, Zhengxiang Cheng, Yuexing Hao, Liting Mai, Xianglin Ji, Wenjun Zhang, Zhuofan Chen, Yixiao Huang, Chi Wang, Wenyue Hua, Yilun Hao, Yuantao Zhai, Ziyan Zhao, Jingyan Xie

机构 * Tsinghua University(清华大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Boston University(波士顿大学) University of Queensland(昆士兰大学) University of Science and Technology of China(中国科学技术大学) Flatiron Institute(弗拉蒂伦研究所) Microsoft Research(微软研究院) AG2 AI(AG2 AI公司)

AI总结 研究人员推出首个联合评估AI创新探索与自主科学执行能力的基准ASI-Bench,逐步减少人类方法指导测试AI自主科研能力,发现当前AI仍严重依赖人类指导,该基准面向全球开放邀请贡献。

Comments 16 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17162 2026-08-19 cs.LG 新提交

OraclePhys: A Systematic Framework for LLM Fine-Tuning on Structural Mechanics

OraclePhys:面向结构力学的大语言模型微调系统框架

Mingyu Li, Guorui Song, Jing Lin, Haoqian Wang

机构 * University of Houston(休斯顿大学) Tsinghua University(清华大学)

AI总结 本研究提出OraclePhys,一种面向结构力学的大语言模型微调系统框架,含自动评分基准、多形式监督数据集及对照训练研究,发现标签答案形式而非比特数决定微调效果,训练所得8B模型达空间结构响应任务数据精度前沿。

Comments 18 pages, 8 figures, 9 tables. Under review at ACL Rolling Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13538 2026-08-19 cs.CL 版本更新

SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization

SAEVerbalizer:通过表示 verbalization 为稀疏自编码器特征生成解释

Weihan Meng, Hongzhu Guo, Yi Jing, Dewen Liu, Zijun Yao, Xiaozhi Wang, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) Peking University(北京大学) Fudan University(复旦大学)

AI总结 该研究提出 SAEVerbalizer 框架,通过微调 LLM 下游层生成 SAE 特征的自然语言解释,解决了传统解释方法的表面性与低效率问题,其 verbalization 能力可泛化、迁移并扩展到不同 LLM 的 SAE 特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03895 2026-08-19 cs.OS cs.AI cs.CR 版本更新

Agent libOS: A Runtime Substrate for Capability-Controlled Self-Evolving LLM Agents

Agent libOS: 一种受库操作系统启发的运行时,用于长时间运行、能力受控的LLM智能体

Yingqi Zhang

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 提出Agent libOS运行时,将LLM智能体建模为具有进程标识、生命周期、能力控制和审计记录的AgentProcess,通过类似libc的工具包装和运行时原语边界实现安全调度与资源控制。

Comments 20 pages, 3 figures, 7 tables. Project page: this https URL (https://github.com/yingqi-z20/Agent-libOS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29662 2026-08-19 cs.CV cs.RO 版本更新

SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation

SAFE-Pruner: 语义注意力引导的未来感知令牌剪枝用于高效视觉-语言-动作操控

Shilin Ma, Chubin Zhang, Changyuan Wang, Yuji Wang, Yue Wu, Zixuan Wang, Jingqi Tian, Zheng Zhu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

AI总结 针对视觉-语言-动作模型推理加速中现有剪枝方法忽略深层视觉信息的问题,提出SAFE-Pruner框架,通过引入未来层注意力线索和语义注意力一致性实现前瞻性令牌剪枝,在仿真和真实实验中取得最高1.89倍加速且成功率下降小于1.7%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16299 2026-08-19 cs.CV 版本更新

Repurposing 3D Generative Model for Autoregressive Layout Generation

将3D生成模型重新利用于自回归布局生成

Haoran Feng, Yifan Niu, Zehuan Huang, Yang-Tian Sun, Yuxin Peng, Lu Sheng

机构 * School of Software, Beihang University(北航软件学院) Tsinghua University(清华大学) University of Hong Kong(香港大学) Tencent Hunyuan(腾讯文英) Peking University(北京大学)

AI总结 本文提出LaviGen框架,利用3D生成模型直接在3D空间中生成布局,通过自回归过程建模几何关系和物理约束,提升3D场景的物理合理性与效率。

Comments this https URL (https://fenghora.github.io/LaviGen-Page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21693 2026-08-19 cs.LG 版本更新

TiMi: Empower Time Series Transformers with Multimodal Mixture of Experts

TiMi: 通过多模态专家混合增强时间序列变换器

Jiafeng Lin, Yuxuan Wang, Huakun Luo, Jianmin Wang, Zhongyi Pei

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)

AI总结 TiMi通过多模态专家混合机制,利用大语言模型生成未来推断以提升时间序列预测的因果推理能力,实现多模态数据的有效整合与高精度预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18005 2026-08-19 cs.CV 版本更新

UrbanWorld2.0: A Multimodal Agentic Framework for Reality-Aligned 3D World Generation at City-Scale

RAISECity: 一种用于城市级现实对齐3D世界生成的多模态代理框架

Shengyuan Wang, Zhiheng Zheng, Yu Shang, Lixuan He, Yangcheng Yu, Fan Hangyu, Jie Feng, Qingmin Liao, Yong Li

机构 * College of AI, Tsinghua University(人工智能学院,清华大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京研究院,清华大学)

AI总结 RAISECity通过多模态代理框架实现城市级3D世界生成,提升现实对齐、精度和性能,适用于沉浸媒体和具身智能应用。

Comments Accepted by ACM MM 2026, the code is available at: this https URL (https://github.com/tsinghua-fib-lab/UrbanWorld2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01586 2026-08-19 cs.RO cs.AI 版本更新

ManiCM: Real-time 3D Diffusion Policy via Consistency Model for Robotic Manipulation

ManiCM:用于机器人操作的基于一致性模型的实时3D扩散策略

Zifeng Gao, Guanxing Lu, Tianxing Chen, Wenxun Dai, Ziwei Wang, Chao Shang, Wenbo Ding, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

AI总结 该研究提出ManiCM模型,通过一致性约束实现一步推理,在31项机器人操作任务上,推理速度较最优方法提升10倍且保持竞争力。

Comments this https URL (https://manicm-fast.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏