arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-08-18 至 2026-08-18 共收录 28
2608.16628 2026-08-18 cs.AI 新提交

Hypergraph-based Multimodal Retrieval-Augmented Generation with Incremental Refinement

基于超图的多模态检索增强生成与增量优化

Shenao Chen, Yidan Xu, Xiangmin Han, Rundong Xue, Duanpo Wu, Yuhan Gao, Chenggang Yan, Yue Gao

机构 * Hangzhou Dianzi University(杭州电子科技大学) Beijing University of Technology(北京工业大学) Tsinghua University(清华大学)

AI总结 该研究针对现有多模态检索增强生成系统的二元连接局限与优化冗余问题,提出Hyper-M2RAG框架,通过多模态超图建模与锚点驱动的增量优化机制,在多模态基准数据集上实现优于现有方法的性能。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16590 2026-08-18 cs.RO 新提交

Zetta $ζ$: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence

Zetta ζ:用于自进化物理智能的高效闭环具身框架

Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Z-Trans AI

AI总结 Zetta ζ是一种闭环具身框架,通过时间尺度分离的循环进化评判器与恢复技能,结合Z-Infra在LIBERO-Pro、RoboCasa上实现90.8%、93.6%的成功率,为物理智能扩展提供路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16589 2026-08-18 cs.CV 新提交

Ultra: Unsupervised Cross-Task Optimization for Reliable Restoration Segmentation Collaboration under Adverse Weather

Ultra:面向恶劣天气下可靠的修复-分割协作的无监督跨任务优化

Shiqin Wang, Zhiqian Li, Haoyuan Du, Junming Chen, Jiayuan Li, Tianrun Xu, Haoyang Chen

机构 * Wuhan University(武汉大学) Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

AI总结 本研究针对恶劣天气下修复-分割协作的无监督跨任务优化问题,提出Ultra框架,含CTDN与CMIL模块,在UDA-ASS基准上实现最优分割性能,还可泛化至修复与检测协作任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16234 2026-08-18 cs.CV 新提交

GaussianDWM++: Language-Grounded 3D Gaussian Driving World Model for Unified Scene Understanding, Editing, and Multi-Modal Generation

GaussianDWM++:用于统一场景理解、编辑与多模态生成的语言接地3D高斯驾驶世界模型

Tianchen Deng, Xuefeng Chen, Shuang Wu, Qu Chen, Jiajun Zhu, Bo Dai, Jianfei Yang, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Tsinghua University(清华大学) Chongqing Afari Intelligent Drive Co., Ltd.(重庆阿法瑞智能驾驶有限公司) Nanyang Technological University(南洋理工大学)

AI总结 该研究提出GaussianDWM++,通过基础特征高斯分词器等模块构建统一框架,在多类驾驶任务中实现场景理解、编辑与多模态生成,性能达当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16222 2026-08-18 cs.RO cs.AI 新提交

HiPHI: A Large-Scale Benchmark for High-Precision Human Motion and Object-Interaction

HiPHI:面向高精度人体运动与物体交互的大规模基准测试集

Jiahao Ji, Ji Ma, Runhan Zhang, Runyi Yu, Wenjia Wang, Weiheng Chi, Qianqian Peng, Weichao Yan, Yongfei Gu, Ye Tian, Ting Wu, Longwei Li, Chun Yuan, Ruoli Dai, Lei Han

机构 * National University of Singapore(新加坡国立大学) The University of Hong Kong(香港大学) SIGS, Tsinghua University(清华大学深圳国际研究生院) The Hong Kong University of Science and Technology(香港科技大学) Noitom Robotics(诺亦腾机器人公司)

AI总结 该研究针对现有具身数据集的局限,提出基于FrameNet的600+小时高保真人体运动与物体交互基准HiPHI,配套评估套件,为类人策略学习及计算机图形学运动先验模型提供数据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16216 2026-08-18 cs.LG 新提交

Beyond Peak Backlog: Conditional Energy and Temporal Geometry in Capacity-Constrained Delayed Bandit Optimization

超越峰值积压:容量受限延迟多臂老虎机优化中的条件能量与时间几何

Anling Xiang, Yuwen Yang, Yang Shen

机构 * Minzu University of China(中央民族大学) ZeeLin (Beijing) Technology Co., Ltd.(泽林(北京)科技有限公司) Tsinghua University(清华大学)

AI总结 针对仅能跟踪有限反馈项的延迟多臂老虎机优化问题,引入条件能量接口得到更优延迟复杂度界,发现总延迟摘要一致时仍存在时序对极小极大悔度的影响。

Comments 19 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15755 2026-08-18 cs.AI 新提交

Intent-Driven Situation Tracking for User-Centric Multi-Turn Agents

面向以用户为中心的多轮智能体的意图驱动情境跟踪

Meiling Tao, Yiling Tao, Peng Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 该研究针对以用户为中心的多轮智能体,提出无需训练的IDSS框架,通过维护明确情境状态提升任务完成度等性能,为智能体情境跟踪提供有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15698 2026-08-18 cs.CV cs.IR 新提交

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐

Peng Chunyi, Xu Zhipeng, Yan Yukun, Liu Zhenghao, Yu Shi, Mei Sen, Sun Yubo, Zhang Yongheng, Zhou Jie, Gu Yu, Yu Ge, Sun Maosong

机构 * Northeastern University(东北大学) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 针对视觉文档检索中现有监督信号的局限,本文提出ConceptFormer框架,以自适应潜在概念为中间表示衔接语义鸿沟,在基准测试中较最强基线实现了16.7%、22.1%的NDCG@10相对提升,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15654 2026-08-18 cs.CL cs.AI 新提交

When Stories Evolve: Benchmarking LLM Storytelling Across Agent Architectures in Open-Ended World Simulations

当故事演变时:在开放世界模拟中针对智能体架构对大语言模型故事讲述能力进行基准测试

Yuqi Chen, Sixuan Li, Yunfeng Cai, Xueai Li, Ka Man Yan, Ying Li

机构 * The University of Hong Kong(香港大学) Peking University(北京大学) Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications (BIMSA)(北京数学科学与应用研究院)

AI总结 该研究推出WSE-bench基准,评估开放世界模拟中不同智能体架构的大语言模型故事讲述的持续生成、规范一致性和有意义发展,发现三者存在竞争关系,模型规模仅提升持续生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15583 2026-08-18 cs.CV 新提交

PoseAdapter: Dual-Stream 2.5D Controllable Image Generation for Complex Multi-Object Scenes

PoseAdapter:面向复杂多目标场景的双流2.5D可控图像生成

Yufeng Chi, Huimin Ma, Fan Gao, Zhice Niu, Keqin Li, Jianmin Li

机构 * Tsinghua University(清华大学) National University of Defense Technology(国防科技大学)

AI总结 PoseAdapter是一种轻量2.5D可控图像生成框架,通过双流表示解决多目标场景属性泄漏问题,构建OrientLayout数据集,在空间精度等指标上优于现有最优方法。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15490 2026-08-18 cs.RO 新提交

Vision-Based Tactile Intelligence for Robotics: Sensing, Learning, and Embodied Manipulation

机器人基于视觉的触觉智能:感知、学习与具身操作

Peng Zhou, Jun Hu, Sihan Chen, Zeqing Zhang, Haofei Ma, Zhenyu Lu, Sichao Liu, Xueqian Wang, Pai Zheng, Xiang Li, Shan Luo, Jia Pan, David Navarro-Alarcon, Chenguang Yang, Michael Yu Wang

机构 * Great Bay University(大湾区大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学) South China University of Technology(华南理工大学) KTH Royal Institute of Technology(瑞典皇家理工学院) King’s College London(伦敦国王学院)

AI总结 本综述调研机器人领域基于视觉的触觉传感器(VBTSs)全流程,对其硬件分类、学习方法、仿真与数据集等展开分析,指出开放挑战,以推进接触密集型机器人任务的触觉智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15304 2026-08-18 cs.AI 新提交

Understanding Cognition-Induced Risks in Agentic AI Systems

理解智能体AI系统中认知引发的风险

Guanchu Wang, Qinuo Li, Mengnan Du, Xia Hu, Bowen Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

AI总结 该研究针对由LLM驱动的智能体AI系统,基于物理、社会、自我指涉认知的三级框架分析其引发的风险,提出策略以增强系统可控性,保障长期安全发展。

Comments This paper has been accepted by IEEE Intelligent Systems, which can be accessed at this https URL (https://doi.ieeecomputersociety.org/10.1109/MIS.2026.3721766). The DOI is https://doi.org/10.1109/MIS.2026.3721766

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15285 2026-08-18 cs.RO cs.AI 新提交

PhaseLoRA: Control-Regime-Conditioned Low-Rank Adaptation for Continuous-Action Vision-Language-Action Policies

PhaseLoRA:面向连续动作视觉-语言-动作策略的控制条件式低秩适配

Yufei Guo, Yinan Wu, Haoran Duan, Guiguang Ding, Jungong Han

机构 * Tsinghua University(清华大学)

AI总结 PhaseLoRA是面向连续动作VLA策略的轻量级PEFT方法,通过控制条件式LoRA实现阶段依赖适配,在LIBERO数据集上较匹配参数的高秩LoRA基线提升平均成功率12.2个百分点,性能优于其他LoRA变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15242 2026-08-18 cs.AI cs.SE 新提交

LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures

LongRCA Bench:诊断长 horizon 智能体失败中的责任角色与根本原因

Yunfei Zhang, Boyu Feng, Changhua Pei, Zexin Wang, Zhihuang Peng, Xinlong Liu, Hengyue Jiang, Difeng Ma, Jiayi Zhang, Yongzhou Yao, Yanan Zhao, Fei Sun, Yintong Huo, Zhaoyang Liu, Jingjing Li, Gaogang Xie, Dan Pei

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) Chongqing University(重庆大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Singapore Management University(新加坡管理大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Tsinghua University(清华大学)

AI总结 LongRCA Bench 是含1140条失败轨迹的长 horizon 智能体失败诊断基准,本文提出无需训练的 RCTA 方法,在责任角色归因和根本步骤定位上优于现有基线,表明需将二者作为独立评估目标。

Comments 17 pages, 5 figures. Yunfei Zhang and Boyu Feng contributed equally. Changhua Pei is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15060 2026-08-18 cs.CV cs.RO 新提交

EgoTac: In-the-wild Tactile Prediction from Egocentric Vision

EgoTac:从第一视角视觉实现野外环境下的触觉预测

Wenkang Zhang, Chengbo Yuan, Zicheng Zhang, Zhengxue Cheng, Yang Gao

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 本文提出EgoTac模型,利用超570万组图像-触觉对训练,可从第一视角视觉预测触觉,在域内及域外测试中性能优于现有方法,能为机器人学习提供触觉先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15043 2026-08-18 cs.AI 新提交

SCOPE: Score-Isolated Agentic Optimization for Video World Models

SCOPE:用于视频世界模型的分数隔离智能体优化

Yuhua Jiang, Jiaming Wang, Qingbin Liu, Feifei Gao

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Tencent(腾讯)

AI总结 本研究针对视频世界模型推理时改进的评估难题,提出SCOPE框架,通过类型化状态更新与冻结策略实现可审计适应,在Physics-IQ基准上较冻结基线提升+14.24,同时揭示推理时更新的益处需原则性部署机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15036 2026-08-18 cs.LG 新提交

Lipschitz Bandits with Arbitrary Feedback Delays

具有任意反馈延迟的Lipschitz多臂老虎机

Yuhao Liu, Yu Chen, Longbo Huang

机构 * Institute for Interdisciplinary Information Sciences Tsinghua University(清华大学交叉信息研究院)

AI总结 针对任意反馈延迟下的Lipschitz多臂老虎机,分别为随机和对抗奖励设置提出消除算法与EXP3算法,所得后悔界与无延迟时匹配,刻画了反馈延迟的额外影响。

Comments 10 pages of main contents, 26 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14718 2026-08-18 cs.CV cs.CL 新提交

VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

VideoGAIA:面向通用人工智能助手的智能体视频理解基准

Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 VideoGAIA是面向通用AI助手的智能体视频理解基准,构建多轮工具增强交互任务,现有MLLMs在其上准确率不足60%,可评估下一代模型并推动相关转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09311 2026-08-18 cs.CV 版本更新

Degraded Infrared Small Object Detection via Degradation-Adapted Physics-Guided Restoration

面向退化红外小目标检测的退化自适应物理引导恢复方法

Xinkai Lu, Wenjun Chen, Yi Li, Yi Chang, Luxin Yan

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Ocean Engineering, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院海洋工程学院)

AI总结 针对红外小目标检测中退化泛化性差的问题,提出DAISOD框架,结合退化识别、专用分支处理与物理引导恢复,构建对应数据集,实验表明其性能优于现有方法。

Comments Accept by ICIG2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27924 2026-08-18 cs.LG cs.CV cs.RO 版本更新

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

ODEWorld:一种基于物理时间流的连续预测架构

Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang, Sangli Teng, Koushil Sreenath, Xianyuan Zhan

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Berkeley Artificial Intelligence Research (BAIR), University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究院(BAIR))

AI总结 研究针对现有世界建模机器学习范式局限于离散时间预测的问题,提出基于PT-Flow的连续时间潜在世界模型ODEWorld,解决表示崩溃问题,在视频生成和机器人控制任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10745 2026-08-18 cs.CL 版本更新

The First ChineseBabyLM Challenge: training data-efficient and cognitively plausible language models for Chinese

首个中文BabyLM挑战:训练数据高效且认知合理的中文语言模型

Siyuan Song, Zhiheng Qian, Yunhao Zhang, Linyang He, Xiaozhe Ji, Yingxin Lin, Hongao Zhu, Chongtian Shao, Chuhan Lang, Luan Li, Rui Wang, Renfen Hu, Shaonan Wang, Hai Hu

机构 * Princeton University(普林斯顿大学) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) Columbia University(哥伦比亚大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) University of California San Diego(加利福尼亚大学圣地亚哥分校) The Hong Kong Polytechnic University(香港理工大学)

AI总结 首个中文BabyLM挑战将在2026年自然语言处理与中文计算会议举办,要求用1亿中文词元从头训练语言模型,在自然语言理解、认知对齐和汉字知识三轨道评估,不限分词器、模型架构和训练轮数。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12485 2026-08-18 cs.LG cs.AI 版本更新

Speculative Rollback Correction for Quality-Diverse Web Agent Imitation

面向质量多样性的Web智能体模仿的推测性回滚修正

Longkun Hao, Hongyu Lin, Hao Li, Zhuowen Liu, Zhichao Yang, Haojie Hao, Dongshuo Huang, Haitao Yang, Hongyu Ge, Ming jie Xie, Yanjun Wu, Zi Hao Yin, Yan Bai, Yihang Lou

机构 * Beihang University(北京航空航天大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science and Technology(香港科技大学) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学)

AI总结 提出推测性回滚修正(SRC)框架,通过固定视野分支审查和回滚机制,在减少教师查询的同时保持轨迹多样性,在WebArena-Infinity上收集了977条通过验证的轨迹和9183个下一步动作示例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21858 2026-08-18 cs.CL 版本更新

Hypergraph as Language

超图作为语言

Mengqi Lei, Guohuan Xie, Shihui Ying, Shaoyi Du, Jun-Hai Yong, Chuan Shi, Ling Tian, Siqi Li, Yue Gao

机构 * Tsinghua University(清华大学) Yangtze Delta Region Institute(长江三角洲研究院) Shanghai Institute of Applied Mathematics and Mechanics(上海应用数学和力学研究所) State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所)

AI总结 本文提出了一种基于超图的语言模型对齐框架Hyper-Align,通过将超图结构转换为可被大语言模型理解的超图令牌,以更有效地处理高阶关联关系,从而在结构建模任务中取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02637 2026-08-18 cs.CL 版本更新

Train Yourself as an LLM: Exploring Effects of AI Literacy on Persuasion via Role-playing LLM Training

通过角色扮演训练LLM:探索AI素养对说服力的影响

Qihui Fan, Min Ge, Chenyan Jia, Weiyan Shi

机构 * Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(法国国家信息与自动化研究所巴黎-罗康库尔中心) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕默研究实验室)

AI总结 本文通过角色扮演训练LLMimic,提升用户AI素养,减少AI说服力效果,并增强诚实与社会责任感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05513 2026-08-18 cs.RO cs.AI 版本更新

DECO: Decoupled Multimodal Diffusion Transformer for Bimanual Dexterous Manipulation with a Plugin Tactile Adapter

DECO:解耦多模态扩散变压器用于配备插件触觉适配器的双臂灵巧操作

Xukun Li, Yu Sun, Lei Zhang, Bosheng Huang, Yibo Peng, Yuan Meng, Haojun Jiang, Shaoxuan Xie, Guocai Yao, Alois Knoll, Zhenshan Bing, Xinlong Wang, Zhenguo Sun

机构 * Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) School of Computation, Information and Technology, Technical University of Munich, Garching, Germany(慕尼黑技术大学计算与信息学院) Department of Shenyang Institute of Computing Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院沈阳计算技术研究所部门) State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

AI总结 DECO通过解耦多模态输入和触觉适配器,实现了双臂灵巧操作的高效整合与高成功率

Comments 25 pages, 8 figures. Project Page: this https URL (https://baai-humanoid.github.io/DECO-webpage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13185 2026-08-18 cs.CV cs.GR 版本更新

FlexAM: Flexible Appearance-Motion Decomposition for Versatile Video Generation Control

FlexAM: 一种灵活的外观-运动分解方法用于多功能视频生成控制

Mingzhi Sheng, Zekai Gu, Peng Li, Cheng Lin, Hao-Xiang Guo, Ying-Cong Chen, Yuan Liu

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) MUST(澳门大学) Tsinghua University(清华大学)

AI总结 FlexAM通过引入新型3D控制信号,实现外观与运动的解耦,提升视频生成任务的灵活性和生成质量。

Comments Codes: this https URL (https://github.com/IGL-HKUST/FlexAM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18005 2026-08-18 cs.CV 版本更新

UrbanWorld2.0: A Multimodal Agentic Framework for Reality-Aligned 3D World Generation at City-Scale

RAISECity: 一种用于城市级现实对齐3D世界生成的多模态代理框架

Shengyuan Wang, Zhiheng Zheng, Yu Shang, Lixuan He, Yangcheng Yu, Fan Hangyu, Jie Feng, Qingmin Liao, Yong Li

机构 * College of AI, Tsinghua University(人工智能学院,清华大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京研究院,清华大学)

AI总结 RAISECity通过多模态代理框架实现城市级3D世界生成,提升现实对齐、精度和性能,适用于沉浸媒体和具身智能应用。

Comments Accepted by ACM MM 2026, the code is available at: this https URL (https://github.com/tsinghua-fib-lab/UrbanWorld2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23863 2026-08-18 cs.LG cs.AI 版本更新

PhyxMamba: Chaotic System Reconstruction from Short Context Observations with Generative State-Space Models

PhyxMamba:基于生成式状态空间模型的短上下文观测混沌系统重构

Chang Liu, Bohao Zhao, Jingtao Ding, Huandong Wang, Yong Li

机构 * Department of Electronic Engineering, BNRist Tsinghua University(电子工程系,清华大学)

AI总结 该研究提出PhyxMamba框架,结合Mamba状态空间模型与物理知情原理,在短观测数据下实现混沌系统重构,在Lorenz96系统上性能优于基线,鲁棒性强。

详情

展开后加载摘要…

URL PDF HTML 收藏