arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 392
2510.09733 2026-07-29 cs.CL cs.CV 版本更新

VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation

VisRAG2.0:通过视觉检索增强生成中的证据引导多图像推理减轻视觉幻觉

Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun

机构 * School of Software and Microelectronics, Peking University, China(北京大学软件与微电子学院) School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系)

AI总结 研究针对视觉检索增强生成中VLM存在的视觉幻觉及证据识别问题,提出证据引导的多图像推理框架EVisRAG,引入RS-GRPO改进训练,实验表明该方法能提升性能、减少幻觉,有效提高视觉基础和推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20033 2026-07-28 cs.RO 版本更新

Robots Acquire Manipulation Skills in Seconds from a Single Human Video

机器人从单个人类视频中在数秒内获取操作技能

Guangyan Chen, Meiling Wang, Te Cui, Zichen Zhou, Qi Shao, Shalfun Li, Hang Su, Roy Gan, Hao Wang, Mengyin Fu, Yi Yang, Yufeng Yue

机构 * Beijing Institute of Technology(北京理工大学) X SQUARE ROBOT(X方块机器人) Tsinghua University(清华大学)

AI总结 研究提出HOST框架,通过自定位预测,使机器人能从单个人类视频数秒内获取操作技能,保留先前技能,相比零样本基线及任务50次机器人示范微调的基线,在示范次数和获取速度上优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16692 2026-07-28 cs.SE cs.CL 版本更新

Dependency-Guided Code Generation: Structured Matrix Decomposition and Consistency-Guided Refinement

依赖引导的代码生成:结构化矩阵分解与一致性引导的细化

Mingqiao Mo, Yangchen Zeng, Zikai Xiao, Xin Xiao, Wenhua Nie, Zhaolu Kang, Guangyuan Dong, Kai Shu, Hao Zhang, Xiaodong Fan

机构 * University of the Chinese Academy of Sciences(中国科学院大学) ByteDance Inc.(字节跳动公司) Zhejiang University(浙江大学) National Taiwan University(台湾国立大学) Peking University(北京大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Liaoning Technical University(辽宁技术大学)

AI总结 针对现有代码生成方法无法充分捕捉代码实体依赖关系的问题,提出依赖感知代码生成框架,通过结构化矩阵分解和一致性引导细化生成代码,经实验验证该方法能生成语义对齐和结构保真度更高的代码。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09133 2026-07-28 cs.CV cs.AI 版本更新

IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation

IB-Flow:用于少步文本到图像生成的信息瓶颈引导的CFG蒸馏

Yiting Wang, Jingyi Zhang, Wenhu Zhang, Ke Chao, Yves Liang, Kun Cheng, Kang Zhao

机构 * Tsinghua University(清华大学) Wan Team, Alibaba Group(万团队,阿里巴巴集团) HKUST(香港科技大学) Beijing Normal University(北京师范大学)

AI总结 研究针对少步文本到图像生成中推理延迟问题,通过信息论将蒸馏建模为信息瓶颈引导的动态互信息博弈,提出双轨自适应框架,消除过度条件化伪影,在2步配置下实现SOTA生成保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04498 2026-07-28 cs.CV cs.SD 版本更新

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

UniSkip-Mamba:用于视听时间伪造定位的频率感知状态空间模型

Cangjin Yu, Quan Zhang, Dan Jiang, Ke Zhang

机构 * Soochow University(苏州大学) Tsinghua University(清华大学)

AI总结 针对视听时间伪造定位,通过频域分析发现伪造特征集中在低中频,提出融合多模态序列与新颖扫描机制的UniSkip-Mamba框架,实现性能提升和推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28828 2026-07-28 cs.CV 版本更新

Ground4D: Consistency-Aware 4D Reconstruction from Monocular Video

Ground4D: 从单目视频进行一致性感知的四维重建

Qing Zhao, Weijian Deng, Pengxu Wei, Liang Lin

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)

AI总结 提出Ground4D框架,结合3D基础模型进行几何初始化与动态高斯泼溅进行一致性优化,实现从单目视频的高保真4D重建与新视角渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24118 2026-07-28 cs.CV 版本更新

An LMM for Precisely Grounding Elements in Documents

一种用于精确文档元素定位的大型多模态模型

Yijian Lu, Chuangxin Zhao, Kai Sun, Lei Hou, Ji Qi, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 提出PreciseDoc,一种通过合成数据与强化学习联合训练实现文档元素精确定位的大型多模态模型,显著提升文档理解与视觉定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22876 2026-07-28 cs.LG 版本更新

WeCon: An Efficient Weight-Conditioned Neural Solver for Multi-Objective Combinatorial Optimization Problems

WeCon: 一种高效的权重条件神经求解器用于多目标组合优化问题

Xuan Wu, Jinbiao Chen, Yang Li, Lijie Wen, Chunguo Wu, Yuanshu Li, Yubin Xiao, Chunyan Miao, You Zhou, Di Wang

机构 * Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) College of Software, Jilin University(吉林大学软件学院) School of Software, Tsinghua University(清华大学软件学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院 computing and information systems 系)

AI总结 提出一种权重条件神经求解器WeCon,通过编码器中的门控残差融合和解码器中的残差融合模块增强权重-特征交互,并采用高效偏好优化构建高质量解对,在多个多目标组合优化问题上达到与最先进方法相当的HV值并减少40%推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16008 2026-07-28 cs.LG 版本更新

Corner Reflector Array Jamming Discrimination Using Multi-Dimensional Micro-Motion Features with Frequency Agile Radar

利用多维微运动特征的频率敏捷雷达角反射阵干扰鉴别

Jie Yuan, Lei Wang, Yanhao Wang, Yimin Liu

机构 * Department of Electronic Engineering, Tsinghua University Beijing, China(电子工程系,清华大学北京,中国)

AI总结 本文提出一种鲁棒的鉴别方法,通过多维微运动特征区分真实船舶目标与非刚性诱饵,结合手工特征与深度学习特征提升识别性能。

Comments Submition at the 2026 CIE International Conference on Radar

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14896 2026-07-28 cs.CL 版本更新

Language-Coupled Reinforcement Learning for Multilingual Retrieval-Augmented Generation

多语言耦合强化学习用于多语言检索增强生成

Rui Qi, Fengran Mo, Yufeng Chen, Xue Zhang, Shuo Wang, Hongliang Li, Jinan Xu, Jian-Yun Nie, Kaiyu Huang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) University of Montreal(蒙特利尔大学) Tsinghua University(清华大学) University of Notre Dame(Notre Dame 大学)

AI总结 本文提出LcRL框架,通过语言耦合组相对策略优化减少知识偏差和冲突,提升多语言检索增强生成的性能,适用于受限训练数据和多语言大规模集合的场景。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04266 2026-07-28 eess.SP cs.LG 版本更新

Aortic Valve Disease Screening from PPG via Physiology-Guided Self-Supervised Learning

通过生理引导的自监督学习检测PPG中的主动脉瓣疾病

Jiaze Wang, Qinghao Zhao, Zizheng Chen, Zhejun Sun, Deyun Zhang, Yuxi Zhou, Shenda Hong

机构 * Department of Computer Science, Tianjin University of Technology(天津理工大学计算机科学系) National Institute of Health Data Science, Peking University(北京大学国家健康数据科学研究院) Department of Cardiology, Peking University People’s Hospital(北京大学人民医院心内科) HeartVoice Medical Technology(心声医疗科技) DCST, BNRist, RIIT, Institute of Internet Industry, Tsinghua University(清华大学计算机科学与技术系、北京人工智能研究所、互联网产业研究所) Institute of Medical Technology, Peking University Health Science Center(北京大学健康科学中心医学技术研究所) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究所) State Key Laboratory of Vascular Homeostasis and Remodeling, NHC Key Laboratory of Cardiovascular Molecular Biology and Regulatory Peptides, Peking University(北京大学血管稳态与重塑国家重点实验室、国家心血管分子生物学与调节肽重点实验室)

AI总结 本文提出基于生理引导的自监督学习方法,利用大量未标记PPG数据高效筛查主动脉狭窄和反流,实现优于传统监督学习的检测性能。

Comments 33 pages, 8 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01856 2026-07-28 cs.CV 版本更新

GCR: Geometry-Consistent Routing for Task-Agnostic Continual Anomaly Detection

GCR:面向任务无关持续异常检测的几何一致性路由

Joongwon Chae, Lihui Luo, Yang Liu, Runming Wang, Dongmei Yu, Zeming Liang, Xi Yuan, Dayan Zhang, Zhenglin Chen, Peiwu Qin, Ilmoon Chae

机构 * Tsinghua University Shenzhen International Graduate School(清华大学深圳国际研究生院) Ratel Soft Affiliated Fifth Hospital, Wenzhou Medical University(温州医学院附属第五医院) Chinese Medicine Guangdong Laboratory(广东中医药实验室)

AI总结 GCR通过几何一致性路由提升持续异常检测的稳定性,减少遗忘并保持检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01031 2026-07-28 cs.RO cs.AI cs.LG 版本更新

VLASH: Real-Time VLAs via Future-State-Aware Asynchronous Inference

VLASH: 通过未来状态感知的异步推断实现实时VLAs

Jiaming Tang, Yufei Sun, Yilong Zhao, Shang Yang, Yujun Lin, Zhuoyang Zhang, James Hou, Yao Lu, Zhijian Liu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达) Tsinghua University(清华大学) UC Berkeley(加州大学伯克利分校) UCSD(加州大学圣地亚哥分校) Caltech(加州理工学院)

AI总结 VLASH通过未来状态感知的异步推断框架,实现高效、准确的实时VLAs控制,显著提升反应速度和任务执行精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16909 2026-07-28 cs.CV cs.RO 版本更新

SLAM-Former: Putting SLAM into One Transformer

SLAM-Former:将同步定位与地图构建集成于一个Transformer

Yijun Yuan, Zhuoguang Chen, Kenan Li, Weibang Wang, Minghui Qin, Zhijian Fang, Weicheng Zheng, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学智能系统研究所)

AI总结 研究将SLAM功能集成于单个Transformer的方法,核心是SLAM-Former由协同的前后端组成,前端实时处理单目图像用于增量映射和跟踪,后端全局优化,实验证明该方法相比现有密集SLAM方法性能优越。

Comments Published on ECCV 2026, Project Page:https://tsinghua-mars-lab.github.io/SLAM-Former

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14514 2026-07-27 cs.CV cs.AI 版本更新

VTM-Nav: Harnessing Cross-Episode Experience for Object-Goal Navigation with Hierarchical Visual-Topological Memory

VTM-Nav:用于跨情节对象目标导航的分层视觉拓扑记忆

Xiaoran Xu, Yupeng Wu, Tianyu Xue, Yifan Xu, Xuanran Dong, Xiaoshan Yang, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉科学学院) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究跨情节对象目标导航问题,提出无训练的VLM导航框架\method,其带有分层视觉拓扑记忆,通过粗到细匹配检索经验,在三个基准测试中性能最佳,证明跨数据集结构化视觉拓扑经验复用有效且鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10428 2026-07-27 cs.CL 版本更新

Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging

享受你的对话:一个用于多轮对话的以人为本基准,具有解耦的用户模拟、目标建模和评判

Jinglan Gong, Jiefan Lu, Hewei Guo, Kehan Li, Zhiyuan Han, Jihang Jiang, Wenwen Tong, Lewei Lu

机构 * SenseTime Research(商汤科技研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 该研究提出EYT-Bench基准,通过三方解耦设计评估大语言模型多轮对话能力,引入新指标,发现先进模型在主观维度相近但客观意图跟踪差异大,推理可提升客观跟踪,角色格式影响轨迹分布,且热身效应稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29662 2026-07-27 cs.CV cs.RO 版本更新

SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation

SAFE-Pruner: 语义注意力引导的未来感知令牌剪枝用于高效视觉-语言-动作操控

Shilin Ma, Chubin Zhang, Changyuan Wang, Yuji Wang, Yue Wu, Zixuan Wang, Jingqi Tian, Zheng Zhu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

AI总结 针对视觉-语言-动作模型推理加速中现有剪枝方法忽略深层视觉信息的问题,提出SAFE-Pruner框架,通过引入未来层注意力线索和语义注意力一致性实现前瞻性令牌剪枝,在仿真和真实实验中取得最高1.89倍加速且成功率下降小于1.7%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22321 2026-07-27 cs.CR cs.AI cs.SE 版本更新

ASEval: Automated Trajectory-Level Security Testing for Autonomous Agents

对时间、空间和语义规避的自主代理进行基准测试

Jianan Ma, Xiaohu Du, Ruixiao Lin, Yaoxiang Bian, Jialuo Chen, Yunhao Feng, Xiaofang Yang, Shiwen Cui, Changhua Meng, Xinhao Deng, Jingyi Wang, Zhen Wang

机构 * Tsinghua University(清华大学)

AI总结 本文提出了一种针对基于大语言模型(LLM)的代理系统的多维规避框架,通过引入时间、空间和语义三种隐蔽攻击向量,系统地量化了这些威胁,并展示了其在实际威胁场景中的效果,揭示了现有自主代理系统在架构层面的系统性漏洞。

Comments 18 pages, 12 figures, 8 tables. Code and data available at https://github.com/antgroup/Agent3Sigma-Stage

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19541 2026-07-27 cs.SD 版本更新

Optimising Neural Speech Codecs for 300bps Communication using Reinforcement Learning

利用强化学习优化神经语音编解码器用于300bps通信

Junyi Wang, Chi Zhang, Jing Qian, Haifeng Luo, Hao Wang, Zengrui Jin, Chao Zhang

机构 * Tsinghua University(清华大学) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 本文提出ClariCodec,一种在300bps下工作的神经语音编解码器,通过将量化视为随机策略,利用强化学习优化可懂度,从而在极端压缩水平下减少词错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00713 2026-07-27 cs.CV 版本更新

RAD: A Dataset and Benchmark for Real-Life Anomaly Detection with Robotic Observations

RAD:面向机器人观测的真实异常检测数据集与基准

Kaichen Zhou, Xinhai Chang, Taewhan Kim, Jiadong Zhang, Yang Cao, Chufei Peng, Fangneng Zhan, Hao Zhao, Hao Dong, Kai Ming Ting, Ye Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Great Bay University(大湾大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Nanjing University(南京大学) Deakin University(德克萨斯大学)

AI总结 提出RAD数据集,包含13类日常物体和4种缺陷,从60多个机器人视角在非受控光照下采集,用于评估2D特征、3D重建和视觉语言模型在姿态无关的异常检测中的表现,发现2D方法优于3D和VLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05394 2026-07-27 cs.CV 版本更新

Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability

深入探究视频VAE的潜在频谱偏置以实现更优的可扩散性

Shizhan Liu, Xinran Deng, Zhuoyi Yang, Jiayan Teng, Xiaotao Gu, Jie Tang

机构 * Zhipu AI, Beijing, China(智谱AI,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

AI总结 本文通过统计分析发现视频VAE潜在空间的频谱特性对扩散训练至关重要,提出局部相关正则化和潜在掩码重建两种轻量级正则化器,实现3倍收敛加速和10%视频奖励提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12393 2026-07-27 cs.CL cs.AI 版本更新

MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Knowledge Graph

MedKGent:用于构建随时间演变的医学知识图谱的大语言模型智能体框架

Duzhen Zhang, Zixiao Wang, Zhong-Zhi Li, Yahan Yu, Shuncheng Jia, Jiahua Dong, Haotian Xu, Xing Wu, Yingying Zhang, Tielin Zhang, Jie Yang, Xiuying Chen, Le Song

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) Kyoto University(京都大学) Tsinghua University(清华大学) East China Normal University(华东师范大学) Center for Excellence in Brain Science and Intelligence Technology(脑科学与智能技术卓越中心) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里特妇女医院) GenBio AI

AI总结 研究针对医学文献增长带来的知识结构化挑战,引入MedKGent框架,利用PubMed摘要通过两个智能体每日增量构建医学知识图谱,经评估其三元组有效性高,能显著改进大语言模型在医学问答基准上的检索增强生成。

Comments Accepted by Npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20083 2026-07-24 cs.LG cs.AI 版本更新

Co-Evolving LLM Evaluators and Policies via DynamicRubric

通过动态评分标准共同进化大语言模型评估器和策略

Beining Wang, Weihang Su, Hongtao Tian, Hao Kong, Tao Yang, Ting Yao, Qingyi Pan, Yueyue Wu, Qingyao Ai, Min Zhang, Yiqun Liu

机构 * Tsinghua University(清华大学) Tencent(腾讯)

AI总结 研究基于评估器反馈优化大语言模型时因策略改进导致的优化瓶颈问题,提出DynamicRubric框架,通过生成加权评分标准项实现评估器与策略共同进化,实验证明该框架提升了评估器性能及策略效果,并已成功应用于微信搜索。

Comments add online model info (approved)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14047 2026-07-23 cs.RO cs.HC cs.SY eess.SY 版本更新

Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment

PhysClaw-0:一种通过语言修正实现机器人自主的共生智能体系统

Boyuan Wang, Zhenyuan Zhang, Zhiqin Yang, Peijun Gu, Shuya Wang, Xiaofeng Wang, Xianghui Ze, Yifan Chang, Guosheng Zhao, Jiangnan Shao, Guan Huang, Hengyu Liu, Yonggang Zhang, Wei Xue, Chunyuan Guan, Chenglin Pu, Yike Guo, Xingang Wang, Zheng Zhu

机构 * GigaAI(字节跳动人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) Hong Kong University of Science and Technology(香港科技大学) University of Leeds(利兹大学) Cornell University(康奈尔大学) Tsinghua University(清华大学) Nanjing University of Science and Technology(南京理工大学) The Chinese University of Hong Kong(香港中文大学) FAWTD(一汽技术开发部)

AI总结 研究针对自主数据收集问题,提出PhysClaw-0共生智能体系统,通过跨轮保留和重用修正、自主收集验证等方式,在真实机器人测试中减少人力时间,提高成功率,并提升验证者与人类一致性。

Comments WebPage: https://open-gigaai.github.io/Zero2Skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27355 2026-07-23 cs.RO 版本更新

RouterVLA: Budgeted Commissioning and Expert Onboarding for Growing VLA Pools

RouterVLA:将冒烟测试转化为异构VLA选择的监督信号

Xingyu Ren, Chugang Yi, Youran Sun

机构 * The Chinese University of Hong Kong(香港中文大学) University of Maryland, College Park(马里兰大学 College Park 分校) Tsinghua University(清华大学)

AI总结 提出RouterVLA方法,利用预部署评估的冒烟测试记录来监督异构VLA策略的选择,通过结果分离的交叉拟合和透明规则,在LIBERO-Plus数据集上将保留集成功率提升14.64个百分点。

Comments v2: revised title, updated author list, restructured the experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28390 2026-07-23 cs.AI 版本更新

You Live More Than Once: Towards Hierarchical Skill Meta-Evolving

你活不止一次:迈向分层技能元进化

Xujun Li, Kehan Zheng, Mingyuan Zhao, Yize Geng, Jinfeng Zhou, Qi Zhu, Fei Mi, Lifeng Shang, Minlie Huang, Hongning Wang

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Huawei Foundation Model Department(华为基础模型部门)

AI总结 本文提出HiSME,一种轻量级分层技能元进化方法,通过从智能体任务执行轨迹中学习元技能,联合优化技能和技能进化策略,以持续提升部署的智能体系统在不同下游场景中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01051 2026-07-23 cs.LG 版本更新

SwiftRepertoire: Few-Shot Immune-Signature Synthesis via Dynamic Kernel Codes

SwiftRepertoire: 通过动态核码实现少样本免疫特征合成

Rong Fu, Yang Li, Yabin Jin, Jiekai Wu, Chunlei Meng, Youjin Wang

机构 * University of Macau(澳门大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) The First People’s Hospital of Foshan(佛山第一人民医院) Juntendo University(立命馆大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Renmin University of China(中国人民大学) Minzu University of China(民族大学) Tsinghua University(清华大学) Capital Medical University(首都医科大学)

AI总结 本文提出SwiftRepertoire框架,通过动态核码实现少样本免疫特征合成,利用轻量任务描述符和原型字典生成紧凑任务特定参数化,实现快速适应新任务,提升临床和研究场景下的模型实用性与可解释性。

Comments 19 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17967 2026-07-22 cs.CV 版本更新

MoGe-3: Fine-Detail Monocular Geometry Estimation with Self-Guided Sparse Volumetric Refinement

基于自引导稀疏体细化的精细细节单目几何估计

Lingyu Kong, Ruicheng Li, Ruicheng Wang, Sicheng Xu, Chengtang Yao, Jianfeng Xiang, Jiaolong Yang

机构 * Tsinghua University(清华大学) USTC(中国科学技术大学) Microsoft Research(微软研究院)

AI总结 针对单目几何估计在局部3D结构精细细节上的失真问题,提出基于自引导稀疏体细化的方法,将建模从2D提升到3D空间,通过稀疏卷积避免特征混合,实验证明该方法在恢复精细3D几何方面显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12527 2026-07-22 cs.AI 版本更新

Evidence-Grounded AI for Musculoskeletal Care

用于肌肉骨骼护理的基于证据的人工智能

Wenjie Li, Yujie Zhang, Fanrui Zhang, Haoran Sun, Renhao Yang, Junjun He, Weiran Huang, Yuanfeng Ji, Chenrun Wang, Kailing Wang, Hongcheng Gao, Kaipeng Zhang, Hanyu Wang, Angela Lin Wang, Xingqi He, Yilin Huang, Shiyi Yao, Lilong Wang, Yankai Jiang, Yirong Chen, Chenglong Ma, Jiyao Liu, Ming Hu, Gen Li, Yidong Xu, Chengyu Zhuang, Jiawei Liu, Yin Zhang, Lequan Yu, Lu Chen, Yinpeng Dong, Lei Liu, Carlos Gutierrez Sanroman, Yu Qiao, Weijie Ma, Xiaosong Wang, Lei Wang

机构 * Ruijin Hospital, College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院,健康科学技术学院) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学脑启发智能感知与认知教育部重点实验室) School of Basic Medical Sciences, Intelligent Medicine Institute, Fudan University(复旦大学基础医学院智能医学研究院) Department of Radiation Oncology, Stanford University School of Medicine(斯坦福大学医学院放射肿瘤学系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 研究针对肌肉骨骼护理中证据分散问题,提出基于大语言模型的OrthoPilot系统,整合多源数据进行持续管理。该系统在诊断推理等方面超越专家,优于其他智能系统,还提升了管理成功率和病床病例数等,推动临床人工智能实现纵向管理。

Comments All co-authors have now consented to the submission and approved the authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03118 2026-07-22 cs.CV cs.LG 版本更新

Vidu S1: A Real-Time Interactive Video Generation Model

Vidu S1:一个实时交互式视频生成模型

Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zheng, Haoxu Wang, Xiaohang Wang, Qi Jia, Xin Chen, Yimin Chen, Youhe Jiang, Fangcheng Fu, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu

机构 * Tsinghua University(清华大学) Shengshu Technology(生数科技)

AI总结 介绍实时交互式视频生成模型Vidu S1,支持数字角色语音控制,用户可随时通过语音指令控制视频内容,基于TurboDiffusion和TurboServe构建,能实时生成高质量视频,性能优且满足实时推理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏