arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 614
2606.26741 2026-06-26 cs.RO cs.CV 新提交

PressMimic: Pressure-Guided Motion Capture and Control for Humanoid Robot Imitation

PressMimic: 压力引导的动作捕捉与控制用于人形机器人模仿

Yi Lu, Shenghao Ren, Tianyu Xiong, Zhaoxiang Li, Jiaqi Li, He Zhang, Tao Yu, Qiu Shen, Xun Cao

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) Key Laboratory of Optoelectronic Devices and Systems with Extreme Performances of MOE, Nanjing University(南京大学极端性能光电技术与系统教育部重点实验室) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

AI总结 提出PressMimic框架,通过压力模态融合RGB估计3D姿态和全局运动,并利用压力监督策略实现物理一致的接触模式,提升人形机器人模仿的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26694 2026-06-26 cs.CV 新提交

PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models

PhysEditWorld: 一个面向物理可编辑世界模型的大规模数据集

Bin Hu, Yanwen Ma, Jiehui Huang, Ziliang Zhang, Haoning Wu, Ruicheng Zhang, Yaokun Li, Zijun Wang, Yuechen Zhang, Chun-Mei Tseng, Hanhui Li, Shengju Qian, Jun Zhou, Kaipeng Zhang, Xiaodan Liang, Jiaya Jia, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Beihang University(北京航空航天大学) The Hong Kong University of Science and Technology(香港科技大学) Independent Researcher(独立研究者) Shanghai Jiao Tong University(上海交通大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Tencent(腾讯)

AI总结 提出PhysEditWorld数据集,通过UE5重放渲染管线生成多重力配置下的动作条件视频,支持可控物理编辑,用于改进世界模型的动力学建模和一致性。

Comments Project page: https://yizhiqianbi.github.io/physeditworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25006 2026-06-26 cs.LG 新提交

Scalable Peptide Design via Memory-Efficient Equivariant Transformer

通过内存高效等变变压器实现可扩展的肽设计

Rui Jiao, Xiangzhe Kong, Yinjun Jia, Yijia Zhang, Ziyi Yang, Yang Liu, Jianzhu Ma

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Department of Chemistry, Tsinghua University(清华大学化学系)

AI总结 提出内存高效等变变压器(MEET),通过线性内存缩放和几何特征改进,实现全原子肽的序列与结构协同设计,在生成质量、结合亲和力和多样性上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18195 2026-06-26 cs.CL 新提交

Learning from the Self-future: On-policy Self-distillation for dLLMs

从自我未来学习:面向扩散LLM的在线自蒸馏

Yifu Luo, Zeyu Chen, Haoyu Wang, Xinhao Hu, Yuxuan Zhang, Zhizhou Sha, Shiwei Liu

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑工业大学) Nanyang Technological University(南洋理工大学) University of British Columbia(不列颠哥伦比亚大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) ELLIS Institute Tubingen(ELLIS蒂宾根研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tubingen AI Center(蒂宾根人工智能中心)

AI总结 提出首个面向扩散大语言模型的在线自蒸馏框架d-OPSD,通过自我生成答案作为后缀条件实现从自我未来经验学习,并将监督从词元级转向步骤级,在推理基准上以约10%的优化步骤超越RLVR和SFT基线。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25740 2026-06-25 cs.CV cs.AI 新提交

Point Cloud Diffusion with Global and Local Reconstruction for Instance-Level 3D Anomaly Detection

基于全局与局部重建的点云扩散用于实例级3D异常检测

Linchun Wu, Qin Zou, Jiwen Lu, Qingquan Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Automation, Tsinghua University(清华大学自动化系) Guangdong Artificial Intelligence and Digital Economy Laboratory (SZ)(广东人工智能与数字经济实验室(深圳))

AI总结 提出PCDiff框架,通过实例级多模态条件生成弱缺陷异常,并采用联合局部-全局重建算法恢复前景缺陷同时保持背景正常结构,在3D异常检测中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25619 2026-06-25 cs.CV 新提交

ScaleHP: Estimating Hand Pose in Metric Space

ScaleHP: 在度量空间中估计手部姿态

Ruitao Jing, Xingyu Chen, Hongyang Li, Qing Jiang, Yukai Shi, Lei Zhang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Visincept International Digital Economy Academy (IDEA Research)(国际数字经济学院(IDEA研究院)) South China University of Technology(华南理工大学)

AI总结 提出ScaleHP,一种端到端的一阶段手部姿态估计框架,利用手部骨骼内在比例关系作为度量先验,通过尺度token和透视约束最小二乘法在相机坐标系中恢复绝对度量尺度,在多个基准上达到最先进性能。

Comments 27 pages, 8 figures, 6 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25592 2026-06-25 cs.CV 新提交

VPA-Guard: Defending and Benchmarking Image-to-Video Generation Against Visual Prompt Attacks

VPA-Guard:防御与基准测试图像到视频生成中的视觉提示攻击

Yining Sun, Haoyu Kang, Jiajun Wu, Heng Zhang, Danyang Zhang, Zhenjun Zhao, Haochen Han, Fangming Liu, Wai Kin Victor Chan, Alex Jinpeng Wang

机构 * Tsinghua University(清华大学) Central South University(中南大学) South China Normal University(华南师范大学) ByteDance Inc.(字节跳动公司) Pengcheng Laboratory(鹏城实验室)

AI总结 提出首个针对图像到视频生成中视觉提示攻击的系统基准VVA-Bench,并设计检索增强自进化防御框架VPA-Guard,平均降低攻击成功率44.2%和危害评分73.4%。

Comments Dataset Page: https://huggingface.co/datasets/CSU-JPG/VVA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25529 2026-06-25 cs.SD cs.AI 新提交

STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity

STEB:用于评估超越翻译保真度的语音到语音翻译表现力基准

Sitong Cheng, Weizhen Bian, Songjun Cao, Jin Li, Bei Liu, Chunyang Jiang, Yike Zhang, Weihao Wu, Yiming Li, Chi-Min Chan, Long Ma, Wei Xue

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Youtu Lab(腾讯优图实验室) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 提出STEB基准,通过描述-总结框架评估语音到语音翻译在情感、场景风格和非语言发声方面的表现力,发现现有系统在语义保真度上表现良好但表现力保留不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25509 2026-06-25 cs.RO cs.CV 新提交

ASSCG: Just-Right Gating over Chattering for Fast-Slow LLM Planning in Autonomous Driving

ASSCG:自动驾驶中快慢LLM规划的恰到好处门控

Sining Ang, Yuan Chen, Liu Haiyan, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Lenovo Group Limited(联想集团)

AI总结 提出自适应慢系统控制门(ASSCG),通过帧级查询/缓存/丢弃决策优化快慢规划器调用,结合RWKV骨干网络和GRPO风格强化学习,在nuPlan和NAVSIM上分别提升性能并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25473 2026-06-25 cs.CV cs.LG 新提交

Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models

Causal-rCM:一种用于流式视频生成和交互式世界模型中自回归扩散蒸馏的统一教师强制与自我强制开放配方

Kaiwen Zheng, Guande He, Min Zhao, Jintao Zhang, Huayu Chen, Jianfei Chen, Chen-Hsuan Lin, Ming-Yu Liu, Jun Zhu, Qianli Ma

机构 * Tsinghua University(清华大学) UT Austin(德克萨斯大学奥斯汀分校) NVIDIA(英伟达)

AI总结 提出Causal-rCM框架,将扩散蒸馏扩展到自回归视频扩散,通过教师强制(前向散度)与自我强制(反向散度)互补,实现流式视频生成和交互式世界模型,在帧级和块级设置中达到最先进性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25360 2026-06-25 cs.RO 新提交

Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning

解耦语义与几何基础:面向语言条件模仿学习的空间视觉提示

Yanzhe Tang, Xinyu Shao, Yuxuan Hu, Siyu Chen, Bowen Yang, Yajun Gao, Tongtong Cao, Xiu Li, Long Zeng

机构 * Tsinghua University(清华大学) Huawei Technologies Co., Ltd.(华为技术有限公司) National University of Singapore(新加坡国立大学)

AI总结 提出SVP-IL解耦架构,通过视觉语言基础模型将指令解析为零样本几何掩码,生成空间视觉提示并注入连续动作生成器,在低数据条件下显著提升语言条件模仿学习的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25277 2026-06-25 cs.RO cs.CV 新提交

An Integrated Hardware-Software Design for Low-Data Spatial Defect Detection in Robotic Visual Inspection with Hybrid Optoelectronic Neural Networks

面向机器人视觉检测中低数据空间缺陷检测的软硬件集成设计:混合光电神经网络

Chaoqing Tang, Jiaxuan Li, Huanze Zhuang, Guiyun Tian, Chao Wang, Yihao Ouyang, Wenzhong Liu

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) China Belt and Road Joint Lab on Measurement and Control(中国一带一路测量与控制联合实验室) School of Electric and Electrical Engineering, Chongqing University of Technology(重庆理工大学电气与电子工程学院) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)

AI总结 提出一种软硬件集成的光电架构,通过非成像低数据范式和传感器在环策略,结合压缩感知与CLIP引导注意力,实现缺陷检测数据量减少90%、计算量降低60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24982 2026-06-25 cs.LG stat.ML 新提交

Latent Block-Diffusion Temporal Point Processes: A Semi-Autoregressive Framework for Asynchronous Event Sequence Generation

潜在块扩散时间点过程:一种用于异步事件序列生成的半自回归框架

Shuai Zhang, Yancheng Chen, Chuan Zhou, Yang Liu, Xixun Lin, Xiangyu Zhao, Jun Zhu, Zhi-Ming Ma

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 提出潜在块扩散时间点过程(LBDTPP),通过潜在空间中的块级自回归和块内高斯扩散,实现可变长度、高质量的事件序列生成,理论证明可减少误差累积,实验优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24775 2026-06-24 cs.CL cs.DB cs.IR 新提交

Are We Ready For An Agent-Native Memory System?

我们准备好构建原生智能体记忆系统了吗?

Wei Zhou, Xuanhe Zhou, Shaokun Han, Hongming Xu, Guoliang Li, Zhiyu Li, Feiyu Xiong, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) MemTensor (Shanghai) Technology Co., Ltd(MemTensor(上海)科技有限公司)

AI总结 从数据管理视角系统研究智能体记忆,提出四模块分析框架,评估12种记忆系统,发现无单一架构占优,并揭示成本-性能权衡。

Comments Paper list available at: https://github.com/OpenDataBox/awesome-agent-memory. Source code available at: https://github.com/OpenDataBox/MemoryData

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24742 2026-06-24 cs.RO 新提交

World Value Models for Robotic Manipulation

机器人操作的世界价值模型

Zhihao Wang, Jianxiong Li, Yu Cui, Yuan Gao, Xianyuan Zhan, Junzhi Yu, Xiao Ma

机构 * Peking University(北京大学) Tsinghua University(清华大学)

AI总结 提出世界价值模型(WVM),融合世界模型与价值估计,通过时序建模评估数据质量,在标准基准和次优轨迹基准上达到SOTA,提升策略学习性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24631 2026-06-24 cs.RO 新提交

Optimization-based Safe Trajectory Planning for Autonomous Ground Vehicle in Multi-Floor Scenarios

基于优化的多楼层场景自动驾驶地面车辆安全轨迹规划

Zishang Xiang, Runda Zhang, Runqi Chai, Kaiyuan Chen, Senchun Chai, Yuanqing Xia

机构 * Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学)

AI总结 提出一种针对多楼层场景的轨迹规划框架,包括基于广义Voronoi图和多目标算法的任务规划模块,以及采用优化方法和热启动分层规划生成高质量轨迹的轨迹规划模块,并通过仿真验证可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24598 2026-06-24 cs.SE cs.AI cs.LG 新提交

Toward Self-Evolution-Ready Workflow Harnesses: A Reversible Migration Path and Convertibility Taxonomy for Expert LLM Pipelines

面向自进化就绪工作流工具:专家大语言模型管道的可逆迁移路径与可转换性分类法

Yimo Lin, Zhen Zhang, Yibin Li

机构 * Yunyong Century (Beijing) Artificial Intelligence Technology Co., Ltd.(云涌世纪(北京)人工智能科技有限公司) Tsinghua University(清华大学)

AI总结 针对专家验证的“LLM+脚本”工作流静态、无法自适应的问题,提出一种基于绞杀者模式的可逆迁移路径,将遗留工作流重构为可组合、类型化、可审计的阶段,并引入三级可转换性分类法(A/B/C)作为路由阶段诊断工作流就绪状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24596 2026-06-24 cs.CL 新提交

To Compare, or Not to Compare: On Methodological Practices in Evaluating Social Bias

比较还是不比较:论评估社会偏见的方法论实践

Federico Marcuzzi, Xuefei Ning, Roy Schwartz, Iryna Gurevych

机构 * Tsinghua University(清华大学) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普适知识处理实验室(UKP Lab),计算机科学系,达姆施塔特工业大学及国家应用网络安全研究中心ATHENE)

AI总结 提出统一框架标准化异构基准,揭示孤立评估与强制比较设置间的系统性范式差距,发现比较设置会催化潜在歧视,且链式思维推理加剧偏见,规模越大偏见越强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24539 2026-06-24 cs.CV 新提交

PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought

PointVG-R: 通过视觉思维链在多模态大语言模型中内化几何推理以实现精确指向定位

Ling Li, Bowen Liu, Zinuo Zhan, Jianhui Zhong, Ziyu Zhu, Bingcai Wei, Kenglun Chang, Zhidong Deng

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Northwestern Polytechnical University(西北工业大学) Wuhan University(武汉大学)

AI总结 提出PointVG-R,通过强化学习和冷启动数据内化几何推理,结合视觉思维链数据集EgoPoint-CoT,在指向性视觉定位任务中实现mIoU提升15.86个点的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24510 2026-06-24 cs.AI cs.CL 新提交

A specialized reasoning large language model for accelerating rare disease diagnosis: a randomized AI physician assistance trial

一种用于加速罕见病诊断的专用推理大语言模型:随机AI辅助医生试验

Haichao Chen, Songchi Zhou, Zhengyun Zhao, Shikai Hu, Xianghong Jin, Hongwei Ji, Li He, Shuli Li, Yiming Qin, Xin Tan, Runfeng Shi, Yih Chung Tham, Jiaye Zhu, Ye Li, Ye Jin, Longhao Cao, Dawei Li, Honghan Wu, Hongqiu Gu, Guanqiao Li, Tudor Groza, Chunying Li, Dian Zeng, Weihong Yu, Gareth Baynam, Saumya Shekhar Jamuar, Min Shen, Shuyang Zhang, Bin Sheng, Sheng Yu, Tien Yin Wong

机构 * Tsinghua Medicine, Tsinghua University(清华大学医学部,清华大学) Department of Ophthalmology, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院眼科,中国医学科学院 & 北京大学医学部) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) Department of Rheumatology and Clinical Immunology, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院风湿免疫科,中国医学科学院 & 北京大学医学部) Department of Rare Diseases, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院罕见病科,中国医学科学院 & 北京大学医学部) Department of Dermatology, Xijing Hospital, Air Force Medical University(西安空军军医大学西京医院皮肤科) School of Computer Science and Technology, East China Normal University (ECNU)(东华大学计算机科学与技术学院) Department of Neurosurgery, Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院神经外科) Department of Ophthalmology, National University of Singapore(新加坡国立大学眼科) Singapore Eye Research Institute, Singapore National Eye Centre(新加坡眼科学研究所,新加坡国家眼科中心) Ophthalmology and Visual Science Academic Clinical Program, Duke-NUS Medical School(杜克-国立新加坡大学医学学校眼科与视觉科学学术临床项目) Department of Pediatrics, The First Hospital of Tsinghua University(清华大学第一医院儿科) College of Future Technology, Peking University(北京大学未来技术学院) School of Health and Wellbeing, University of Glasgow(格拉斯哥大学健康与福祉学院)

AI总结 提出开源推理大模型RaDaR(32B参数),通过增强推理训练和合成数据,在罕见病诊断中超越DeepSeek-R1等模型,随机试验显示其辅助使医生诊断准确率提升21.44个百分点。

Comments 36 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24498 2026-06-24 cs.CV 新提交

VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection

VistaRef: 提升指向目标检测的视觉空间方位感知能力

Ling Li, Zhizhen Cai, Xinkun Wu, Ziyu Zhu, Jiaqing Lyu, Bowen Liu, Zhidong Deng

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Dalian University of Technology(大连理工大学)

AI总结 提出VistaRef框架,通过局部手部实体建模和几何射线建模模块增强空间方位感知,并引入方向一致性对齐损失,在指向目标检测任务中实现14个绝对点的精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24479 2026-06-24 cs.CV 新提交

MambaRaw: Selective State Space Modeling for Efficient 4K Raw Image Reconstruction

MambaRaw: 基于选择性状态空间建模的高效4K原始图像重建

Peize Li, Fanhu Zeng, Tongda Xu, Xingguo Xu, Xinjie Zhang, Xingtong Ge, Haotian Zhang, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Dalian University of Technology(大连理工大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 提出MambaRaw框架,利用状态空间模型高效估计熵参数,通过TileMambaBlock和能量感知精化模块实现4K原始图像的高效重建,在三个相机数据集上达到最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24447 2026-06-24 cs.CV 新提交

P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling

P-MTP: 通过渐进深度缩放的多令牌预测实现高效文档解析

Le Xiang, Chenxi Zhai, Shu Wei, Jingjing Wu, Qunyi Xie, Xiao Tan, Kunbin Chen, Wei He

机构 * Department of Computer Vision Technology (VIS) Baidu Inc China(百度计算机视觉技术部(VIS)) Tsinghua University Shenzhen International Graduate School China(清华大学深圳国际研究生院)

AI总结 提出P-MTP框架,通过渐进式多令牌预测和轻量级MTP模块,结合渐进课程损失和置信门控动态草稿,实现文档解析高达5倍加速且精度损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24428 2026-06-24 cs.CL 新提交

Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning

逃离自我确认陷阱:一种用于智能体经验学习的执行-蒸馏-验证范式

Shiding Zhu, Yudi Qi, Yajie Wang, Jiaze Li, Chao Song, Yaorui Shi, Yibo Miao, Hanqi Gao, Kai Zhang

机构 * Zhejiang University(浙江大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Northwestern Polytechnical University(西北工业大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学)

AI总结 提出EDV框架,通过多智能体并行执行、第三方蒸馏和共识验证,解决单智能体经验学习中的自我确认陷阱问题,在三个长时任务基准上取得一致提升。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24422 2026-06-24 cs.CV 新提交

EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding

EgoSAT: 一个全面的自我中心流式交互理解基准

Yijia Lei, Jinzhao Li, Yichi Zhang, Jiacheng Hua, Yin Li, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 提出EgoSAT基准,统一自我中心视频的回顾、在线和前瞻推理任务,评估视觉语言模型在流式设置中的表现,发现现有模型存在前瞻/回顾困难及置信度校准问题。

Comments Accepted to ECCV 2026. Project page: https://leiyj23.github.io/EgoSAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24361 2026-06-24 cs.CV 新提交

SignNet-1M: Large-Scale Multilingual Sign Language Video Dataset with Downstream Benchmarks

SignNet-1M:大规模多语言手语视频数据集及下游基准

Zhewen He, Junyi Hu, Haomian Huang, Zhenhua Li, Yu-Shen Liu, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ChatSign Technology(ChatSign 技术公司) Tsinghua University(清华大学)

AI总结 提出SignNet-1M,通过3D高斯泼溅、扩散模型和后期渲染增强合成多样化手语视频,提升模型在跨视角、背景和身份等分布偏移下的泛化能力。

Comments 25 pages. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24311 2026-06-24 cs.AI 新提交

LemonHarness Technical Report

LemonHarness 技术报告

Kailong Ren, Fubo Sun, Jiachen Liu, Liu Yang, Zimo Yin, Jiaying Li, Congli Yin, Ming He, Yu Huo, Jiawei Liu, Zeping Chen, Yubin Huangfu, Ronghua Li, Yixuan Wu, Xing Su, Yanzhi Xu, Likang Wu, Hongke Zhao, Lei Zhang, Xiaohui Geng, Jianping Fan

机构 * Tianjin University(天津大学) Anhui University(安徽大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)

AI总结 针对长周期智能体因工作空间状态变化难以追踪的问题,提出LemonHarness框架,通过显式执行边界、可复用规则知识库和时感知执行机制,在Terminal-Bench 2.0上实现86.52%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24248 2026-06-24 cs.CV 新提交

M^2C-EvDet: Multi-Domain Multi-Order Cross-Modal Knowledge Distillation for Event-based Object Detection

M^2C-EvDet:面向事件目标检测的多域多阶跨模态知识蒸馏

Wei Bao, Siqi Li, Shouan Pan, Yi Xie, Yue Gao

机构 * BNRist, THUIBCS, BLBCI, School of Software, Tsinghua University(清华大学软件学院、北京信息科学与技术国家研究中心、清华-英特尔先进计算与智能技术联合研究中心、北京国家区块链与物联网技术研究中心) Yangtze Delta Region Institute, Tsinghua University(清华大学长三角研究院) School of Economics and Management, Beijing Forestry University(北京林业大学经济管理学院)

AI总结 提出M^2C-EvDet框架,通过频率学习和超图计算,结合自适应频率解耦特征蒸馏和多阶关系蒸馏,缩小事件数据与帧数据在目标检测上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24214 2026-06-24 cs.CV 新提交

MorVess: Morphology-Aware Pulmonary Vessel Segmentation Network

MorVess: 形态感知的肺血管分割网络

Fuyou Mao, Yifei Chen, Beining Wu, Lixin Lin, Jinnan Dai, Zhiling Li, Yilei Chen, Yaqi Wang, Hao Zhang, Yan Tang, Huiyu Zhou, Feiwei Qin

机构 * Central South University(中南大学) Tsinghua University(清华大学) Hangzhou Dianzi University(杭州电子科技大学) University of Leicester(莱斯特大学)

AI总结 提出MorVess框架,结合可微几何先验与大模型适应,通过联合预测血管掩膜、距离图和厚度图,提升肺血管分割的拓扑完整性和小血管恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24175 2026-06-24 cs.CV 新提交

Tri-Efficient Transfer Learning for Point Cloud Videos

点云视频的三效迁移学习

Yiding Sun, Dongxu Zhang, Jihua Zhu, Haozhe Cheng, Zhengqiao Li, Pengcheng Li, Chaowei Fang, Yonghao Dong, Lin Chen

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院) School of Information and Communication Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) SIGS, Tsinghua University(清华大学深圳国际研究生院)

AI总结 提出PoinTriE框架,通过伪运动轨迹合成、几何-运动对偶网络和时空侧网络,实现数据、参数和内存三方面高效的点云视频迁移学习,在动作识别和语义分割任务上取得新最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏