arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 614
2607.07438 2026-07-09 cs.CV 新提交

Two-Stage Multi-Modal Fusion with Adaptive Alignment for Action Quality Assessment

用于动作质量评估的具有自适应对齐的两阶段多模态融合

Kanglei Zhou, Ruizhi Cai, Xinning Wang, Yijian Zheng, Liyuan Wang, Jianguo Li, Xiaohui Liang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Children’s Hospital, Capital Institute of Pediatrics(首都儿科研究所附属儿童医院) Zhongguancun Laboratory(中关村实验室)

AI总结 研究动作质量评估问题,提出两阶段多模态融合框架DualAlign,通过自适应对齐解决跨模态错位等挑战,引入MM-JDM数据集,实验表明该框架在多模态评估中表现出色,相比现有方法有显著提升且在特定条件下稳健。

Comments Accepted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07103 2026-07-09 cs.LG cs.DB 新提交

A knowledge-augmented dataset of high-risk driving scenarios with LLM annotations for autonomous driving

一个用于自动驾驶的具有大语言模型注释的高风险驾驶场景知识增强数据集

Heye Huang, Jingguang Li, Zhiyuan Zhou, Paul Liang, Mingyu Wu, Kitae Jang, Jianqiang Wang

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Fudan University(复旦大学) Massachusetts Institute of Technology(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 研究自动驾驶中高风险场景数据不足问题,核心方法是构建K-Risk数据集,整合多源轨迹数据并利用大语言模型生成注释,主要贡献是为自动驾驶开发和评估提供标准化基础。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07021 2026-07-09 cs.AI cs.HC 新提交

Learning social norms enhances compatibility in dynamic human-AI coordination

学习社会规范可增强动态人机协作中的兼容性

Yi Yang, Siyuan Liu, Xin Gao, Huamu Sun, Chao Liu, Qing Zhou, Bingbing Nie

机构 * School of Vehicle and Mobility, Tsinghua University, Beijing, China(清华大学车辆与移动系统学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University, Beijing 100084, China(清华大学智能绿色车辆与移动系统国家重点实验室) State Key Laboratory of Cognitive Neuroscience and Learning & IDG/McGovern Institute for Brain Research, Beijing Normal University, Beijing, China(北京师范大学认知神经科学与学习国家重点实验室) Beijing Key Laboratory of Safe AI and Superalignment, Beijing, China(北京安全人工智能与超对齐关键实验室) Beijing Institute of AI Safety and Governance, Beijing, China(北京人工智能安全与治理研究院)

AI总结 研究以行人与车辆互动为代表,搭建实验平台,识别出人类社会规范的三项原则,将其融入人工智能显著改善人机协作,在闭环互动任务中,融入社会规范的大语言模型总分比基线策略高出近四倍,比人际互动高出43%。

Comments 44 pages, 5 figures, supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06699 2026-07-09 cs.RO 新提交

RoboSnap: One-Shot Real-to-Sim Scene Generation for Generalizable Robot Learning and Evaluation

RoboSnap:用于可泛化机器人学习与评估的一次性真实到模拟场景生成

Shujie Zhang, Jingkun Yi, Weipeng Zhong, Zirui Zhou, Yangkun Zhu, Hanqing Wang, Xudong Xu, Weinan Zhang, Chunhua Shen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 针对构建物理稳定且视觉逼真场景缓慢昂贵的问题,提出RoboSnap框架,通过分层设计将单张RGB图像转为模拟场景,实验证明其能实现轨迹重放等,还引入DROID-Sim数据集,凸显真实到模拟方法对机器人学习评估的价值。

Comments 24 pages, 16 figures, Project page: https://robosnap.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05394 2026-07-09 cs.LG cs.AI cs.CL 新提交

Weak-to-Strong Generalization via Direct On-Policy Distillation

通过直接在线策略蒸馏实现弱到强泛化

Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

机构 * SIA-Lab of Tsinghua AIR and ByteDance Seed(清华-字节跳动联合研究中心SIA实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Peking University(北京大学)

AI总结 针对可验证奖励RL在大模型上成本高的问题,提出Direct-OPD方法迁移小模型RL的策略偏移,无需在大模型上跑RL即可实现性能提升。

Comments Project Page: https://bytedtsinghua-sia.github.io/Direct-OPD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00572 2026-07-09 cs.AI cs.CR 新提交

HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment

HARC:耦合有害性与拒绝方向以实现鲁棒的安全对齐

Shei Pern Chua, Hao Wu, Qianli Ma, Fangzhao Wu

机构 * Tsinghua University(清华大学) Southeast University(东南大学) Microsoft(微软公司)

AI总结 提出HARC微调方法,通过耦合提示和响应位置的有害性与拒绝方向,在不损害通用能力的情况下提升LLM安全对齐的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06440 2026-07-08 cs.CV 新提交

PIPBench: A Profile-Inclusive Framework for Personalized Image Generation Evaluation

PIPBench:用于个性化图像生成评估的包含个人资料的框架

Yuhang Wu, Shuxiang Zhang, Wee Hian Ching, Chi Zhang, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qi Zhi Institute(上海启智研究院)

AI总结 研究个性化图像生成问题,引入PIPBench基准及新数据构建管道,利用心理和人口统计学资料维度收集数据,全面评估代表性方法,揭示现有方法局限,为个性化文本到图像合成带来新挑战与机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06323 2026-07-08 cs.RO 新提交

LAMP: Latent Motion Prior-Guided Real-World Learning for Dexterous Hand Manipulation

LAMP:用于灵巧手部操作的潜在运动先验引导的现实世界学习

Xinye Yang, Zhiyuan Ma, Hongze Yu, Yuanpei Chen, Yaodong Yang, Xiaojie Chai, Xinlei Chen, Chao Yu

机构 * Fudan University(复旦大学) Tsinghua University(清华大学) Peking University(北京大学) PsiBot

AI总结 研究针对灵巧手部现实世界学习易出错的问题,提出含潜在运动先验模块的三阶段学习框架LAMP,先预训练模块,再训练视觉运动策略并通过在线残差RL改进,在真实机器人任务中取得高成功率,提升了学习效果。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06157 2026-07-08 cs.CL cs.AI 新提交

LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability

用于协商协作的大语言模型智能体:部分可观测联合决策下的联合决策研究

Chenxu Wang, Yongkun Yang, Boyuan Du, Shiwei Lin, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Fuzhou University(福州大学)

AI总结 研究部分可观测联合决策任务下的协商LLM智能体,通过形式化问题、引入基准、实例化框架和协议并评估LLMs,发现复杂任务仍挑战语言模型,协商过程有反思纠错机会,为评估改进LLM智能体奠定基础。

Comments Code is available at https://github.com/wcx21/deliberative-collaboration-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05965 2026-07-08 cs.CV cs.AI 新提交

Decoupled Single-Mask Annotation Noise Detection via Cross-Sectional Patch Self-Consistency

通过横截面补丁自一致性进行解耦单掩码注释噪声检测

Yinheng Zhu, Xiaowei Xu

机构 * Tsinghua University(清华大学) Guangdong Provincial People’s Hospital(广东省人民医院)

AI总结 研究血管CT数据集单掩码注释噪声问题,提出利用横截面补丁自一致性的解耦框架检测噪声,通过采样、检索邻居及计算分数产生证据和质量图,实验验证其能提高训练鲁棒性并揭示注释偏差。

Comments 13 pages, 6 figures. Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05475 2026-07-08 cs.AR cs.AI 新提交

Is Your NPU Ready for LLMs? Dissecting the Hidden Efficiency Bottlenecks in Mobile LLM Inference

你的NPU是否适用于大语言模型?剖析移动大语言模型推理中隐藏的效率瓶颈

Guanyu Cai, Ruiming Tian, Lang Yang, Zhouhong Ren, Jinliang Yuan, Lingkun Li, Jiliang Wang

机构 * Tsinghua University(清华大学) Beijing Jiaotong University(北京交通大学)

AI总结 研究剖析移动大语言模型推理隐藏的效率瓶颈,通过跨层测量及PowerBench工具,发现框架性能差距在NPU上被放大、不同后端在不同阶段各有优劣及存在调度空间浪费,据此提出配置可降NPU后端能耗54.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05436 2026-07-08 cs.LG 新提交

Statistically Meaningful Geometry and Gauge Symmetry Breaking: A Geometric Foundation for Scientific Discovery and Intelligence Emergence

统计有意义的几何与规范对称性破缺:科学发现与智能涌现的几何基础

Bing Cheng, Yi-Shuai Niu, Howell Tong, Shing-Tung Yau

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) AMSS Center for Forecasting Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院预测科学研究中心) Beijing Institute of Mathematical Sciences and Applications (BIMSA)(北京国际数学研究中心) Department of Statistics, London School of Economics and Political Science(伦敦政治经济学院统计系) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) Paula and Gregory Chow Institute for the Studies in Economics, Xiamen University(厦门大学经济研究所) Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心)

AI总结 研究超参数化机器学习系统是否展现真正智能的问题,引入统计有意义的几何框架,通过建模为Orlicz纤维束,证明在特定刺激下会出现规范对称性破缺,可区分真正发现与幻觉,为认证智能提供无参数、可证伪方法,推动人工智能用于科学的范式转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11032 2026-07-08 cs.CV 新提交

U-TTT: Towards Generalizable PET Image Denoising via Test-Time Training

U-TTT:通过测试时训练实现可泛化的PET图像去噪

Zhiwen Yang, Jiayin Li, Hao Lu, Hui Zhang, Zihua Wang, Yan Xu

机构 * School of Biological Science and Medical Engineering, Beihang University(北京航空航天大学生物科学与医学工程学院) Department of Biomedical Engineering, Tsinghua University(清华大学生物医学工程系) School of Aerospace Engineering, Tsinghua University(清华大学航天航空学院) ByteDance Inc.(字节跳动有限公司)

AI总结 针对PET图像去噪模型在分布偏移下性能退化的问题,提出U-TTT模型,集成测试时训练(TTT)层,通过自监督动态调整参数,并设计双域自适应机制(空间和频率TTT层),在未见剂量水平和扫描仪下实现最优去噪和泛化。

Comments This paper introduces the first TTT-based model for image restoration

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04809 2026-07-07 stat.ML cs.LG 新提交

Context-Constrained Transfer Learning for Tabular Foundation Models via Data Distillation

面向表格基础模型的基于数据蒸馏的上下文约束迁移学习

Yijun Lin, Sai Li

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学)

AI总结 针对表格基础模型迁移学习中的上下文尺寸限制与分布偏移问题,提出TL-ANDI蒸馏框架,通过最优传输构建紧凑源上下文,结合局部标签蒸馏与残差校准缓解负迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03764 2026-07-07 eess.IV cs.CV 新提交

Deep Learning-Based Characterization of Detonation-Cell Size Distributions in Soot-Foil Records

基于深度学习的烟迹记录中爆轰胞格尺寸分布表征方法

Mingyang Bu, Robson A. Schneider, Karl P. Chatelain, Mhedine Alicherif, Yingchen Shi, Andrés Z. Mendiburu, Deanna A. Lacoste, Bing Wang

机构 * School of Aerospace Engineering, Tsinghua University(清华大学航天航空学院) Mechanical Engineering Department, Federal University of Rio Grande do Sul (UFRGS)(里约格兰德-do-.sul联邦大学机械工程系) Physical Science and Engineering Division, Mechanical Engineering Program, King Abdullah University of Science and Technology (KAUST)(卡爾邦大學科學與技術研究院机械工程项目) Institute for Aero Engine, Tsinghua University(清华大学航空发动机研究院)

AI总结 针对传统爆轰胞格测量耗时主观、现有计算机视觉方法泛化性差的问题,提出基于Mask R-CNN的深度学习方法,实现爆轰胞格自动识别与特征提取,精度高、鲁棒性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05378 2026-07-07 cs.LG 新提交

CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents

CompactionRL:面向长视界智能体的带上下文压缩强化学习

Yujiang Li, Zhenyu Hou, Yi Jing, Jie Tang, Yuxiao Dong

机构 * Tsinghua University(清华大学)

AI总结 针对长视界大语言模型智能体受上下文窗口限制的问题,提出结合上下文压缩的强化学习方法,联合优化任务执行与摘要生成,在智能体编码任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05377 2026-07-07 cs.RO cs.AI cs.CV 新提交

Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation

Cortex:一种用于长视距操作的双向对齐具身智能体框架

Jiaqi Peng, Xiqian Yu, Delin Feng, Yuqiang Yang, Wenzhe Cai, Jing Xiong, Ganlin Yang, Jinliang Zheng, Jiafei Cao, Xueyuan Wei, Jiangmiao Pang, Yuan Shen, Tai Wang

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) USTC(中国科学技术大学)

AI总结 针对现有VLA模型长视距任务短板及分层方法语义-运动鸿沟问题,提出双向对齐框架Cortex,标准化技能原语、优化数据与采样策略,提升长视距操作性能与零样本泛化能力。

Comments Project website: https://steinate.github.io/cortex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05150 2026-07-07 cs.CV 新提交

Claim-Level Rubric Rewards for Video Caption Reinforcement Learning

用于视频字幕强化学习的声明级评分标准奖励(CuRe)

Mingqi Gao, Hongyuan Dong, Yifei Chen, Zhisheng Zhong, Zheng Ruan, Wenjin Hou, Yu Chen, Han Hu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University of Chinese Academy of Sciences(中国科学院大学) LLM Department, Tencent(腾讯大语言模型部)

AI总结 针对密集视频字幕强化学习的奖励设计瓶颈,提出声明级评分标准奖励框架,将奖励建模重构为细粒度声明级验证,规避传统奖励方案的固有缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04894 2026-07-07 cs.CV 新提交

ProCon: Projection-Consistency Memory for Training-Free Anomaly Detection

ProCon:用于无训练异常检测的投影一致性内存

Joongwon Chae, Lihui Luo, Yang Liu, Dongmei Yu, Peiwu Qin, Runming Wang, Ilmoon Chae

机构 * Tsinghua University Shenzhen International Graduate School(清华大学深圳国际研究生院) Ratel Soft Affiliated Fifth Hospital, Wenzhou Medical University(温州医科大学附属第五医院) Chinese Medicine Guangdong Laboratory(广东中医药大学实验室)

AI总结 研究无训练异常检测,提出ProCon框架,将内存检索转变为无解码器重建,通过软投影、构建种子扰动分层内存等稳定投影残差,在多数据集单类别评估中性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04860 2026-07-07 cs.CV cs.HC 新提交

PAGE: Towards Practical Human-level Gaze Target Estimation

PAGE:迈向实用的人类水平注视目标估计

Zhoutong Ye, Chengwen Zhang, Zhaibin Cui, Mingze Sun, Jiaqi Liu, Xiangwu Li, Qingyang Wan, Chang Liu, Xutong Wang, Huan-ang Gao, Yu Mei, Chun Yu, Yuanchun Shi

机构 * Tsinghua University(清华大学) Jinan University(暨南大学)

AI总结 提出PaGE模型明确建模场景与头部特征交互,以大ViT-H+骨干模型为教师,在更大更多样未标注数据集上蒸馏轻量级学生模型,提升注视估计性能,缩小人机差距且便于实际部署。

Comments Project page: https://PaGE-26.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04554 2026-07-07 cs.RO 新提交

HUGS: Guiding Unified Dexterous Grasp Synthesis Across Modes and Scales via Learned Human Priors

HUGS:通过学习人类先验知识指导跨模式和尺度的统一灵巧抓取合成

Mingrui Yu, Yongpeng Jiang, Yongyi Jia, Kangchen Lv, Li Huang, Yi Ren, Xiang Li

机构 * Tsinghua University(清华大学)

AI总结 研究跨尺度物体的灵巧抓取问题,提出HUGS框架,通过学习物体条件下的人类先验知识指导优化,平衡成功率和多样性,提升了接触模式覆盖与合成成功率,合成大量机器人抓取数据。

Comments The first two authors contributed equally. Project website: https://hugs-dex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04472 2026-07-07 cs.CV 新提交

EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration

EVAS:通过视听协同和引导边界校准实现高效多模态时间伪造定位

Shen Shen, Quan Zhang, Dan Jiang, Ke Zhang

机构 * Soochow University(苏州大学) Tsinghua University(清华大学)

AI总结 针对人工智能生成内容带来的多模态取证挑战,提出EVAS框架,利用多阶段视听协同机制和边界感知细化策略,结合解耦训练范式与轻量级网络,有效定位长视频中稀疏分布的伪造片段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04341 2026-07-07 cs.GR cs.CL cs.CV eess.IV 新提交

How to Build Digital Humans? From Priors to Photorealistic Avatars

如何构建数字人?从先验知识到逼真的虚拟形象

Wojciech Zielonka, Tobias Kirschstein, Timo Bolkart, Simon Giebenhain, Vanessa Sklyarova, Xiang Deng, Donglai Xiang, Shunsuke Saito, Yebin Liu, Matthias Niessner, Justus Thies

机构 * Meta Technical University of Munich(慕尼黑技术大学) Google(谷歌) Tsinghua University(清华大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) NVIDIA Technical University of Darmstadt(达姆施塔特技术大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 概述可控3D人类虚拟形象创建,聚焦先验学习和形象创建阶段,定义现有虚拟形象表示并分类,回顾全身和头部虚拟形象等方法,概述原则、推荐文献并讨论挑战与方向。

Comments Eurographics 2026 State-of-the-Art Report (STAR). Project page: https://wojciechzielonka.com/how-to-build-digital-humans/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04331 2026-07-07 cs.RO cs.CV 新提交

Agent-driven Long-tail Simulation for Autonomous Driving

用于自动驾驶的智能体驱动长尾模拟

Junru Gu, Lijin Yang, Jianing Huang, Shu Liu, Zhongzhan Huang, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学交叉信息研究院) Bosch Research(博世研究院)

AI总结 针对现有自动驾驶模拟器局限性,提出智能体驱动模拟框架,通过结构化动作接口由大语言模型控制道路参与者,还引入SemanticPlan基准测试,结果表明长尾场景仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04265 2026-07-07 cs.RO cs.AI 新提交

HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models

HALO-WA:用于世界-动作模型的混合注意力潜在引导在线强化学习

Angen Ye, Weijie Ke, Xiaofeng Wang, Xinze Chen, Chaojun Ni, Guosheng Zhao, Boyuan Wang, Zheng Zhu, Junjie Xie, Dapeng Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) GigaAI(字节跳动公司(推测,根据常见语境)) Tsinghua University(清华大学)

AI总结 针对世界-动作模型在现实精度任务中易受多种误差影响的问题,提出HALO-WA框架,利用潜在特征和动作先验,通过混合注意力结构实现快速在线适应,提升动作块精度,实验验证效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04234 2026-07-07 cs.RO cs.AI cs.CV 新提交

SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects

SoftVTBench:用于物理约束下可变形物体机器人操作的安全感知视觉触觉基准测试

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓景智能) Tsinghua University(清华大学) King’s College London(伦敦国王学院) Southeast University(东南大学) Stevens Institute of Technology(史蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manchester(曼彻斯特大学) Simple AI(简单人工智能公司) Imperial College London(伦敦帝国学院) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 研究物理约束下可变形物体操作,提出SoftVTBench基准测试,通过有限元模拟可变形物体,定义任务套件,分别报告目标成功和安全成功,实现基线并实验,表明仅成功评估高估策略性能,触觉传感可提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04163 2026-07-07 cs.CV cs.AI 新提交

SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering

SeeMe:通过有效的视觉令牌工程减轻大型视觉语言模型中的幻觉

Kai Tang, Jinhao You, Bohua Zhang, Yichen Guo, Yiding Sun, Dongxu Zhang, Chenxi Li, Xiande Huang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室) University of Pennsylvania(宾夕法尼亚大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) De Artificial Intelligence Lab(德人工智能实验室)

AI总结 研究大型视觉语言模型易产生幻觉问题,提出无训练框架SeeMe,引入传统机器学习特征工程概念,经三阶段令牌工程重组视觉令牌抑制幻觉源,实验证明其能减轻幻觉并提高输出一致性。

Comments 12 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04162 2026-07-07 cs.RO cs.LG 新提交

ACE: Agentic Control for Embodied Manipulation via Zero-shot Workflow Reasoning

ACE:通过零样本工作流推理实现具身操纵的智能体控制

Iok Tong Lei, QianZhi Li, Ying Jie Yap, Yujie Zhang, Rui Zhong, Haichao Gui, Xiaolong Liu, Zhidong Deng

机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Wuxi Dexteroushands Robotic Technology Co.(无锡灵犀机器人技术有限公司)

AI总结 研究开放式桌面操作,提出ACE零样本工作流推理框架,结合智能体工作流推理与视觉基础接口、可重复使用的拾取和放置原语等技能,经掩码介导视觉动作接口连接语义推理与物理控制,能在线适应多种情况,在复杂任务中表现出色。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03964 2026-07-07 cs.RO cs.AI 新提交

Worldscape-MoE: A Unified Mixture-of-Experts World Model for Scalable Heterogeneous Action Control

Worldscape-MoE:用于可扩展异构动作控制的统一专家混合世界模型

Jianjie Fang, Yongyan Xu, Ziyou Wang, Chen Gao, Yuchao Huang, Zhaolu Wang, Rongze Tang, Mingyuan Jia, Baining Zhao, Weichen Zhang, Xin Zhang, Haisheng Su, Yu Shang, Wei Wu, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

AI总结 研究视频生成世界模型控制接口碎片化瓶颈,提出基于扩散变换器的专家混合世界模型Worldscape-MoE,通过模态感知控制注入等实现异构动作控制,实验验证其有效性和扩展性。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03851 2026-07-07 cs.CV eess.IV 新提交

ContiStain: Cross-Domain Relation-Preserving Distillation for Continual Multi-Domain Virtual IHC Staining

ContiStain:用于连续多域虚拟免疫组化染色的跨域关系保留蒸馏

Fuqiang Chen, Yifeng Wang, Hongpeng Wang, Yongbing Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 针对临床中随时间顺序获取新生物标志物数据致性能下降问题,提出ContiStain框架,用混合专家特征提取器构建特征空间,提出关系保留蒸馏策略,提升多域虚拟染色稳定性。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏