arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 614
2606.08001 2026-06-09 cs.CV 新提交

Learning a Semantic Calibration Network for Open-Vocabulary Semantic Segmentation

学习语义校准网络用于开放词汇语义分割

Yang Sun, Tao Wang, Anastasia Ioannou, Ge Xu

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出语义校准网络(SCN),通过类消歧和logits融合模块显式建模类间语义相关性,在保持CLIP泛化能力的同时提升分割性能。

Comments Paper accepted by 11th International Conference on Intelligent Computing and Signal Processing (ICSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07970 2026-06-09 cs.CL cs.AI 新提交

Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks

通过扩展训练时对抗攻击防御恶意微调

Haoming Wen, Shi Chen, Qingyu Shi, Siyuan Liu, Minrui Luo, Jingzhao Zhang, Tianxing He

机构 * Xiongan AI Institute(雄安人工智能研究院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海期智研究院)

AI总结 针对全参数微调的安全威胁,提出基于对抗训练和双层优化的Patcher方法,通过扩展对抗循环中的优化步数增强防御,并设计并行算法提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07965 2026-06-09 cs.AI 新提交

Zero-Shot Learning in Industrial Scenarios: New Large-Scale Benchmark, Challenges and Baseline

工业场景中的零样本学习:新的大规模基准、挑战与基线

Zekai Zhang, Qinghui Chen, Maomao Xiong, Shijiao Ding, Zhanzhi Su, Xinjie Yao, Yiming Sun, Cong Bai, Jinglin Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Huawei Technologies(华为技术有限公司) Tsinghua University(清华大学) Microsoft Research(微软研究院)

AI总结 针对工业场景中视觉语言模型应用难、数据稀缺的问题,提出大规模多模态工业开放数据集MMIO和精炼文本-视觉提示RTVP,实现零样本工业缺陷检测,在MMIO上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07962 2026-06-09 cs.CV 新提交

ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?

ChronoPhyBench:多模态大语言模型真正理解世界还是仅仅利用语言先验?

Bin Zhu, Yanhao Jia, Kexin Zhao, Jie Wang, Munan Ning, Hao Li, Yuwei Niu, Tanqing Sun, Huangchong Yan, Mingjun Pan, Xinyi Wu, Qishen Yin, Yunyang Ge, Shuai Zhao, Li Yuan

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) Peng Cheng Laboratory(鹏城实验室) Rabbitpre Intelligence Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

AI总结 提出ChronoPhyBench基准,通过视频上下文和文本描述强制模型进行物理状态推理,揭示当前开源模型物理推理能力仍处初级阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07704 2026-06-09 cs.LG cs.AI 新提交

FunctionEvolve: Structure-Guided Symbolic Regression with LLMs

FunctionEvolve: 基于结构引导的符号回归与大型语言模型

Zeyu Xia, Jun Zhu, Dong Yan

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Tsinghua-Bosch Joint Center for ML, Tsinghua University(清华大学-博世联合机器学习中心)

AI总结 提出FunctionEvolve框架,利用表达式树组织符号回归搜索,通过结构摘要、局部树编辑和结构感知系数拟合,在LLM-SRBench合成子集上以Claude Opus 4.6实现82.9%的SA@50,较同基线提升4.5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07590 2026-06-09 cs.CV cs.AI 新提交

SlideCheck: Guiding Self-Supervised Pretraining of Pathology Foundation Models via Dataset Distributions

SlideCheck: 通过数据集分布引导病理基础模型的自监督预训练

Mingyi He, Xinyi Guo, Xitong Ling, Weiming Chen, Jiawen Li, Lianghui Zhu, Minxi Ouyang, Mingxi Fu, Yizhi Wang, Tian Guan

机构 * Beijing University of Chemical Technology(北京化工大学) South China Normal University(华南师范大学) Tsinghua University(清华大学)

AI总结 提出SlideCheck工具,利用冻结病理基础模型的特征,通过双头MLP评分异常和恶性证据,引导自监督预训练数据筛选,实验表明数据分布影响模型下游性能。

Comments 9 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07577 2026-06-09 cs.AI cs.CV cs.SD eess.AS 新提交

OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs

OmniMem: 面向流式音视频大语言模型的扰动感知记忆压缩

Guangzhi Sun, Yixuan Li, Yudong Yang, Chao Zhang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动) Department of Engineering, University of Cambridge(剑桥大学工程系)

AI总结 提出OmniMem,一种针对音视频LLM的流式记忆压缩框架,通过模态感知分配和扰动感知选择压缩KV缓存,在保持长视频理解的同时减少内存,在多个基准上提升2-4%准确率。

Comments Code: https://github.com/bytedance/SALMONN/tree/omni_mem

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07326 2026-06-08 cs.CV 新提交

AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization

AnchorWorld: 基于视图演化定制的具身自我中心世界模拟

Yu Li, Menghan Xia, Gongye Liu, Xintao Wang, Conglang Zhang, Lei Ke, Yuxuan Lin, Ruihang Chu, Pengfei Wan, Kun Gai, Yujiu Yang

机构 * Tsinghua University(清华大学) HUST(华中科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) HKUST(香港科技大学) WHU(武汉大学)

AI总结 提出AnchorWorld框架,利用3D人体运动和外源视角辅助训练增强交互完整性,并通过锚点视图和文本描述实现自我演化世界的灵活定制,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07289 2026-06-08 cs.LG cs.CV 新提交

Closed-Form Spectral Regularization for Multi-Task Model Merging

多任务模型融合的闭式谱正则化

Yongxian Wei, Runxi Cheng, Xingxuan Zhang, Li Shen, Chun Yuan, Peng Cui, Dacheng Tao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

AI总结 针对多任务模型融合中的干扰最小化问题,发现迭代求解器实际充当隐式谱正则化器,据此提出基于谱滤波的闭式方法SWUDI及其自适应变体SWUDI-A,显著提升效率并匹配或超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07107 2026-06-08 cs.RO 新提交

Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models

粗到细控制:面向视觉-语言-动作模型的行动令牌规划

Jinhao Wu, Shiduo Zhang, Yicheng Liu, Xiaopeng Yu, Sixian Li, Siyin Wang, Hang Zhao, Jing Huo, Yang Gao, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 提出Coarse-to-Control框架,在动作令牌空间中引入原生规划,通过先预测粗粒度动作令牌序列再生成可执行动作,提升长程任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07089 2026-06-08 cs.RO 新提交

Dreaming when Necessary: Advancing World Action Models with Adaptive Multi-Modal Reasoning

必要时做梦:通过自适应多模态推理推进世界行动模型

Yinzhou Tang, Jingbo Xu, Yu Shang, Zihao Song, Chen Gao, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

AI总结 提出AdaWAM,通过轻量动态路由器自适应触发文本或视觉推理,提升长时复杂任务中的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06953 2026-06-08 cs.RO 新提交

LIMMT: Less is More for Motion Tracking

LIMMT:少即是多的运动追踪

Yu Guan, Zekun Qi, Chenghuai Lin, Xuchuan Chen, Dairu Liu, Wenyao Zhang, Jilong Wang, Xinqiang Yu, He Wang, Li Yi

机构 * Tsinghua University(清华大学) GalBot Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Shanghai Qi Zhi Institute(上海启智研究院)

AI总结 提出数据驱动的运动追踪框架LIMMT,通过物理可行性、多样性和复杂性三维度筛选高质量运动数据,仅用AMASS的3%数据即可超越全量训练效果。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06903 2026-06-08 cs.CV cs.AI 新提交

Beyond Skeletons: Learning Animation Directly from Driving Videos with Same2X Training Strategy

超越骨架:使用Same2X训练策略直接从驱动视频学习动画

Yuan Zeng, Yujia Shi, Yuhao Yang, Dongxia Liu, Zongqing Lu, Wenming Yang, Qingmin Liao

机构 * Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

AI总结 提出DirectAnimator框架,通过驱动线索三元组和Same2X训练策略,绕过姿态提取直接从原始视频学习动画,实现鲁棒且高质量的人体图像动画生成。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06518 2026-06-08 cs.AI cs.LG 新提交

DiBS: Diffusion-Informed Branch Selection

DiBS: 扩散模型引导的分支选择

Bo Liu, Yuan Xie, Yuan Gao, Xiaolong Luo, Peng Ye, Tao Chen, Fujun Han

机构 * Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 针对数独求解中学习型求解器缺乏正确性保证而符号求解器存在长尾搜索的问题,提出扩散模型引导的分支选择方法DiBS,在保持符号求解器完备性的同时,利用扩散模型排序候选值,显著降低搜索成本。

Comments 12 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏