arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-08-04 至 2026-08-04 共收录 11
2608.02160 2026-08-04 cs.CV 新提交

AdaForensics: Learning A Characteristic-aware Adaptive Deepfake Detector

AdaForensics:学习一种具有特征感知能力的自适应深度伪造检测器

Xiaoke Yang, Haixu Song, Xiangyu Lu, Shao-Lun Huang, Yueqi Duan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 本文提出名为AdaForensics的特征感知自适应深度伪造检测器,通过双分支超网络学习自适应参数,在多数据集上性能优于现有最先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02145 2026-08-04 cs.CV cs.AI 新提交

UniqueSplat: View-conditioned 3D Gaussian Splatting for Generalizable 3D Reconstruction

UniqueSplat:用于通用3D重建的视角条件化3D高斯溅射模型

Haixu Song, Xiaoke Yang, Shengjun Zhang, Jiwen Lu, Yueqi Duan

机构 * Tsinghua University(清华大学)

AI总结 本文提出视角条件化前馈3D高斯溅射模型UniqueSplat,通过双分支视角条件化超网络实现高斯动态调整,在多数据集及跨数据集评估中均优于现有最优方法,提升了通用3D重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01460 2026-08-04 cs.LG 新提交

Conformalized Large Language Models under Configuration Shift

配置偏移下的共形大语言模型

Yuqicheng Zhu, Jialin Yu, Lin Li, Gengyuan Zhang, Zhen Yang, Steffen Staab, Puneet Dokania, Philip Torr, Jie Tang, Evgeny Kharlamov

机构 * University of Stuttgart(斯图加特大学) Robert Bosch GmbH(罗伯特·博世有限公司) University of Oxford(牛津大学) LMU Munich(慕尼黑大学) Tsinghua University(清华大学) University of Southampton(南安普顿大学) University of Oslo(奥斯陆大学)

AI总结 该研究针对配置偏移对共形大语言模型有效性的影响展开系统分析,通过多维度实证研究揭示其削弱覆盖率的问题,提出两种实用缓解措施以恢复覆盖率并保留效率。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01178 2026-08-04 cs.CV cs.AI 新提交

DynActiveGS: Active Gaussian Splatting for Dynamic Scene Reconstruction

DynActiveGS:面向动态场景重建的主动高斯溅射方法

Hongbo Duan, Pengting Luo, Chengzhi Zhao, Yuanhao Chiang, Fangming Liu, Xueqian Wang

机构 * Tsinghua University, Shenzhen International Graduate School(清华大学深圳国际研究生院) Huawei Technologies Ltd(华为技术有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室)

AI总结 DynActiveGS是基于3DGS的动态感知主动重建框架,通过分解不确定性实现动态场景的鲁棒主动重建,在多指标上优于现有基线。

Comments Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01157 2026-08-04 cs.CV 新提交

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos

InteracVid:基于直播聊天视频构建真实交互式视听响应数据集

Chi Zhang, Haoyang Shi, Yueyi Liu, Zhaokun Yan, Yishu Yin, Yuhang Wu, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 该研究提出首个开源大规模交互式视听数据集InteracVid,解决现有生成模型监督信号缺失问题,实验证实其可提升多模态助手的交互规划与响应生成性能,为交互式多模态生成提供关键基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01113 2026-08-04 cs.CV 新提交

CoT-Edit: Let CoT Guide Instruction Video Editing

CoT-Edit:让思维链(CoT)指导指令视频编辑

Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

AI总结 本文提出CoT-Edit的plan--guide--edit框架,以CoT增强的MLLM为规划器生成空间先验,结合扩散编辑器实现高保真指令视频编辑,性能优于多个基准方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00730 2026-08-04 cs.RO 新提交

Push-Wiper: Toward General-Purpose Robotic Cleaning across Varied Stains and Surfaces with Segmented Pushing Trajectories

Push-Wiper:基于分段推动轨迹的通用机器人清洁方案,用于处理不同污渍与表面

Renhao Lu, Mingxin Wang, Chenyang Cao, Yang Yang, Guoping Pan, Kangkang Dong, Yi Cheng, Houde Liu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Z-Lab, Zerith Robotics(Zerith机器人公司Z-Lab实验室) University of Toronto(多伦多大学)

AI总结 Push-Wiper 框架将粘性污渍清洁转化为聚合问题,通过分段推动轨迹结合 Diffusion Policy 与 ASPI 控制器,清洁得分比基线高130%,可零样本泛化至多种污渍与表面。

Comments 8 pages, 8 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00646 2026-08-04 cs.CV 新提交

PixelSR: Efficient Screen Content Super-Resolution via Pixel Classification

PixelSR:基于像素分类的高效屏幕内容超分辨率方法

Zhiheng Li, Lei Chen, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

AI总结 PixelSR通过训练阶段的像素分箱分类计算内容注意力、测试阶段利用屏幕内容特性优化推理,在屏幕内容超分辨率任务中实现了性能先进且推理速度更快的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00548 2026-08-04 cs.CV 新提交

DrawAI: Agentic Benchmark and Workflow for Making Raster Images Editable

DrawAI:用于生成可编辑光栅图像的智能体基准与工作流

Pu Cao, Qingye Kong, Xuedan Yin, Xuekun Zhao, Rupeng Yan, Qing Song, Yao Zhang, Lu Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

AI总结 DrawAI提出图像到可编辑重建任务,构建含DrawAI-Bench基准与DrawAI-Flow工作流的智能体方案,经实验验证DrawAI-Flow可提升可编辑结构,不同模型-harness配置的重建质量与成本差异显著。

Comments Project URL: https://drawai.renaissancemind.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00473 2026-08-04 cs.CV cs.AI cs.CL 新提交

CrossProjection: Geometric Grounding Beyond Viewpoint Change in Architectural Drawings

CrossProjection:建筑图纸中超越视角变化的几何定位

Kaho Li, Pengyu Zeng, Yuqin Dai, Jun Yin, Tianjing Feng, Shuai Lu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University College London(伦敦大学学院)

AI总结 该研究提出CrossProjection方法评估视觉语言模型在异构建筑视图间的几何定位能力,发现模型在自由几何定位上性能脆弱,仅封闭选择成功不代表具备可靠几何定位能力。

Comments Initial controlled diagnostic study on 23 natural drawing sets and three VLMs; broader model, building, repeated-inference, and human coverage is planned for a subsequent version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00013 2026-08-04 cs.CL cs.AI cs.CV 新提交

What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs

从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态

Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学)

AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。

详情

展开后加载摘要…

URL PDF HTML 收藏