arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-07-22 至 2026-07-22 共收录 10
2607.19235 2026-07-22 cs.CL cs.CV 新提交

MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings

MeetingToM:在多方会议中对具有心理理论推理能力的多模态大语言模型进行评估

Ziyi Wang, Yuhang Wu, Dongxu Piao, Xingyu Liu, Tianhui Zhou, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)

AI总结 研究多方会议中多模态大语言模型的心理理论推理,引入MeetingToM基准,分层评估不同粒度社会行为推理,提供评估协议并分析模型,揭示其在整合线索、推断态度及区分共识方面的局限,为推进多模态模型的会议心理理论推理提供试验台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18917 2026-07-22 cs.CV 新提交

TAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question Answering

TAP-RAG:用于长文档多模态问答的任务感知策略控制

Zhong Ji, Keqi Jin, Yan Zhang, Jiasheng Li

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) The International Joint Institute of Tianjin University(天津大学国际联合学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 研究长文档多模态问答,提出TAP-RAG框架,含任务感知策略控制器及两个执行器,能预测任务先验、估计证据信号并生成策略,在多模态文档图上扩展证据,在相关数据集上取得最佳总体准确率。

Comments 18 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18850 2026-07-22 cs.CV cs.AI 新提交

OPD-IAD: From Language Judgment to Industrial Anomaly Detection via On-Policy Self-Distillation

OPD-IAD:通过策略内自蒸馏从语言判断到工业异常检测

Shuimu Chen, Jing Jin, Nan Su, Hongbo Xu, Zebang Cheng, Wenming Yang, Fei Ma, Guijin Wang

机构 * Tsinghua University(清华大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen University(深圳大学)

AI总结 研究如何利用大型视觉语言模型进行工业异常检测,提出OPD-IAD框架,通过策略内自蒸馏和语言引导视觉锚定,将语言判断转化为像素级异常图,在相关方法中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18798 2026-07-22 cs.CV cs.GR 新提交

UVFaceFusion: Fast Multi-view Topologically Consistent Face Reconstruction in the Wild via UV-space Neural Fusion

UVFaceFusion:通过UV空间神经融合在野外进行快速多视图拓扑一致的面部重建

Xin Ming, Yuxuan Han, Junhai Yong, Feng Xu

机构 * School of Software and BNRist, Tsinghua University(清华大学软件学院及清华-伯克利深圳学院)

AI总结 针对数字头像创建等需求,UVFaceFusion提出用UV空间神经融合取代启发式拓扑优化,通过VGGT和Pixel3DMM获取数据,经神经融合网络预测点图,直接采样出固定拓扑网格,在多基准测试和野外数据上有很好表现,重建精度高且速度快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18637 2026-07-22 cs.RO cs.LG 新提交

End-to-end Conditional Diffusion for Realistic and Controllable Visual Traffic Scenario Generation

用于逼真且可控的视觉交通场景生成的端到端条件扩散

Jingzheng Li, Yufei Ge, Zhijun Chen, Qianren Mao, Zizhe Wang, Binhang Qi, Bing Li, Keyu Chen, Baochang Zhang, Xianglong Liu, Philip S Yu

机构 * Zhongguancun Laboratory(中关村实验室) Tianjin University(天津大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) State Key Laboratory of Software Development Environment(软件开发环境国家重点实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 研究如何生成逼真且可控的视觉交通场景,提出端到端条件扩散框架E2E-CDiff,基于前视图视觉观察联合去噪未来运动状态等,减轻规划控制不匹配,实验表明其在可控性与逼真性权衡上表现良好,还能引发挑战性交互,作为自我规划器有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18413 2026-07-22 cs.CL 新提交

Convolution for Large Language Models

大语言模型中的卷积

Yuchuan Tian, Yingte Shu, Wei He, Shuo Zhang, Tianchen Zhao, Chao Xu, Xinghao Chen, Yunhe Wang, Hanting Chen, Yu Wang

机构 * Peking University(北京大学) Huawei Technologies(华为技术有限公司) Tsinghua University(清华大学)

AI总结 研究大语言模型中,轻量级深度卷积能否在不大幅增模型大小的情况下提供局部归纳偏差。通过实验发现特定位置应用卷积效果最佳,采用特定残差深度卷积设计,在多个模型和数据预算下提升了下游基准平均准确率,支持其作为自注意力补充建模短程交互。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17967 2026-07-22 cs.CV 版本更新

MoGe-3: Fine-Detail Monocular Geometry Estimation with Self-Guided Sparse Volumetric Refinement

基于自引导稀疏体细化的精细细节单目几何估计

Lingyu Kong, Ruicheng Li, Ruicheng Wang, Sicheng Xu, Chengtang Yao, Jianfeng Xiang, Jiaolong Yang

机构 * Tsinghua University(清华大学) USTC(中国科学技术大学) Microsoft Research(微软研究院)

AI总结 针对单目几何估计在局部3D结构精细细节上的失真问题,提出基于自引导稀疏体细化的方法,将建模从2D提升到3D空间,通过稀疏卷积避免特征混合,实验证明该方法在恢复精细3D几何方面显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12527 2026-07-22 cs.AI 版本更新

Evidence-Grounded AI for Musculoskeletal Care

用于肌肉骨骼护理的基于证据的人工智能

Wenjie Li, Yujie Zhang, Fanrui Zhang, Haoran Sun, Renhao Yang, Junjun He, Weiran Huang, Yuanfeng Ji, Chenrun Wang, Kailing Wang, Hongcheng Gao, Kaipeng Zhang, Hanyu Wang, Angela Lin Wang, Xingqi He, Yilin Huang, Shiyi Yao, Lilong Wang, Yankai Jiang, Yirong Chen, Chenglong Ma, Jiyao Liu, Ming Hu, Gen Li, Yidong Xu, Chengyu Zhuang, Jiawei Liu, Yin Zhang, Lequan Yu, Lu Chen, Yinpeng Dong, Lei Liu, Carlos Gutierrez Sanroman, Yu Qiao, Weijie Ma, Xiaosong Wang, Lei Wang

机构 * Ruijin Hospital, College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院,健康科学技术学院) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学脑启发智能感知与认知教育部重点实验室) School of Basic Medical Sciences, Intelligent Medicine Institute, Fudan University(复旦大学基础医学院智能医学研究院) Department of Radiation Oncology, Stanford University School of Medicine(斯坦福大学医学院放射肿瘤学系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 研究针对肌肉骨骼护理中证据分散问题,提出基于大语言模型的OrthoPilot系统,整合多源数据进行持续管理。该系统在诊断推理等方面超越专家,优于其他智能系统,还提升了管理成功率和病床病例数等,推动临床人工智能实现纵向管理。

Comments All co-authors have now consented to the submission and approved the authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03118 2026-07-22 cs.CV cs.LG 版本更新

Vidu S1: A Real-Time Interactive Video Generation Model

Vidu S1:一个实时交互式视频生成模型

Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zheng, Haoxu Wang, Xiaohang Wang, Qi Jia, Xin Chen, Yimin Chen, Youhe Jiang, Fangcheng Fu, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu

机构 * Tsinghua University(清华大学) Shengshu Technology(生数科技)

AI总结 介绍实时交互式视频生成模型Vidu S1,支持数字角色语音控制,用户可随时通过语音指令控制视频内容,基于TurboDiffusion和TurboServe构建,能实时生成高质量视频,性能优且满足实时推理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07473 2026-07-22 cs.CR cs.AI 版本更新

Give Them an Inch and They Will Take a Mile:Understanding and Measuring Caller Identity Confusion in MCP-Based AI Systems

给予一寸,他们将索取一英里:理解和测量基于MCP的AI系统中的调用者身份混淆

Yuhang Huang, Boyang Ma, Biwei Yan, Xuelong Dai, Yechao Zhang, Minghui Xu, Kaidi Xu, Yue Zhang

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-罗克Quantin 研究院) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Shandong University(山东省大学) City University of Hong Kong(香港城市大学)

AI总结 研究发现基于MCP的AI系统因缺乏调用者身份验证和细粒度授权而存在安全风险,需改进认证机制以减少攻击面。

Comments Withdrawal due to some flaws in experimental methodology and unresolved ethical issues in data collection. We need to redesign the experiments and obtain proper ethical clearance before resubmission

详情

展开后加载摘要…

URL PDF HTML 收藏