arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-04-29 至 2026-04-29 共收录 15
2604.25806 2026-04-29 cs.CL cs.AI cs.HC

MAIC-UI: Making Interactive Courseware with Generative UI

MAIC-UI: 用生成式UI制作交互式课程ware

Shangqing Tu, Yanjia Li, Keyu Chen, Sichen Zhang, Jifan Yu, Daniel Zhang-Li, Lei Hou, Juanzi Li, Yu Zhang, Huiqin Liu

机构 * Tsinghua University(清华大学) Guangzhou University(广州大学) Zhejiang University(浙江大学)

AI总结 MAIC-UI通过零代码系统实现教育者快速编辑交互式课程ware,采用多模态知识分析、生成-验证-优化流程和点击定位编辑技术,提升教学效果和学习公平性。

Comments You can try our demo at https://open.maic.chat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25636 2026-04-29 cs.CV

Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models

通过再生进行细化:扩大修改空间提升统一多模态模型中的图像细化

Jiayi Guo, Linqing Wang, Jiangshan Wang, Yang Yue, Zeyu Liu, Zhiyuan Zhao, Qinglin Lu, Gao Huang, Chunyu Wang

机构 * Tsinghua University(清华大学) Tencent HY(腾讯HY)

AI总结 本文提出通过再生进行细化的新框架,通过扩大修改空间提升统一多模态模型的图像细化效果,实验表明在多个基准测试中性能显著提升。

Comments GitHub: https://github.com/LeapLabTHU/RvR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24796 2026-04-29 q-bio.OT cs.LG

A multi-stage soft computing framework for complex disease modelling and decision support: A liver cirrhosis case study

一种多阶段软计算框架用于复杂疾病建模和决策支持:肝硬化案例研究

Xueyuan Huang, Yuheng Wang, Yuanzhi He, Siqi Gou, Lu Bai, Wenqian Wu, Peifeng Liu, Aijia Wang, Tianhui Fan, Ze Zhou, Jiayu Xu

机构 * organization= Department of Hepatobiliary Surgery, the Second Affiliated Hospital of Chongqing Medical University , city= Chongqing , postcode= 400010 , country= China organization= State Key Laboratory of Respiratory Health Multimorbidity, Institute of Basic Medical Sciences \& School of Basic Medicine, Chinese Academy of Medical Sciences \& Peking Union Medical College , city= Beijing , postcode= 100005 , country= China organization= School of Computer Science Informatics, Cardiff University , city= Wales , postcode= CF24 0DE , country= United Kingdom organization= Department of Medical Oncology, the First Hospital of China Medical University , city= Shenyang , postcode= 110001 , country= China organization= Institute for Innovation Development, Tsinghua University , city= Beijing , postcode= 100086 , country= China organization= Department of Liver Surgery, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences \& Peking Union Medical College , city= Beijing , country= China

AI总结 本文提出一种多阶段软计算框架,用于复杂疾病建模与治疗探索,通过整合单细胞转录组数据、高维网络特征稳定化、多模型学习和深度表征学习,提升肝硬化等复杂疾病的诊断与治疗决策能力。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19709 2026-04-29 cs.SD cs.AI

Hyperbolic Additive Margin Softmax with Hierarchical Information for Speaker Verification

双曲加法边距软max与层次信息的说话人验证

Zhihua Fang, Liang He

机构 * School of Computer Science and Technology(计算机科学与技术学院) Xinjiang University(新疆大学) Xinjiang Multimodal Information Technology Engineering Research Center(新疆多模态信息处理工程技术研究中心) School of Intelligence Science and Technology(智能科学与技术学院) Department of Electronic Engineering(电子工程系) Tsinghua University(清华大学)

AI总结 本文提出基于双曲空间的H-Softmax和HAM-Softmax,通过投影嵌入和说话人中心到双曲空间并计算双曲距离,提升说话人特征的层次信息建模能力,实验表明其在说话人验证中显著降低EER。

Comments 5 pages, 3 figures, Accepted at ICASSP 2026

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06757 2026-04-29 cs.SD cs.CV

XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice Association

XM-ALIGN:面向人脸-语音关联的统一跨模态嵌入对齐框架

Zhihua Fang, Shumei Tao, Junxu Wang, Liang He

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Xinjiang Multimodal Information Technology Engineering Research Center(新疆多模态信息处理工程技术研究中心) Urumqi Branch, China Mobile Group Xinjiang Co., Ltd(中国移动新疆乌鲁木齐分公司) School of Intelligence Science and Technology, Xinjiang University(新疆大学智能科学与技术学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 本文提出XM-ALIGN框架,通过显式与隐式对齐机制提升跨模态验证性能,采用共享分类器联合优化人脸与语音嵌入,并通过数据增强提升泛化能力。

Comments FAME 2026 Technical Report

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20211 2026-04-29 cs.CV cs.AI

OmniAlpha: Aligning Transparency-Aware Generation via Multi-Task Unified Reinforcement Learning

OmniAlpha:通过多任务统一强化学习对透明度感知生成进行对齐

Hao Yu, Jinglin Wang, Jiabo Zhan, Rui Chen, Zile Wang, Huaisong Zhang, Hongyu Li, Xinrui Chen, Yongxian Wei, Chun Yuan

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

AI总结 OmniAlpha通过多任务统一强化学习框架,解决透明度感知生成中RGB外观、alpha透明度和跨层合成的建模问题,提升RGBA生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25427 2026-04-29 cs.CV

A Systematic Post-Train Framework for Video Generation

视频生成的系统性后训练框架

Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

机构 * The University of Hong Kong(香港大学) JD Explore Academy(京东探索研究院) Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 本文提出系统性后训练框架,通过四个协同阶段提升视频生成的视觉质量、时间一致性和指令遵循性,同时保持预训练阶段的可控性。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20191 2026-04-29 cs.CV cs.AI cs.RO

From Scene to Object: Text-Guided Dual-Gaze Prediction

从场景到物体:文本引导的双目预测

Zehong Ke, Yanbo Jiang, Jinhao Li, Zhiyuan Liu, Yiqian Tu, Qingwen Meng, Heye Huang, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(Cho Chun Shik 移动研究生院,韩国科学技术院)

AI总结 本文提出双分支 gaze 预测框架,通过构建物体级数据集和改进模型架构,实现精准物体级注意力预测,提升语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11075 2026-04-29 cs.RO

RISE: Self-Improving Robot Policy with Compositional World Model

RISE:具有组合世界模型的自改进机器人策略

Jiazhi Yang, Kunyang Lin, Jinwei Li, Wencong Zhang, Tianwei Lin, Longyan Wu, Zhizhong Su, Hao Zhao, Ya-Qin Zhang, Li Chen, Ping Luo, Xiangyu Yue, Hongyang Li

机构 * The Chinese University of Hong Kong(香港中文大学) Kinetix AI The University of Hong Kong(香港大学) Shanghai Innovation Institute(上海创新研究院) Horizon Robotics Tsinghua University(清华大学)

AI总结 本文提出RISE框架,通过组合世界模型提升机器人策略鲁棒性,在动态砖块排序、背包打包和箱盖闭合任务中分别取得+35%、+45%和+35%的性能提升。

Comments RSS 2026. Project page: https://opendrivelab.com/RISE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10718 2026-04-29 cs.LG cs.CL

SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining

SnapMLA: 通过硬件感知的FP8量化流水线实现高效的长上下文MLA解码

Yifan Zhang, Zunhai Su, Shuhao Hu, Rui Yang, Wei Wu, Yulei Qian, Yuchen Xie, Xunliang Cai

机构 * Meituan LongCat Team(美团LongCat团队) Tsinghua University(清华大学)

AI总结 SnapMLA通过硬件感知的FP8量化流水线优化,提升长上下文解码效率,实验显示在长输出解码任务中吞吐量提升达1.91倍,同时在推理和代码生成基准上与BF16基线表现相近。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07348 2026-04-29 cs.CV

MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition

MICo-150K:一个多图像合成的综合数据集

Xinyu Wei, Kangrui Cen, Hongyang Wei, Zhen Guo, Kai Cui, Bairui Li, Zeqing Wang, Jinrui Zhang, Lei Zhang

机构 * Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) OPPO Research Institute(OPPO研究院)

AI总结 本文提出MICo-150K数据集,通过系统研究多图像合成任务,构建高质量图像和多样提示,结合人类反馈生成平衡的合成图像,同时建立评估基准和新指标,验证了数据集对模型提升的有效性。

Comments Project Page: https://MICo-150K.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05425 2026-04-29 cs.CV cs.AI

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

SIV-Bench:一种用于社会互动理解和推理的视频基准测试

Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出SIV-Bench,一个用于评估多模态大语言模型在社会场景理解、社会状态推理和社会动态预测能力的视频基准测试,揭示了现有模型在社会推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05199 2026-04-29 cs.CV

DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework

DEGround:一种有效的基于自身视角的3D视觉定位基线框架

Yani Zhang, Dongming Wu, Hao Shi, Yingfei Liu, Tiancai Wang, Xingping Dong

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Tsinghua University(清华大学)

AI总结 本文提出DEGround框架,通过统一的框架实现检测与定位的物体级共享,引入两个任务特定模块提升细粒度指令定位性能,实验表明在多个基准上表现最佳,尤其在EmbodiedScan数据集上精度提升显著。

Comments 1st place on EmbodiedScan visual grounding

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00712 2026-04-29 math.OC cs.AI cs.LG

On Finding Small Hyper-Gradients in Bilevel Optimization: Hardness Results and Improved Analysis

在双层优化中寻找小超梯度:难度结果与改进分析

Lesi Chen, Jing Xu, Jingzhao Zhang

机构 * IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai Qizhi Institute(上海启智研究院) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文研究了双层优化中寻找超目标 stationary 点的难度,证明在非凸-凸情况下零尊重算法不可行,并提出在满足PL条件的非凸-非凸问题中,通过简单一阶算法获得更优复杂度界。

Comments Published in COLT 2024. This arXiv version refines Assumption 4.1 (d); adds discussions on related works in Appendix A; and corrects the kappa dependency in the upper bounds

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.03886 2026-04-29 eess.SP cs.AI

Demo: Real-Time Semantic Communications with a Vision Transformer

演示:基于视觉Transformer的实时语义通信

Hanju Yoo, Taehun Jung, Linglong Dai, Songkuk Kim, Chan-Byoung Chae

机构 * School of Integrated Technology, Yonsei University(燕山大学整合技术学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 本文提出基于深度神经网络的图像传输架构,并通过FPGA原型在实时无线信道中验证其可行性,展示其在低信噪比下优于传统调制系统。

详情

展开后加载摘要…

URL PDF HTML 收藏