arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4547
2604.26218 2026-04-30 cs.CV

ViBE: Visual-to-M/EEG Brain Encoding via Spatio-Temporal VAE and Distribution-Aligned Projection

ViBE:通过时空VAE和分布对齐投影实现视觉到M/EEG脑编码

Ganxi Xu, Zhao-Rong Lai, Yuting Tang, Yonghao Song, Shuyan Zhou, Guoxu Zhou, Boyu Wang, Jian Zhu, Jinyi Long

机构 * Jinan University(济南大学) The First Affiliated Hospital of Jinan University(济南大学第一附属医院) Western University(西方大学) Guangdong University of Technology(广东工业大学) Tsinghua University(清华大学)

AI总结 本文提出ViBE框架,通过时空卷积变分自编码器和分布对齐投影,实现从视觉刺激生成高质量M/EEG信号,解决跨模态对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25937 2026-04-30 eess.AS cs.AI cs.SD

SongBench: A Fine-Grained Multi-Aspect Benchmark for Song Quality Assessment

SongBench: 一个细粒度多维度歌曲质量评估基准

Dapeng Wu, Shun Lei, Wei Tan, Guangzheng Li, Yunzhe Wang, Huaicheng Zhang, Lishi Zuo, Zhiyong Wu

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) Tencent(腾讯)

AI总结 本文提出SongBench,通过七个关键维度评估歌曲质量,构建专家标注数据库,揭示当前模型的细粒度性能差距,推动更专业且音乐连贯的歌曲生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03260 2026-04-30 cs.CL cs.AI

Why Attend to Everything? Focus is the Key

为何关注一切?关注是关键

Hengshuai Yao, Xing Chen, Ahmed Murtadha, Jin Li, Yasin Abbasi Yadkori, Shuai Shao, Changling Liu, Guan Wang, Mingli Yuan, William Chen, Sen Song

机构 * Sapient Intelligence University of Alberta(阿尔伯塔大学) Tsinghua University(清华大学)

AI总结 本文提出Focus方法,通过学习重要token对来优化注意力机制,实验证明在不同模型规模和架构下均无性能下降,并在速度和质量上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02731 2026-04-30 cs.SD cs.CV cs.MM

Omni2Sound: Towards Unified Video-Text-to-Audio Generation

Omni2Sound:迈向统一的视频-文本到音频生成

Yusheng Dai, Zehua Chen, Yuxuan Jiang, Baolong Gao, Qiuhong Ke, Jianfei Cai, Jun Zhu

机构 * Tsinghua University(清华大学) Monash University(莫纳什大学) Shengshu AI(盛数人工智能)

AI总结 本文提出Omni2Sound模型,解决视频-音频、文本-音频及联合视频-文本-音频生成中的数据稀缺与任务竞争问题,通过SoundAtlas数据集和三阶段训练策略实现统一生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08547 2026-04-30 cs.RO cs.CV

R2RGEN: Real-to-Real 3D Data Generation for Spatially Generalized Manipulation

R2RGEN:用于空间通用操作的实现实体3D数据生成

Xiuwei Xu, Angyuan Ma, Hankun Li, Bingyao Yu, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing Key Laboratory of Embodied Intelligence Systems(北京智能体智能系统重点实验室) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学智能体与机器人研究院) GigaAI

AI总结 本文提出R2RGen框架,通过实现实体3D数据生成提升空间通用操作的鲁棒性,采用统一三阶段方法增强数据效率,适用于移动操作场景。

Comments Accepted to RSS 2026. Project page: https://r2rgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05907 2026-04-30 cs.RO

EvolvingAgent: Curriculum Self-evolving Agent with Continual World Model for Long-Horizon Tasks

EvolvingAgent: 基于持续世界模型的课程自进化代理用于长周期任务

Tongtong Feng, Xin Wang, Zekai Zhou, Ren Wang, Yuwei Zhan, Guangyao Li, Qing Li, Wenwu Zhu

机构 * Department of Computer Science and Technology, Beijing National Research Center for Information Science and Technology, Tsinghua University(计算机科学与技术系,北京信息科学与技术国家研究中心,清华大学) Department of Computer Science, University of Sydney(计算机科学系,悉尼大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

AI总结 本文提出EvolvingAgent,通过持续世界模型实现自主完成长周期任务,采用任务规划、动作控制和反思模块,提升Minecraft和Atari环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13729 2026-04-30 cs.LG cs.AI cs.CV cs.GR

ComboStoc: Combinatorial Stochasticity for Diffusion Generative Models

ComboStoc: 差分生成模型中的组合随机性

Rui Xu, Jiepeng Wang, Hao Pan, Yang Liu, Xin Tong, Shiqing Xin, Changhe Tu, Taku Komura, Wenping Wang

机构 * The University of Hong Kong Work partially done at MSRA. † Corresponding authors. China The University of Hong Kong China Tsinghua University China Microsoft Research Asia China Shandong University China Texas A\&M University USA The University of Hong Kong Tsinghua University Microsoft Research Asia Shandong University Texas A\&M University

AI总结 本文研究了差分生成模型中未被充分探索但重要的组合复杂性问题,提出 ComboStoc 方法通过构建随机过程充分利用组合结构,提升训练效率并实现测试时生成的灵活控制。

Comments ACM Transactions on Graphics, SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25806 2026-04-29 cs.CL cs.AI cs.HC

MAIC-UI: Making Interactive Courseware with Generative UI

MAIC-UI: 用生成式UI制作交互式课程ware

Shangqing Tu, Yanjia Li, Keyu Chen, Sichen Zhang, Jifan Yu, Daniel Zhang-Li, Lei Hou, Juanzi Li, Yu Zhang, Huiqin Liu

机构 * Tsinghua University(清华大学) Guangzhou University(广州大学) Zhejiang University(浙江大学)

AI总结 MAIC-UI通过零代码系统实现教育者快速编辑交互式课程ware,采用多模态知识分析、生成-验证-优化流程和点击定位编辑技术,提升教学效果和学习公平性。

Comments You can try our demo at https://open.maic.chat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25636 2026-04-29 cs.CV

Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models

通过再生进行细化:扩大修改空间提升统一多模态模型中的图像细化

Jiayi Guo, Linqing Wang, Jiangshan Wang, Yang Yue, Zeyu Liu, Zhiyuan Zhao, Qinglin Lu, Gao Huang, Chunyu Wang

机构 * Tsinghua University(清华大学) Tencent HY(腾讯HY)

AI总结 本文提出通过再生进行细化的新框架,通过扩大修改空间提升统一多模态模型的图像细化效果,实验表明在多个基准测试中性能显著提升。

Comments GitHub: https://github.com/LeapLabTHU/RvR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24796 2026-04-29 q-bio.OT cs.LG

A multi-stage soft computing framework for complex disease modelling and decision support: A liver cirrhosis case study

一种多阶段软计算框架用于复杂疾病建模和决策支持:肝硬化案例研究

Xueyuan Huang, Yuheng Wang, Yuanzhi He, Siqi Gou, Lu Bai, Wenqian Wu, Peifeng Liu, Aijia Wang, Tianhui Fan, Ze Zhou, Jiayu Xu

机构 * organization= Department of Hepatobiliary Surgery, the Second Affiliated Hospital of Chongqing Medical University , city= Chongqing , postcode= 400010 , country= China organization= State Key Laboratory of Respiratory Health Multimorbidity, Institute of Basic Medical Sciences \& School of Basic Medicine, Chinese Academy of Medical Sciences \& Peking Union Medical College , city= Beijing , postcode= 100005 , country= China organization= School of Computer Science Informatics, Cardiff University , city= Wales , postcode= CF24 0DE , country= United Kingdom organization= Department of Medical Oncology, the First Hospital of China Medical University , city= Shenyang , postcode= 110001 , country= China organization= Institute for Innovation Development, Tsinghua University , city= Beijing , postcode= 100086 , country= China organization= Department of Liver Surgery, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences \& Peking Union Medical College , city= Beijing , country= China

AI总结 本文提出一种多阶段软计算框架,用于复杂疾病建模与治疗探索,通过整合单细胞转录组数据、高维网络特征稳定化、多模型学习和深度表征学习,提升肝硬化等复杂疾病的诊断与治疗决策能力。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19709 2026-04-29 cs.SD cs.AI

Hyperbolic Additive Margin Softmax with Hierarchical Information for Speaker Verification

双曲加法边距软max与层次信息的说话人验证

Zhihua Fang, Liang He

机构 * School of Computer Science and Technology(计算机科学与技术学院) Xinjiang University(新疆大学) Xinjiang Multimodal Information Technology Engineering Research Center(新疆多模态信息处理工程技术研究中心) School of Intelligence Science and Technology(智能科学与技术学院) Department of Electronic Engineering(电子工程系) Tsinghua University(清华大学)

AI总结 本文提出基于双曲空间的H-Softmax和HAM-Softmax,通过投影嵌入和说话人中心到双曲空间并计算双曲距离,提升说话人特征的层次信息建模能力,实验表明其在说话人验证中显著降低EER。

Comments 5 pages, 3 figures, Accepted at ICASSP 2026

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06757 2026-04-29 cs.SD cs.CV

XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice Association

XM-ALIGN:面向人脸-语音关联的统一跨模态嵌入对齐框架

Zhihua Fang, Shumei Tao, Junxu Wang, Liang He

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Xinjiang Multimodal Information Technology Engineering Research Center(新疆多模态信息处理工程技术研究中心) Urumqi Branch, China Mobile Group Xinjiang Co., Ltd(中国移动新疆乌鲁木齐分公司) School of Intelligence Science and Technology, Xinjiang University(新疆大学智能科学与技术学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 本文提出XM-ALIGN框架,通过显式与隐式对齐机制提升跨模态验证性能,采用共享分类器联合优化人脸与语音嵌入,并通过数据增强提升泛化能力。

Comments FAME 2026 Technical Report

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20211 2026-04-29 cs.CV cs.AI

OmniAlpha: Aligning Transparency-Aware Generation via Multi-Task Unified Reinforcement Learning

OmniAlpha:通过多任务统一强化学习对透明度感知生成进行对齐

Hao Yu, Jinglin Wang, Jiabo Zhan, Rui Chen, Zile Wang, Huaisong Zhang, Hongyu Li, Xinrui Chen, Yongxian Wei, Chun Yuan

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

AI总结 OmniAlpha通过多任务统一强化学习框架,解决透明度感知生成中RGB外观、alpha透明度和跨层合成的建模问题,提升RGBA生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25427 2026-04-29 cs.CV

A Systematic Post-Train Framework for Video Generation

视频生成的系统性后训练框架

Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

机构 * The University of Hong Kong(香港大学) JD Explore Academy(京东探索研究院) Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 本文提出系统性后训练框架,通过四个协同阶段提升视频生成的视觉质量、时间一致性和指令遵循性,同时保持预训练阶段的可控性。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20191 2026-04-29 cs.CV cs.AI cs.RO

From Scene to Object: Text-Guided Dual-Gaze Prediction

从场景到物体:文本引导的双目预测

Zehong Ke, Yanbo Jiang, Jinhao Li, Zhiyuan Liu, Yiqian Tu, Qingwen Meng, Heye Huang, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(Cho Chun Shik 移动研究生院,韩国科学技术院)

AI总结 本文提出双分支 gaze 预测框架,通过构建物体级数据集和改进模型架构,实现精准物体级注意力预测,提升语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11075 2026-04-29 cs.RO

RISE: Self-Improving Robot Policy with Compositional World Model

RISE:具有组合世界模型的自改进机器人策略

Jiazhi Yang, Kunyang Lin, Jinwei Li, Wencong Zhang, Tianwei Lin, Longyan Wu, Zhizhong Su, Hao Zhao, Ya-Qin Zhang, Li Chen, Ping Luo, Xiangyu Yue, Hongyang Li

机构 * The Chinese University of Hong Kong(香港中文大学) Kinetix AI The University of Hong Kong(香港大学) Shanghai Innovation Institute(上海创新研究院) Horizon Robotics Tsinghua University(清华大学)

AI总结 本文提出RISE框架,通过组合世界模型提升机器人策略鲁棒性,在动态砖块排序、背包打包和箱盖闭合任务中分别取得+35%、+45%和+35%的性能提升。

Comments RSS 2026. Project page: https://opendrivelab.com/RISE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10718 2026-04-29 cs.LG cs.CL

SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining

SnapMLA: 通过硬件感知的FP8量化流水线实现高效的长上下文MLA解码

Yifan Zhang, Zunhai Su, Shuhao Hu, Rui Yang, Wei Wu, Yulei Qian, Yuchen Xie, Xunliang Cai

机构 * Meituan LongCat Team(美团LongCat团队) Tsinghua University(清华大学)

AI总结 SnapMLA通过硬件感知的FP8量化流水线优化,提升长上下文解码效率,实验显示在长输出解码任务中吞吐量提升达1.91倍,同时在推理和代码生成基准上与BF16基线表现相近。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07348 2026-04-29 cs.CV

MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition

MICo-150K:一个多图像合成的综合数据集

Xinyu Wei, Kangrui Cen, Hongyang Wei, Zhen Guo, Kai Cui, Bairui Li, Zeqing Wang, Jinrui Zhang, Lei Zhang

机构 * Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) OPPO Research Institute(OPPO研究院)

AI总结 本文提出MICo-150K数据集,通过系统研究多图像合成任务,构建高质量图像和多样提示,结合人类反馈生成平衡的合成图像,同时建立评估基准和新指标,验证了数据集对模型提升的有效性。

Comments Project Page: https://MICo-150K.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05425 2026-04-29 cs.CV cs.AI

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

SIV-Bench:一种用于社会互动理解和推理的视频基准测试

Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出SIV-Bench,一个用于评估多模态大语言模型在社会场景理解、社会状态推理和社会动态预测能力的视频基准测试,揭示了现有模型在社会推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05199 2026-04-29 cs.CV

DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework

DEGround:一种有效的基于自身视角的3D视觉定位基线框架

Yani Zhang, Dongming Wu, Hao Shi, Yingfei Liu, Tiancai Wang, Xingping Dong

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Tsinghua University(清华大学)

AI总结 本文提出DEGround框架,通过统一的框架实现检测与定位的物体级共享,引入两个任务特定模块提升细粒度指令定位性能,实验表明在多个基准上表现最佳,尤其在EmbodiedScan数据集上精度提升显著。

Comments 1st place on EmbodiedScan visual grounding

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00712 2026-04-29 math.OC cs.AI cs.LG

On Finding Small Hyper-Gradients in Bilevel Optimization: Hardness Results and Improved Analysis

在双层优化中寻找小超梯度:难度结果与改进分析

Lesi Chen, Jing Xu, Jingzhao Zhang

机构 * IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai Qizhi Institute(上海启智研究院) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文研究了双层优化中寻找超目标 stationary 点的难度,证明在非凸-凸情况下零尊重算法不可行,并提出在满足PL条件的非凸-非凸问题中,通过简单一阶算法获得更优复杂度界。

Comments Published in COLT 2024. This arXiv version refines Assumption 4.1 (d); adds discussions on related works in Appendix A; and corrects the kappa dependency in the upper bounds

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.03886 2026-04-29 eess.SP cs.AI

Demo: Real-Time Semantic Communications with a Vision Transformer

演示:基于视觉Transformer的实时语义通信

Hanju Yoo, Taehun Jung, Linglong Dai, Songkuk Kim, Chan-Byoung Chae

机构 * School of Integrated Technology, Yonsei University(燕山大学整合技术学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 本文提出基于深度神经网络的图像传输架构,并通过FPGA原型在实时无线信道中验证其可行性,展示其在低信噪比下优于传统调制系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24625 2026-04-28 cs.CV cs.AI cs.LG cs.MM

Meta-CoT: Enhancing Granularity and Generalization in Image Editing

Meta-CoT:提升图像编辑的粒度与泛化能力

Shiyi Zhang, Yiji Cheng, Tiankai Hang, Zijin Yin, Runze He, Yu Xu, Wenxun Dai, Yunlong Lin, Chunyu Wang, Qinglin Lu, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Hunyuan, Tencent(腾讯 Hunyuan)

AI总结 Meta-CoT通过双重分解提升图像编辑的粒度和泛化能力,通过任务-目标-理解能力三元组分解和五元基本元任务训练策略,显著提高编辑性能。

Comments Accepted by CVPR2026, Project Page: https://shiyi-zh0408.github.io/projectpages/Meta-CoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24562 2026-04-28 cs.AI cs.CL cs.CY

Towards Lawful Autonomous Driving: Deriving Scenario-Aware Driving Requirements from Traffic Laws and Regulations

迈向合法自动驾驶:从交通法规中推导场景感知的驾驶要求

Bowen Jian, Rongjie Yu, Hong Wang, Liqiang Wang, Zihang Zou

机构 * College of Transportation, Tongji University(同济大学交通运输学院) The Key Laboratory of Road and Traffic Engineering, Ministry of Education(教育部道路与交通工程重点实验室) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) College of Computer Science, University of Central Florida(佛罗里达中央大学计算机科学学院) Optixway AI

AI总结 本文提出一种基于交通场景分类的新型方法,利用大语言模型推导法律要求,提升自动驾驶系统的合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24543 2026-04-28 cs.CV

RACANet: Reliability-Aware Crowd Anchor Network for RGB-T Crowd Counting

RACANet:面向RGB-T人群计数的可靠性感知人群锚网络

Jinghao Shi, Mengqi Lei, Kunliang He, Yun Li, Wei Bao, Siqi Li

机构 * School of Computer Science, China University of Geosciences, Wuhan(中国地质大学(武汉)计算机科学学院) School of Software, Tsinghua University(清华大学软件学院)

AI总结 本文提出RACANet,通过两阶段融合框架解决RGB-T人群计数中跨模态融合的可靠性建模问题,引入轻量级预训练和局部锚点融合模块,提升计数精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24146 2026-04-28 cs.CV

EXACT: an explainable anomaly-aware vision foundation model for analysis of 3D chest CT

EXACT:一种可解释的异常感知视觉基础模型,用于3D胸部CT分析

Xuguang Bai, Mingxuan Liu, Tongxi Song, Yifei Chen, Hongjia Yang, Kasidit Anmahapong, Zihan Li, Ying Zhou, Qiyuan Tian

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) Department of Radiology, Mianyang Central Hospital(绵阳市中心医院放射科) Center for Biomedical Imaging Research, Tsinghua University(清华大学生物医学成像研究中心)

AI总结 EXACT通过学习空间解析表示,提升3D胸部CT的异常检测与可解释性,优于现有医学基础模型,适用于多疾病诊断和报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23972 2026-04-28 cs.CL cs.AI cs.SC

Quantum Knowledge Graph: Modeling Context-Dependent Triplet Validity

量子知识图谱:建模依赖上下文的三元组有效性

Yao Wang, Zixu Geng, Jun Yan

机构 * HKAI-Sci, City University of Hong Kong(香港城市大学HKAI-Sci) Department of Automation, Tsinghua University(清华大学自动化系) Pratt School of Engineering, Duke University(德克萨斯大学达拉斯分校普拉特工程学院)

AI总结 本文提出量子知识图谱(QKG),通过将三元组有效性建模为上下文特定函数,提升医疗问答中事实适用性的判断,实验表明QKG在结合上下文匹配时显著提升验证效果。

Comments 15 pages main text, 6 pages appendix, 5 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23776 2026-04-28 cs.CV cs.AI

From Noisy Historical Maps to Time-Series Oil Palm Mapping Without Annotation in Malaysia and Indonesia (2020-2024)

从嘈杂的历史地图到无需标注的时间序列油棕映射:马来西亚和印度尼西亚(2020-2024)

Nuttaset Kuapanich, Juepeng Zheng, Bohan Shi, Jiaying Liu, Jiayin Jiang, Jiatao Huang, Shenghan Tan, Qingmei Li, Haohuan Fu

机构 * School of Artificial Intelligence, Sun Yat-Sen University, Zhuhai, China.(中山大学人工智能学院,中国珠海) National Supercomputing Center in Shenzhen, Shenzhen, China.(深圳国家超算中心,中国深圳) Khoury College of Computer Sciences, Northeastern University, Boston, United States of America.(东北大学计算机科学学院,美国波士顿) Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China.(清华大学深圳国际研究生院,中国深圳)

AI总结 本文提出利用哨兵-2影像生成高分辨率油棕种植园地图,通过优化的U-Net架构和DMI算法,在无需人工标注的情况下,实现了2020至2024年马来西亚和印度尼西亚的高精度监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23578 2026-04-28 cs.CL cs.AI

LLMs Reading the Rhythms of Daily Life: Aligned Understanding for Behavior Prediction and Generation

LLMs阅读日常生活节奏:行为预测与生成的对齐理解

Fanjin Meng, Jingtao Ding, Nian Li, Yizhou Sun, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,BNRist,清华大学)

AI总结 本文提出BUA框架,通过结构化课程学习将LLMs融入人类行为建模,提升行为预测与生成能力,实验证明其在复杂行为建模中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18471 2026-04-28 cs.LG

NI Sampling: Accelerating Discrete Diffusion Sampling by Token Order Optimization

基于令牌顺序优化的NI采样:通过令牌顺序优化加速离散扩散采样

Enshu Liu, Xuefei Ning, Yu Wang, Zinan Lin

机构 * Department of EE, Tsinghua University(清华大学电子工程系) Microsoft Research(微软研究院)

AI总结 本文提出NI采样方法,通过优化令牌采样顺序显著提升离散扩散模型的采样效率,实验表明在保持准确性的同时,加速效果达14.3倍。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏