arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-08-13 至 2026-08-13 共收录 7
2608.12220 2026-08-13 cs.CV cs.AI 新提交

SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward

SCOUT:通过结构化思维链与多目标过程奖励解锁增强型空间推理能力

Zile Zhou, Huining Yuan, Weichen Zhang, Xinlei Chen, Xiao-ping Zhang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 SCOUT是结合结构化思维链与多目标过程奖励的视觉-语言模型,通过定制数据集训练,在空间推理任务上超越基线模型与GPT-4o,且具备跨图像、视频的泛化能力。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12149 2026-08-13 cs.CL 新提交

Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus

混合线性注意力大语言模型中的大规模激活:注意力前峰值与峰间平台期

Zunhai Su, Bohan Sun, Xialie Zhuang, Shuibai Zhang, He Xiao, Jing Xiong, Hengyuan Zhang, Zhongzhu Zhou, Tiantian Zhang, Ngai Wong, Chuan-Wei Kuo

机构 * Startlux(星创公司) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) University of Sydney(悉尼大学) Columbia University(哥伦比亚大学)

AI总结 本研究系统揭示混合线性注意力大语言模型中大规模激活的两种形态,证实其在多架构、多配置等场景下的重复性,明确其对输出门控的响应规律及机制,为相关模型优化提供依据。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11981 2026-08-13 cs.CL 新提交

Benchmarking Trustworthiness of SLMs: Pre-trained vs. Compressed

小型语言模型(SLM)的可信性基准测试:预训练模型与压缩模型的对比

Haokun Lin, Kaijie Zhu, Haobo Xu, Yichen Wu, Zhichao Lu, Qingfu Zhang, Zhenan Sun

机构 * Institute of Automation, CAS(中国科学院自动化研究所) Tsinghua University(清华大学) Harvard Medical School(哈佛医学院) City University of Hong Kong(香港城市大学)

AI总结 本研究评估SLM的可信性,发现量化压缩预训练模型比剪枝更能保留可信性,且量化压缩可靠大模型得到的SLM比从头训练的小型模型更优,知识蒸馏可进一步提升其可靠性。

Comments Published in IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11938 2026-08-13 cs.CV 新提交

Surfsvr: 2D Surface Priors as 3D Geometric Regularizers for Sparse Voxel Reconstruction

Surfsvr:将2D表面先验作为稀疏体素重建的3D几何正则化项

Yan Di, Chengxi Li, Yaoxing Wang, Mengge Liu, Zhigang Li, Ruida Zhang, Mingyang Li, Pengyuan Wang, Shan Gao, Xiangyang Ji

机构 * HIT (Shenzhen)(哈尔滨工业大学(深圳)) Tsinghua University(清华大学) NWPU(西北工业大学) Beijing Institute of Control and Engineering(北京控制与工程研究所) Technical University of Munich(慕尼黑工业大学)

AI总结 SurfSVR将2D表面先验作为3D几何正则化项,通过结构化2D先验提升至3D约束重建,在3个公开基准上实现了稀疏体素重建的最优效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11913 2026-08-13 cs.CV 新提交

HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion

HarmoniDPO:基于偏好优化扩散模型的视频引导音频生成

Wenshuo Peng, Kaipeng Zhang

机构 * Tsinghua University(清华大学)

AI总结 本文提出HarmoniDPO框架,采用双视频表示、online-DPO微调及DDS算法,实现更精准的视频到音频生成,在音视频同步性与主观质量上优于现有最优方法。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11748 2026-08-13 cs.CV 新提交

Dual Modality Prompted Diffusion Priors for Zero Shot Hyperspectral Pansharpening

用于零样本高光谱 pansharpening 的双模态提示扩散先验

Pengwei Xie, Fei Zhu, Jiajun Li, Xiangyuan Liu, Xiangyuan Liu, Kangqing Shen, Gemine Vivone

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Peking University(北京大学) National Center for Applied Mathematics Shenzhen (NCAMS), Southern University of Science and Technology(南方科技大学深圳应用数学国家中心) Department of Automation, Tsinghua University(清华大学自动化系) National Research Council of Italy, Institute of Integrated Methodologies for Earth Observation (CNR-IMIOT)(意大利国家研究委员会综合地球观测方法研究所)

AI总结 该研究针对零样本高光谱 pansharpening 问题,提出双模态提示扩散模型 DIDM,通过双模态提示注入与全色引导正则化实现空间细节与光谱保真的平衡,在多数据集实验中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11690 2026-08-13 cs.LG stat.ML 新提交

Drift and Dependence: Layer-wise Information-Theoretic Bounds for Replay-Based Continual Learning

漂移与依赖:基于重放的持续学习的分层信息论边界

Tieliang Gong, Zhongbo Zhang, Wen Wen, Yong-Jin Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 该研究提出分层信息论框架,分解重放式持续学习的泛化差距,通过Wasserstein松弛和SGLD实例化实现可操作的边界,经实验验证了相关预测。

详情

展开后加载摘要…

URL PDF HTML 收藏