arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-07-29 至 2026-07-29 共收录 12
2607.26056 2026-07-29 cs.RO 新提交

INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models

INTACT:用于无搜索世界模型的同构意图到动作学习

Junhan Sun, Hao Zhao, Guofeng Zhang

机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) InSpatio

AI总结 研究针对前向潜在世界模型恢复动作需昂贵搜索的问题,提出INTACT方法,通过特定架构和技术实现意图到动作学习,在多任务上取得高成功率,减少采样并提升性能,还具有快速推理能力。

Comments 28 pages, 11 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25993 2026-07-29 cs.CV 新提交

Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

超越缩放:学习用于超高分辨率遥感的多工具视觉推理

Fengxiang Wang, Jiangnan Huang, Mingshuo Chen, Yueying Li, Yang Shi, Junwei Luo, Haoyu Wang, Yansheng Li, Jing Zhang, Haiyan Zhao, Wenjing Yang

机构 * National University of Defense Technology(国防科技大学) Wuhan University(武汉大学) Tsinghua University(清华大学)

AI总结 针对超高分辨率遥感图像给多模态大语言模型带来的挑战,提出GeoMTVR数据集,结合监督微调与以工具注意力为重点的强化学习算法开发GeoLens,实验证明其在多工具视觉推理方面优于直接推理和单工具放大基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25962 2026-07-29 cs.CV 新提交

LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection

LaP-Forensics:用于深度伪造检测的潜在像素一致性引导的多模态推理

Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen

机构 * The Hong Kong Polytechnic University(香港理工大学) University College London(伦敦大学学院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学)

AI总结 研究针对深度伪造检测问题,提出LaP-Forensics多模态框架,利用基于重建的取证证据及结构化模型预测,经组相对策略优化,实现跨生成器检测和伪影定位,实验验证了残差流效用,但后处理下文本忠实性和可靠性有局限。

Comments Accepted at ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25675 2026-07-29 cs.AI 新提交

DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

DecoEvo:文本空间中求解器与评分标准生成器技能的分数解耦协同进化

Jiangwang Chen, Zixin Song, Junlin Liu, Shuaiyu Zhou, Haiyan Wu, Haihan Shi, Chenxi Zhou, Hanqing Li, Xiao Yang, Da Zhu, Guanjun Jiang, Hai Wan, Xibin Zhao

机构 * Tsinghua University(清华大学) Qwen Business Unit of Alibaba(阿里巴巴的通义业务部) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

AI总结 研究文本空间优化中现有方法瓶颈,提出DecoEvo方法,通过解耦目标协同进化求解器与评分标准生成器技能,不依赖黄金评分标准,在多基准和大语言模型主干上表现优异,有显著相对增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25614 2026-07-29 cs.LG cs.CL 新提交

MemSFT: Mitigating Alignment Tax with an External Parametric Memory

MemSFT:使用外部参数内存减轻对齐代价

Jiarui Wang, Xiang Shi, Jiaqi Cao, Rubin Wei, Xiquan Wang, Hao Sun, Jingzhi Wang, Zhiqi Yang, Qipeng Guo, Bowen Zhou, Zhouhan Lin

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

AI总结 研究针对大语言模型应用于特定领域产生的对齐代价问题,提出MemSFT方法,通过参数内存解耦领域专业化与主干参数更新,经多领域多模型评估,能提升领域性能且通用性能下降小,实现通用与专业能力解耦。

Comments 33 pages, 11 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25380 2026-07-29 cs.CL 新提交

Memory for Large Language Models

大语言模型的记忆

Sining Zhoubian, Dan Zhang, Evgeny Kharlamov, Jie Tang

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Bosch AI(博世人工智能)

AI总结 综述对大语言模型中记忆这一基础架构维度进行系统分类,沿表示、更新动态、持久性三个正交轴表征记忆,形式化相关机制,阐明不同内存概念界限,分析混合架构等,为以记忆为中心的LLM设计及未来创新提供基础。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25299 2026-07-29 cs.LG cs.AI 新提交

Retraction-Free Optimization over the Stiefel Manifold for the LoRA Fine-Tuning

用于LoRA微调的Stiefel流形上无回缩优化

Yuan Zhang, Jiang Hu, Zhijian Lai, Lin Lin, Zaiwen Wen

机构 * Center for Data Science, Peking University(北京大学数据科学中心) Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Department of Mathematics, University of California, Berkeley(美国加州大学伯克利分校数学系) Center for Machine Learning Research and Changsha Institute for Computing and Digital Economy, Peking University(北京大学机器学习研究中心和长沙计算与数字经济研究院)

AI总结 研究针对Stiefel流形优化中现有方法的问题,提出无回缩且无惩罚参数算法,利用相关特性建立收敛保证。将LoRA微调问题转为流形优化问题,引入Manifold-LoRA,经实验验证其在加速训练及下游性能方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25270 2026-07-29 cs.CL cs.AI cs.LG 新提交

Where Steering Signals Come From: Activation Source Selection in Activation Steering

转向信号来自何处:激活转向中的激活源选择

Jiaran Ye, Lingxu Ran, Zijun Yao, Chenpeng Wang, Yong Jiang, Lei Hou, Juanzi Li, Liangming Pan

机构 * Peking University(北京大学) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) YiXin-AILab(易信人工智能实验室)

AI总结 研究激活转向中转向信号的来源选择,通过实验表明改变源激活会影响转向成功率,有效转向信号来自执行边界状态,基于此提出尾部减法,揭示转向取决于模型即将做的事而非已出现的内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24889 2026-07-29 cs.LG cs.AI cs.CE 新提交

GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

GAUGE:在没有标准答案的情况下对代理构建的金融模型进行评分

Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yijia He, Jing Li, Daxin Jiang, Zuo Bai, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) University of Adelaide(阿德莱德大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Peking University(北京大学)

AI总结 研究针对金融模型无标准答案的问题,引入GAUGE基准,依据分析师实际做法评估代理构建的估值模型,通过多种方式验证,揭示高级、初级分析师及学生在模型评分上的差异,指出当前代理在模型构建与估值判断上的强弱情况,并发布相关资源。

Comments 35 pages, including appendices. Code, benchmark materials, and evaluation artifacts will be publicly released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24885 2026-07-29 cs.LG cs.AI 新提交

Eliminating Propagation Delay: Attention-Based Spatial-Temporal Fusion Graph Convolution Network for Traffic Flow Prediction

消除传播延迟:基于注意力的时空融合图卷积网络用于交通流预测

Jinpeng Chen, Ziyu Yu, Tao Wang, Jun Ma, Hongbo Gao, Senzhang Wang, Zufeng Zhang, Kaimin Wei

机构 * School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(北京邮电大学计算机学院(国家示范性软件学院)) Department of Automation, School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院自动化系) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Department of Automation, Tsinghua University(清华大学自动化系) College of Information Science and Technology, Jinan University(暨南大学信息科学技术学院)

AI总结 针对交通流预测,提出基于注意力的时空融合图卷积网络(A-STFGCN),设计时空融合块,通过掩码矩阵多头自注意力机制提取特征相关性,去除传播延迟误差,实验表明该方法相比基线方法性能最佳,效率良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24856 2026-07-29 cs.CV cs.AI 新提交

DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization

DisasterTD:使用多模态大语言模型和跨视角地理定位的灾害地名消歧

Wenping Yin, Ziqi Liu, Naixia Mou, Weijia Li, Danfeng Hong, Hao Li

机构 * College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院) School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Automation, Southeast University(东南大学自动化学院) Department of Geography, National University of Singapore(新加坡国立大学地理系)

AI总结 研究针对社交媒体图像地理参考模糊问题,提出DisasterTD框架,集成多模态大语言模型语义推理与跨视角地理定位,在飓风哈维数据集上评估,该方法优于基线,能有效进行细粒度灾害地理定位,提升不同距离下的定位准确率并减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24777 2026-07-29 cs.AI cond-mat.mtrl-sci cs.LG 新提交

Steering topology distributions for unified generative design of architected metamaterials

用于结构化超材料统一生成设计的引导拓扑分布

Haolin Li, Yuyang Miao, Menglei Li, Jinshuai Bai, Liyuan Wang, Xin Liu, Bo Gao, Jiantao Liu, Danilo Mandic, Zahra Sharif Khodaei, M. H. Aliabadi, Weiqiu Chen

机构 * Imperial College London(伦敦帝国理工学院) Tsinghua University(清华大学) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学) Southwest Jiaotong University(西南交通大学) Ningbo University(宁波大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究结构化超材料设计问题,提出GenTO统一框架,通过训练扩散模型并引导拓扑分布,能为异构任务重用拓扑先验,保留结构多样性,获高性能方案,确立拓扑知识为超材料设计统一原则。

详情

展开后加载摘要…

URL PDF HTML 收藏