arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4556
2603.13258 2026-03-17 cs.LG cs.AI cs.SE

Your Code Agent Can Grow Alongside You with Structured Memory

你的代码代理可以与你一同成长,借助结构化记忆

Yi-Xuan Deng, Xiaoqin Liu, Yi Zhang, Guo-Wei Yang, Shuojin Yang

机构 * Tsinghua University(清华大学)

AI总结 本文提出MemCoder框架,通过结构化记忆和实时反馈实现人类与AI的持续共进化,提升代码代理在复杂软件工程任务中的性能。

Comments Code Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05092 2026-03-17 cs.LG cs.AI cs.CL

Aura: Universal Multi-dimensional Exogenous Integration for Aviation Time Series

Aura:通用多维外源整合用于航空时间序列

Jiafeng Lin, Mengren Zheng, Simeng Ye, Yuxuan Wang, Huan Zhang, Yuhui Liu, Zhongyi Pei, Jianmin Wang

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学) Hongshen College, Chongqing University(弘深学院、重庆大学) School of Software, Tsinghua University(软件学院、清华大学) China Southern Airlines(中国南方航空)

AI总结 本文提出Aura框架,通过整合多维外源因素提升航空时间序列预测精度,实验表明其在航空安全与可靠性方面具有广泛应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14727 2026-03-17 cs.LG

HyReaL: Clustering Attributed Graph via Hyper-Complex Space Representation Learning

HyReaL: 通过超复数空间表示学习进行属性图聚类

Junyang Chen, Yang Lu, Mengke Li, Cuie Yang, Yiqun Zhang, Yiu-ming Cheung

机构 * Tsinghua University(清华大学) Xiamen University(厦门大学) Shenzhen University(深圳大学) Northeastern University(东北大学) Hong Kong Baptist University(香港 Baptist大学)

AI总结 HyReaL通过引入超复数空间提升属性图聚类的表示学习,解决过平滑问题,增强属性耦合学习能力,无需过多图卷积层即可实现更有效的聚类。

Comments Accepted to DASFAA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12808 2026-03-16 cs.LG

A Multi-task Large Reasoning Model for Molecular Science

分子科学的多任务大规模推理模型

Pengfei Liu, Shuang Ge, Jun Tao, Zhixiang Ren

机构 * Pengcheng Laboratory(鹏城实验室) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院)

AI总结 本文提出多任务大规模推理模型,结合科学逻辑与深度学习,通过强化学习提升分子推理能力,在10项任务中实现50.3%的性能提升,验证了显式推理机制的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12796 2026-03-16 cs.CV

Spectral Defense Against Resource-Targeting Attack in 3D Gaussian Splatting

频谱防御对抗资源攻击在3D高斯点云中

Yang Chen, Yi Yu, Jiaming He, Yueqi Duan, Zheng Zhu, Yap-Peng Tan

机构 * Nanyang Technological University(南洋理工大学) UESTC Tsinghua University(清华大学) GigaAI VinUniversity(文大学)

AI总结 本文提出频谱防御方法,通过3D频率滤波和2D频谱正则化,有效抑制资源攻击导致的高斯点云过度增长,提升3DGS的鲁棒性、精度和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12793 2026-03-16 cs.CV cs.AI

Cheers: Decoupling Patch Details from Semantic Representations Enables Unified Multimodal Comprehension and Generation

Cheers:解耦补丁细节与语义表示以实现统一的多模态理解和生成

Yichen Zhang, Da Peng, Zonghao Guo, Zijian Zhang, Xuesong Yang, Tong Sun, Shichu Sun, Yidan Zhang, Yanghao Li, Haiyan Zhao, Wang Xu, Qi Shi, Yangang Sun, Chi Chen, Shuo Wang, Yukun Yan, Xu Han, Qiang Ma, Wei Ke, Liang Wang, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 Cheers通过解耦补丁细节与语义表示,实现统一的多模态理解和生成,提升图像生成的保真度,并在多个基准测试中表现优异,同时实现4倍的token压缩效率。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12743 2026-03-16 cs.CV cs.AI cs.CL

MoKus: Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization

MoKus: 利用跨模态知识迁移实现知识感知的概念定制

Chenyang Zhu, Hongxiang Li, Xiu Li, Long Chen

机构 * Tsinghua University(清华大学) HKUST(香港科技大学)

AI总结 本文提出MoKus框架,通过跨模态知识迁移实现知识感知的概念定制,解决稀有token在预训练数据中缺失导致的性能不稳定问题,并引入KnowCusBench基准测试,验证了方法在概念定制任务中的优越性。

Comments Project Page: https://chenyangzhu1.github.io/MoKus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12690 2026-03-16 cs.CV

CM-Bench: A Comprehensive Cross-Modal Feature Matching Benchmark Bridging Visible and Infrared Images

CM-Bench:一个综合的跨模态特征匹配基准,连接可见图像和红外图像

Liangzheng Sun, Mengfan He, Xingyu Shao, Binbin Li, Zhiqiang Yan, Chunyu Li, Ziyang Meng, Fei Xing

机构 * School of Instrument Science and Opto-Electronics Engineering, Beijing Information Science and Technology University(北京信息科技大学仪器科学与光电工程学院) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)

AI总结 本文提出CM-Bench,涵盖30种跨模态特征匹配算法,用于评估同源性估计、相对姿态估计和基于特征匹配的地理定位,包含自适应预处理和新的红外-卫星跨模态数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12686 2026-03-16 cs.RO

Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data

从不完美的人类运动数据中学习竞技型人形网球技能

Zhikai Zhang, Haofei Lu, Yunrui Lian, Ziqing Chen, Yun Liu, Chenghuai Lin, Han Xue, Zicheng Zeng, Zekun Qi, Shaolin Zheng, Qing Luan, Jingbo Wang, Junliang Xing, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Peking University(北京大学) Galbot Inc.(Galbot公司) Shanghai Qi Zhi Institute(上海启智研究所) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文提出LATENT系统,通过不完美的网球运动数据学习人形机器人网球技能,提升真实场景中的网球表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12630 2026-03-16 econ.TH cs.AI cs.CY cs.HC econ.EM

The Economics of AI Supply Chain Regulation

人工智能供应链监管的经济学

Sihan Qian, Amit Mehra, Dengpan Liu

机构 * School of Economics and Management, Tsinghua University(清华大学经济管理学院) Naveen Jindal School of Management, The University of Texas at Dallas(德克萨斯大学达拉斯分校纳文·金达尔管理学院)

AI总结 本文通过博弈模型分析AI供应链中政策干预对消费者剩余的影响,发现促进价格竞争的政策在高计算成本时有效,而促进质量竞争的政策始终提升消费者剩余。

Comments An earlier version of this paper, titled "The Economics of Fine-Tuning for Large-Scale AI Models," was presented at WISE 2023, where it won the Best Student Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12576 2026-03-16 cs.LG

A Spectral Revisit of the Distributional Bellman Operator under the Cramér Metric

对Cramér度量下分布贝尔曼算子的谱再审视

Keru Wang, Yixin Deng, Yao Lyu, Stephen Redmond, Shengbo Eben Li

机构 * School of Electrical and Electronic Engineering, University College Dublin(电子工程学院) School of Vehicle and Mobility, Tsinghua University(车辆与移动技术学院) College of Artificial Intelligence, Tsinghua University(人工智能学院)

AI总结 本文研究分布强化学习中贝尔曼更新对分布的影响,通过Cramér度量分析贝尔曼算子的收缩性质,构建正则化谱希尔伯特表示以实现CDF层级几何结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18632 2026-03-16 cs.CV cs.AI

Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views

用3D思考:从有限视角出发的几何想象引导的空间推理

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xufang Luo, Mingze Sun, Zihao Pan, Xiang An, Yan Feng, Peng Pei, Xunliang Cai, Ruqi Huang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Meituan(美团) National University of Singapore(新加坡国立大学) Beihang University(北航) LMMs-Lab(LMMs实验室)

AI总结 本文提出3DThinker框架,通过利用图像中的丰富几何信息实现空间推理,无需3D先验输入或显式标注3D数据,在多个基准测试中优于现有方法。

Comments 25 pages, 17 figures

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16225 2026-03-16 cs.SD eess.AS

AeroGPT: Leveraging Large-Scale Audio Model for Aero-Engine Bearing Fault Diagnosis

AeroGPT:利用大规模音频模型进行航空发动机轴承故障诊断

Jiale Liu, Dandan Peng, Huan Wang, Chenyu Liu, Yan-Fu Li, Min Xie

机构 * School of Physics and Astronomy, The University of Edinburgh(爱丁堡大学物理与天文学学院) Glasgow College, University of Electronic Science and Technology of China(电子科技大学格拉斯哥学院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) School of Mechanical Engineering, Northwestern Polytechnical University(西北工业大学机械工程学院) Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) City University of Hong Kong Shenzhen Research Institute(香港城市大学深圳研究院)

AI总结 本文提出AeroGPT框架,通过迁移通用音频知识到航空发动机轴承故障诊断,结合振动信号对齐和生成故障分类,实现无需后处理的可解释故障诊断,实验验证其在航空发动机轴承数据集上的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12201 2026-03-13 cs.CL cs.LG

IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse

IndexCache: 通过跨层索引复用加速稀疏注意力

Yushi Bai, Qian Dong, Ting Jiang, Xin Lv, Zhengxiao Du, Aohan Zeng, Jie Tang, Juanzi Li

机构 * Tsinghua University(清华大学)

AI总结 IndexCache通过跨层索引复用减少75%的计算量,提升预填和解码速度,有效优化稀疏注意力效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11650 2026-03-13 cs.CL

QChunker: Learning Question-Aware Text Chunking for Domain RAG via Multi-Agent Debate

QChunker: 通过多智能体辩论学习问题感知的文本分块以实现领域RAG

Jihao Zhao, Daixuan Li, Pengfei Li, Shuaishuai Zu, Biao Qin, Hongyan Liu

机构 * School of Information, Renmin University of China(中国人民大学信息学院) School of Smart Governance, Renmin University of China(中国人民大学智能治理学院) School of Information, BRAIN, Renmin University of China(中国人民大学信息学院、BRAIN学院) School of Economics and Management, Tsinghua University(清华大学经济管理学院)

AI总结 QChunker通过多智能体辩论框架,提升RAG中文本分块的语义完整性和信息粒度,采用ChunkScore评估指标,实现更高效高质量的文本分块生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11640 2026-03-13 cs.CV cs.AI

Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans

分词使多模态大语言模型能够理解、生成和编辑建筑平面图

Sizhong Qin, Ramon Elias Weber, Xinzheng Lu

机构 * Tsinghua University(清华大学) UC Berkeley(伯克利大学)

AI总结 HouseMind通过引入离散房间实例标记,实现了建筑平面图的统一理解和生成,具备高效且可控的布局生成能力。

Comments 20 pages, 9 figures. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11632 2026-03-13 cs.HC cs.RO

From Pets to Robots: MojiKit as a Data-Informed Toolkit for Affective HRI Design

从宠物到机器人:MojiKit作为影响性人机交互设计的数据驱动工具包

Liwen He, Pingting Chen, Ziheng Tang, Yixiao Liu, Jihong Jeung, Teng Han, Xin Tong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Sichuan University(四川大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 MojiKit通过结合结构化参考卡片、拟人化机器人原型和行为控制工作室,为影响性人机交互设计提供数据驱动的系统化工具,帮助用户设计更多样化的机器人影响性行为。

Comments 25 pages, 11 figures, Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11619 2026-03-13 cs.CR cs.AI

Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threats

驯服OpenClaw:自主LLM代理威胁的分析与缓解

Xinhao Deng, Yixiang Zhang, Jiaqing Wu, Jiaqi Bai, Sibo Yi, Zhuoheng Zou, Yue Xiao, Rennai Qiu, Jianan Ma, Jialuo Chen, Xiaohu Du, Xiaofang Yang, Shiwen Cui, Changhua Meng, Weiqiang Wang, Jiaxing Song, Ke Xu, Qi Li

机构 * Ant Group & Tsinghua University(蚂蚁集团与清华大学) Tsinghua University(清华大学)

AI总结 本文分析了自主LLM代理OpenClaw的安全威胁,提出五层安全框架,揭示现有防御机制的不足,并提出包括插件审查、上下文过滤等在内的综合防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11554 2026-03-13 cs.CV cs.AI cs.RO

MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg-horizon tasks

MANSION: 多楼层语言到3D场景生成用于长周期任务

Lirong Che, Shuo Wen, Shan Huang, Chuang Wang, Yuzhe Yang, Gregory Dudek, Xueqian Wang, Jian Su

机构 * Tsinghua University(清华大学) AgiBot McGill University, MILA - Quebec AI Institute(麦吉尔大学,魁北克人工智能研究所)

AI总结 MANSION是首个多楼层语言驱动的3D场景生成框架,能生成真实可导航的建筑环境,支持跨楼层长周期任务的开发与评估,同时配套发布MansionWorld数据集和任务语义编辑代理,为空间推理和规划提供关键测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11543 2026-03-13 cs.CV

Mango-GS: Enhancing Spatio-Temporal Consistency in Dynamic Scenes Reconstruction using Multi-Frame Node-Guided 4D Gaussian Splatting

Mango-GS: 通过多帧节点引导的4D高斯散射提升动态场景重建的空间-时间一致性

Tingxuan Huang, Haowei Zhu, Jun-hai Yong, Hao Pan, Bin Wang

机构 * School of Software, Tsinghua University(清华大学软件学院)

AI总结 Mango-GS通过多帧节点引导的4D高斯散射方法,提升动态场景重建的空间-时间一致性,实现高保真重建与实时渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24161 2026-03-13 cs.CV

GeoDiff4D: Geometry-Aware Diffusion for 4D Head Avatar Reconstruction

GeoDiff4D: 基于几何的扩散模型用于4D头像重建

Chao Xu, Xiaochen Zhao, Xiang Deng, Jingxiang Sun, Donglin Di, Zhuo Su, Yebin Liu

机构 * Tsinghua University(清华大学) Li Auto(利亚自动)

AI总结 GeoDiff4D通过几何感知扩散模型,结合表面法线和表情编码器,实现了高保真的4D头像重建,提升了视觉质量和跨身份泛化能力。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20197 2026-03-13 cs.LG cs.AI

Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning

混合策略强化学习可调节探索用于多模态推理

Zhuoxu Huang, Mengxi Jia, Hao Sun, Xuelong Li, Jungong Han

机构 * Aberystwyth University(阿伯里斯特维斯大学) Institute of Artificial Intelligence (TeleAl)(人工智能研究所) China Telecom(中国电信) Tsinghua University(清华大学)

AI总结 本文提出CalibRL框架,通过分布感知优势加权和非对称激活函数实现可控探索,提升多模态推理模型的探索与利用平衡。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07791 2026-03-13 cs.CV

GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models

GTR-Bench:评估视觉-语言模型中的地理时间推理

Qinghongbing Xie, Zhaoyuan Xia, Feng Zhu, Lijun Gong, Ziyue Li, Rui Zhao, Long Zeng

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Peking University(北京大学) Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所)

AI总结 GTR-Bench提出了一种新的基准,用于评估视觉-语言模型在地理时间推理中的能力,揭示了现有模型在空间和时间上下文利用、时间预测能力及地图数据整合方面的不足。

Comments ICLR 2026, 31 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05806 2026-03-13 cs.CV

Image Segmentation via Variational Model Based Tailored UNet: A Deep Variational Framework

基于变分模型的定制UNet图像分割:一种深度变分框架

Kaili Qi, Wenli Yang, Ye Li, Zhongyi Huang

机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) School of Mathematics, China University of Mining and Technology(中国矿业大学数学学院)

AI总结 本文提出VM_TUNet框架,结合变分模型与UNet,通过数据驱动操作和定制有限点法提升图像分割精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09940 2026-03-13 cs.LG

TianQuan-S2S: A Subseasonal-to-Seasonal Global Weather Model via Incorporate Climatology State

天quant-S2S:通过整合气候状态构建全球亚季节至季节天气模型

Guowen Li, Xintong Liu, Yang Liu, Mengxuan Chen, Shilei Cao, Xuehe Wang, Juepeng Zheng, Jinxiao Zhang, Haoyuan Liang, Lixian Zhang, Jiuke Wang, Meng Jin, Hong Cheng, Haohuan Fu

机构 * Sun Yat-Sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) Huawei Technologies Co Ltd(华为技术有限公司)

AI总结 天quant-S2S通过整合气候状态和不确定性增强的Transformer,提升了亚季节至季节天气预测的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10921 2026-03-12 cs.SD

Training-Free Multi-Step Inference for Target Speaker Extraction

无需训练的多步推理用于目标说话人提取

Zhenghai You, Ying Shi, Lantian Li, Dong Wang

机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学,中国) Center for Speech and Language Technologies, BNRist, Tsinghua University, China(语音与语言技术中心,北京理工大学,中国)

AI总结 本文提出无需训练的多步推理方法,用于目标说话人提取,通过联合度量优化平衡不同评估目标,提升实际应用中的提取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10887 2026-03-12 cs.LG cs.AI

Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models

动态预测采样用于主动强化学习微调大推理模型

Yixiu Mao, Yun Qu, Qi Wang, Heming Zou, Xiangyang Ji

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 DPS通过动态预测方法减少回放成本,提升大推理模型的强化学习微调效率与性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10125 2026-03-12 cs.CV

4DEquine: Disentangling Motion and Appearance for 4D Equine Reconstruction from Monocular Video

4DEquine:从单目视频中解耦运动与外观进行4D马类重建

Jin Lyu, Liang An, Pujin Cheng, Yebin Liu, Xiaoying Tang

机构 * Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

AI总结 4DEquine通过解耦运动与外观重建,提出新框架实现高效4D马类重建,展示在真实数据集上的优越性能。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02873 2026-03-12 cs.CL

LaTeX Compilation: Challenges in the Era of LLMs

LaTeX编译:在大语言模型时代面临的挑战

Tianyou Liu, Ziqiang Li, Xurui Liu, Yu Wu, Yansong Li

机构 * Southern University of Science and Technology(南方科技大学) Alibaba(阿里巴巴) Tsinghua University(清华大学) Rutgers University(罗格斯大学) Liii Network(Liii网络)

AI总结 本文提出Mogan STEM作为替代TeX的结构编辑器,通过高效的数据结构和按需插件加载,在编译效率、生成语义和工具生态系统等方面优于TeX,并展示了其在LLM微调中的优势。

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19442 2026-03-12 cs.CV

UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment

UrbanAlign: 域内任务中VLM与人类偏好对齐的后处理语义校准

Yecheng Zhang, Rong Zhao, Zhizhou Sha, Yong Li, Lei Wang, Ce Hou, Wen Ji, Hao Huang, Yunshan Wan, Jian Yu, Junhao Xia, Yuru Zhang, Chunlei Shi

机构 * Tsinghua University(清华大学) University College London(伦敦大学学院) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学) Zhejiang University(浙江大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Renmin University of China(中国人民大学) Southeast University(东南大学)

AI总结 UrbanAlign通过后处理方法实现VLM与人类偏好的对齐,无需修改模型权重,提升领域任务的准确性和可解释性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏