arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-04 至 2026-05-04 共收录 183 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 13 篇

2512.01020 2026-05-04 cs.AI cs.CL 82%

Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics

用法律问题树准则评估法律推理轨迹

Jinu Lee, Kyoung-Woon On, Simeng Han, Arman Cohan, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) LBOX Stanford(斯坦福) Yale(耶鲁)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出 LEGIT 数据集,用于评估 LLM 在法律领域推理轨迹的质量,发现法律问题覆盖度和正确性影响 LLM 推理能力,RAG 和带准则的 RL 分别提升整体能力与正确性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00020 2026-05-04 cs.LG cs.AI cs.IT eess.SP math.IT 81%

AirFM-DDA: Air-Interface Foundation Model in the Delay-Doppler-Angle Domain for AI-Native 6G

AirFM-DDA:用于AI原生6G的延迟-多普勒-角度域空气接口基础模型

Kejia Bian, Meixia Tao, Jianhua Mo, Zhiyong Chen, Leyan Chen

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, 200240, China(上海交通大学信息科学与电子工程学院,上海,200240,中国) Shanghai Innovation Institute, Shanghai 200231, China(上海创新研究院,上海200231,中国)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AirFM-DDA,一种在延迟-多普勒-角度域运作的空气接口基础模型,用于物理层任务,通过重新参数化CSI并引入帧结构感知位置编码,提升零样本泛化能力与计算效率。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00796 2026-05-04 cs.CR cs.AI cs.CL 73%

When RAG Chatbots Expose Their Backend: An Anonymized Case Study of Privacy and Security Risks in Patient-Facing Medical AI

当RAG聊天机器人暴露其后端:对患者面向医疗AI隐私和安全风险的匿名案例研究

Alfredo Madrid-García, Miguel Rujas

机构 * Independent researcher(独立研究者) Escuela Técnica Superior de Ingenieros de Telecomunicación Universidad Politécnica de Madrid(电信工程学院理工大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究通过匿名案例分析,揭示了患者面向RAG聊天机器人中隐私和安全风险,指出通过浏览器工具可发现关键漏洞,强调部署前需独立审查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14259 2026-05-04 cs.IR cs.AI 70%

GenRecEdit: Adapting Model Editing for Generative Recommendation with Cold-Start Items

GenRecEdit:为生成推荐适应模型编辑以应对冷启动项目

Chenglei Shen, Teng Shi, Weijie Yu, Xiao Zhang, Jun Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学全球化人工智能学院) School of Information Technology and Management, University of International Business and Economics(国际经济贸易大学信息科学技术与管理学院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GenRecEdit通过模型编辑技术解决生成推荐中冷启动问题,通过迭代token级编辑和一对一触发机制提升冷启动项目推荐性能,仅需9.5%的训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00668 2026-05-04 cs.IT math.IT stat.CO 67%

SENECA: Small-Sample Discrete Entropy Estimation via Self-Consistent Missing Mass

SENECA: 通过自一致缺失质量进行小样本离散熵估计

Lucas H. McCabe, H. Howie Huang

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 SENECA提出一种基于自一致缺失质量计算的熵估计方法,解决小样本下因未观测支持集成员导致的系统性低估问题,在生物多样性估计和大语言模型检测中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00361 2026-05-04 cs.CY cs.AI 57%

Pedagogical Promise and Peril of AI: A Text Mining Analysis of ChatGPT Research Discussions in Programming Education

AI在教育中的教学潜力与风险:对编程教育中ChatGPT研究讨论的文本挖掘分析

Juvy C. Grume, John Paul P. Miranda, Aileen P. De Leon, Jordan L. Salenga, Hilene E. Hernandez, Mark Anthony A. Castro, Vernon Grace M. Maniago, Joel D. Canlas, Joel B. Quiambao

机构 * Pampanga State University(帕曼加州大学)

专题命中 领域大模型 :prompting(abstract);分类 cs.AI

AI总结 本文通过文本挖掘分析编程教育中ChatGPT的研究文献,揭示了教学实施、以学生为中心的学习、AI基础设施与人机协作、以及评估与模型评估四大主题,指出需加强评估与治理机制。

Comments 3 tables, 14 pages, book chapter

Journal ref Pedagogical Innovations in Computer Science Education, 2026, pp. 305-330

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 13 篇

2604.27345 2026-05-04 cs.CL 92%

LLMs Capture Emotion Labels, Not Emotion Uncertainty: Distributional Analysis and Calibration of Human-LLM Judgment Gaps

大型语言模型捕捉情绪标签而非情绪不确定性:人类与LLM判断差距的分布分析与校准

Keito Inoshita, Xiaokang Zhou, Akira Kawai, Katsutoshi Yada

机构 * Faculty of Business and Commerce(商科学院) Faculty of Business Data Science(商务数据科学学院) RIKEN Center for Advanced Intelligence Project(先进智能项目研究所) Faculty of Data Science(数据科学学院) Japan Safety Society Research Center(日本安全协会研究中心)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过对比人类标注与LLM在GoEmotions和EmoBank基准上的情绪判断分布,发现零样本模型与人类分布差异显著,需领域微调而非模型规模扩大以缩小差距,并提出三种轻量校准方法以提升情绪标注的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00885 2026-05-04 cs.CL cs.AI cs.LG 91%

Representation in large language models

大型语言模型中的表示

Cameron Yetman

机构 * University of Toronto(多伦多大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨大型语言模型是否通过基于表示的信息处理而非记忆和随机查找来工作,提出通过实践技术研究表示并发展解释,为未来理论提供基础。

Comments Preprint, forthcoming in Ergo: An Open Access Journal of Philosophy, 34 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22409 2026-05-04 cs.SE 89%

NOMAD: A Multi-Agent LLM System for UML Class Diagram Generation from Natural Language Requirements

NOMAD:一种多智能体LLM系统,用于从自然语言需求生成UML类图

Polydoros Giannouris, Sophia Ananiadou

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 NOMAD通过分解UML生成为多个角色专用子任务,提升可解释性并支持针对性验证。通过北风案例和人工UML练习评估,NOMAD在生成质量上优于基线模型,并揭示了细粒度属性提取的持续挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19175 2026-05-04 cs.NI cs.AI cs.MA 87%

LLM-Based Agentic Negotiation for 6G: Addressing Uncertainty Neglect and Tail-Event Risk

基于大语言模型的6G智能协商:解决不确定性忽视和尾事件风险

Hatim Chergui, Farhad Rezazadeh, Mehdi Bennis, Merouane Debbah, Christos Verikoukis

机构 * i2CAT Foundation(i2CAT基金会) Technical University of Catalonia(技术大学巴塞罗那) University of Oulu(奥卢大学) Research Institute for Digital Future(数字未来研究院) Khalifa University(卡利法大学) ISI/ATH and University of Patras(ISI/ATH和帕特拉斯大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一个无偏、风险意识的智能协商框架,通过数字孪生和极值理论中的条件风险价值(CVaR)预测尾部风险,提升6G网络切片的资源分配鲁棒性,验证了无偏方法在消除SLA违规和降低延迟方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00583 2026-05-04 cs.CV cs.AI cs.LG 86%

Jailbreaking Vision-Language Models Through the Visual Modality

通过视觉模态 jailbreak 视觉-语言模型

Aharon Azulay, Jan Dubiński, Zhuoyun Li, Atharv Mittal, Yossi Gandelsman

机构 * Warsaw University of Technology(华沙理工大学) NASK National Research Institute(波兰国家研究研究院) University of Liverpool(利物浦大学) Indian Institute of Technology Roorkee(印度理工学院拉胡尔分校) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 知识编辑与模型理解 :language model(title,abstract);post-training(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出四种利用视觉组件的 jailbreak 攻击,揭示了文本安全训练无法自动推广到视觉传达的有害意图,展示了视觉模态在安全对齐中的关键作用。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00323 2026-05-04 cs.CV cs.LG 83%

Online Self-Calibration Against Hallucination in Vision-Language Models

在线对抗幻觉的视觉-语言模型自我校准

Minghui Chen, Chenxu Yang, Hengjie Zhu, Dayan Wu, Zheng Lin, Qingyi Si

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);preference optimization(abstract);分类 cs.LG

AI总结 本文提出OSCAR框架,通过蒙特卡洛树搜索和双粒度奖励机制在线校准视觉-语言模型,减少幻觉并提升多模态能力。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27209 2026-05-04 cs.SE cs.AI 83%

Theory Under Construction: Orchestrating Language Models for Research Software Where the Specification Evolves

构建中的理论:协调语言模型用于研究软件,其中规范在演变

Halley Young, Nikolaj Björner

机构 * Microsoft Research(微软研究院)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出Comet-H框架,通过迭代提示自动机协调语言模型在研究软件中的应用,解决规范演变中的 hallucination accumulation 和 desynchronization 问题,并通过实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00607 2026-05-04 cs.CL eess.AS 79%

Beyond Decodability: Reconstructing Language Model Representations with an Encoding Probe

超越解码性:使用编码探针重建语言模型表示

Gaofei Shen, Martijn Bentum, Tom Lentz, Afra Alishahi, Grzegorz Chrupała

机构 * Tilburg University(蒂尔堡大学) Radboud University(拉德堡德大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出编码探针方法,用于重建语言模型内部表示,解决传统解码探针无法比较不同特征贡献和特征相关性影响的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21965 2026-05-04 cs.HC 78%

Cognitive Load Estimation Using Brain Foundation Models and Interpretability for BCIs

利用脑基础模型和可解释性进行认知负荷估计用于BCI

Deeksha M. Shama, Dimitra Emmanouilidou, Ivan J. Tashev

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 本文提出利用脑基础模型提取通用EEG特征以提高认知负荷估计的准确性,并通过Partition SHAP分析特征重要性,展示了其在BCI中的应用潜力。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 7221-7225

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00314 2026-05-04 cs.CR cs.AI cs.PL 70%

Semia: Auditing Agent Skills via Constraint-Guided Representation Synthesis

Semia:通过约束引导的表示合成审计代理技能

Hongbo Wen, Ying Li, Hanzhi Liu, Chaofan Shou, Yanju Chen, Yuan Tian, Yu Feng

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 Semia通过约束引导的表示合成技术,对代理技能进行静态审计,发现超过一半的技能存在关键语义风险,其召回率和F1值显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22271 2026-05-04 cs.LG 70%

How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals

大语言模型如何检测并纠正自身错误:内部置信信号的作用

Dharshan Kumaran, Viorica Patraucean, Simon Osindero, Petar Veličković, Nathaniel Daw

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究通过第二阶置信模型探讨大语言模型如何通过内部置信信号检测并纠正自身错误,发现PANL信号在误差检测和自我修正中起关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24169 2026-05-04 cs.CL 70%

Task Vectors, Learned Not Extracted: Performance Gains and Mechanistic Insight

任务向量,学习而非提取:性能提升与机理洞察

Haolin Yang, Hakaze Cho, Kaize Ding, Naoya Inoue

机构 * University of Chicago(芝加哥大学) JAIST Northwestern University(西北大学) RIKEN(日本研究机构) Tohoku University(东北大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出直接训练学习任务向量(LTVs),在准确性与灵活性上优于传统提取方法,并揭示了任务向量在计算中的机理作用,包括注意力头电路和线性传播特性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24164 2026-05-04 cs.CL 70%

Localizing Task Recognition and Task Learning in In-Context Learning via Attention Head Analysis

通过注意力头分析实现上下文学习中的任务识别与任务学习本地化

Haolin Yang, Hakaze Cho, Naoya Inoue

机构 * University of Chicago(芝加哥大学) Tohoku University(东北大学) RIKEN(日本研究机构) JAIST(日本产业技术综合研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过分析注意力头,提出任务子空间logit归因框架,揭示大语言模型在上下文学习中任务识别与任务学习的独立作用机制。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他LLM 14 篇

2605.00012 2026-05-04 cs.IR cs.AI cs.CL 92%

Exploring LLM biases to manipulate AI search overview

探索LLM偏见以操控AI搜索概述

Roman Smirnov

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 研究探索LLM偏见在AI搜索概述系统中的影响,通过强化学习优化搜索片段内容以操控结果,并发现偏见驱动相对优势而非绝对优势。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18315 2026-05-04 cs.SE cs.AI 90%

Effective LLM Code Refinement via Property-Oriented and Structurally Minimal Feedback

通过属性导向和结构最小反馈的有效LLM代码细化

Lehan He, Zeren Chen, Zhe Zhang, Xiang Gao, Lu Sheng

机构 * School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出属性生成求解器(PGS),通过属性导向和结构最小反馈提升LLM代码生成的正确性,实验显示PGS在pass@1和修复率上均优于其他TDD方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00087 2026-05-04 cs.NI cs.AI cs.CY cs.IR cs.LG 88%

DeGenTWeb: A First Look at LLM-dominant Websites

DeGenTWeb:对以大语言模型为主导的网站的首次观察

Sichang Steven He, Calvin Ardi, Ramesh Govindan, Harsha V. Madhyastha

机构 * University of Southern California(南加州大学)

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过DeGenTWeb系统识别出大量由大语言模型生成内容的网站,发现其在Web中的普及率持续增长,但准确识别此类网站面临挑战。

Comments 6 pages, 6 figures, 13 page total; in submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00364 2026-05-04 cs.CL 83%

Unlearning What Matters: Token-Level Attribution for Precise Language Model Unlearning

撤销重要信息:针对语言模型精确撤销的标记级归因

Jiawei Wu, DouDou Zhou

机构 * Department of Statistics and Data Science, National University of Singapore(统计与数据科学系,新加坡国立大学)

专题命中 其他LLM :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出TokenUnlearn框架,通过标记级归因实现精确撤销,结合知识意识信号和熵意识信号生成重要性评分,改进梯度信噪比,实验显示在遗忘效果和效用保持方面优于序列级基线。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00782 2026-05-04 cs.SE cs.AI 81%

GeoContra: From Fluent GIS Code to Verifiable Spatial Analysis with Geography-Grounded Repair

GeoContra:从流畅的GIS代码到可验证的空间分析与地理基础修复

Yinhao Xiao, Rongbo Xiao, Yihan Zhang

机构 * School of Big Data and Artificial Intelligence, Guangdong University of Finance and Economics(大数据与人工智能学院,广东财经大学) School of Geography and Environment Economics, Guangdong University of Finance & Economics(地理与环境经济学院,广东财经大学) Guangdong Engineering Research Center of Low-Altitude Remote Sensing Intelligent Monitoring(低空遥感智能监测工程研究中心)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 GeoContra通过验证和修复框架提升LLM驱动的GIS工作流空间正确性,通过静态检查、运行时验证和语义验证提高空间分析准确性,实验显示在多个模型上空间正确性显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06572 2026-05-04 cs.CR 80%

Parasites in the Toolchain: A Large-Scale Analysis of Attacks on the MCP Ecosystem

工具链中的寄生体:对MCP生态系统的大型分析

Shuli Zhao, Qinsheng Hou, Zihan Zhan, Yanhao Wang, Yuchong Xie, Yu Guo, Libo Chen, Shenghong Li, Zhi Xue

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究发现MCP生态中存在寄生工具链攻击,攻击者通过恶意指令渗透工具链,窃取隐私数据,揭示MCP缺乏安全隔离机制,需加强防御。

Comments Accepted by IEEE Symposium on Security and Privacy, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19622 2026-05-04 q-bio.NC 80%

Reassessing prediction in the brain: Pre-onset neural encoding during natural listening does not reflect pre-activation

重新评估大脑中的预测:自然听觉过程中预启动的神经编码不反映预激活

Sahel Azizpour, Britta U. Westner, Jakub Szewczyk, Umut Güçlü, Linda Geerligs

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究通过MEG和ECoG验证了自然听觉中预启动信号的神经编码,发现其可能反映刺激依赖而非预激活,同时揭示了后预测的神经活动特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00197 2026-05-04 cs.MA cs.AI 79%

The $\textit{Silicon Society}$ Cookbook: Design Space of LLM-based Social Simulations

硅社会食谱:基于大语言模型的社会模拟设计空间

Aurélien Bück-Kaeffer, Sneheel Sarangi, Maximilian Puelma Touzel, Reihaneh Rabbany, Zachary Yang, Jean-François Godbout

机构 * McGill University(麦吉尔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Ubisoft La Forge(育碧La Forge)

专题命中 其他LLM :LLM(title,abstract);分类 cs.AI

AI总结 研究如何通过大语言模型构建社会模拟网络,分析关键设计选择对模拟结果的影响,揭示设计空间的非平凡几何特性。

Comments 20 pages, 12 tables, under review at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00480 2026-05-04 cs.CV 78%

Leveraging Vision-Language Models as Weak Annotators in Active Learning

利用视觉语言模型作为弱标注器在主动学习中的应用

Phuong Ngoc Nguyen, Kaito Shiku, Ryoma Bise, Seiichi Uchida, Shinnosuke Matsuo

机构 * Kyushu University(九州大学)

专题命中 其他LLM :language model(title,abstract)

AI总结 本文提出结合细粒度人工标注与粗粒度VLM生成弱标注的主动学习框架,通过实例级标注分配和系统噪声建模,在CUB200和FGVC-Aircraft数据集上优于现有方法。

Comments Accepted at ICIP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00529 2026-05-04 cs.LG cs.AI cs.IR 73%

Hierarchical Abstract Tree for Cross-Document Retrieval-Augmented Generation

分层抽象树用于跨文档检索增强生成

Ziwen Zhao, Menglin Yang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Ψ-RAG框架,通过迭代'合并与坍缩'过程构建分层抽象树索引,并引入多粒度检索代理,解决传统树状RAG在跨文档多跳问题中的分布适应性、结构隔离和抽象粗粒度等挑战,实验表明其在跨文档多跳问答任务中表现更优。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13511 2026-05-04 cs.CV cs.IR 67%

Adapting MLLMs for Nuanced Video Retrieval

为精细化视频检索适应大语言模型

Piyush Bagad, Andrew Zisserman

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 本文提出一种统一嵌入模型,通过对比损失微调文本训练的多模态大语言模型,以处理视频检索中的时间、否定和多模态细微差别,实现最先进的检索性能。

Comments 38 Pages. Project page at http://bpiyush.github.io/tara-website

详情

展开后加载摘要…

URL PDF HTML 收藏