arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-31 至 2026-07-31 共收录 349 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 81 篇

2607.28190 2026-07-31 cs.CL cs.AI 新提交 82%

The MADRS Pipeline: Supporting Depression Assessment in Clinical Trials

MADRS 流程:支持临床试验中的抑郁评估

Mila Fodor, Katalin Ócsai, Francesco Periti, Rien Sonck, Alex Boudreau

机构 * Clario, part of Thermo Fisher Scientific(赛默飞世尔科技旗下Clario)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究开发了一种 LLM 流程,可将临床试验的结构化音频访谈转换为文本,映射至 MADRS 10 项症状条目并评估严重程度,与专家评级整体相关性达 0.867,为抑郁评估提供可解释支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27268 2026-07-31 cs.SD 新提交 82%

Does EEG Foundation Models Transfer to Speech? A Benchmark on Overt and Imagined Speech Decoding

脑电基础模型能否迁移至语音?显性与想象语音解码的基准测试

Owais Mujtaba Khanday, Mohamed Baha Ben Ticha, Sanae Belfrouh, Marc Ouellet, Jose A. Gonzalez-Lopez

机构 * University of Granada, Spain(格拉纳达大学) Research Centre for Information and Communication Technologies (CITIC-UGR), Spain(信息与通信技术研究中心) University of Chouaib Doukkali, Morocco(舒艾卜·杜卡利大学) Brain, Mind, and Behavior Research Center (CIMCYC), University of Granada, Spain(大脑、心智与行为研究中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文开展首个脑电基础模型语音解码基准测试,对比LaBraM等模型与EEGNet等基线,发现通用脑电预训练未在语音任务上展现一致优势,为语音专用基础模型研究提供依据。

Comments 6 pages, 1 figure, 3 tables, submitted to IberSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28033 2026-07-31 cs.AI 新提交 81%

DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness

DataClawEval:面向真实工业场景的数据工程智能体基准测试

Debin Meng, Jiaming Yang, Zefang Zong, Tengyue Xu, Haining Xie, Yang Li, Peng Chen

机构 * Tencent(腾讯) Xidian University(西安电子科技大学) South China Normal University(华南师范大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DataClawEval是首个针对真实工业数据工程场景的智能体基准,含100项跨5种引擎的任务,用确定性脚本评分,评估16个前沿智能体发现最强模型仅得74.9分,自主数据工程仍是挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27953 2026-07-31 cs.LG 新提交 81%

AutoPref: Automatic Discovery of Task-Specific Preference Objectives for Neural Combinatorial Optimization

AutoPref:面向神经组合优化的任务特定偏好目标的自动发现

Shengda Gu, Kai Li, Xinyi Ke, Haobo Fu, Yifan Zhang, Jian Cheng

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 该研究提出首个LLM引导的AutoPref框架,将偏好目标分解为成对损失与集合感知加权程序,通过分阶段条件搜索策略实现自动发现,在TSP等四类组合优化问题上性能优于手动设计基线。

Comments 8pages, 2figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11015 2026-07-31 cs.AI 版本更新 81%

Numbers Beat Words: A Rigorous On-Premise Benchmark for Coupled MIMO Controller Tuning

从推理中获取结构,从搜索中获取数值:本地部署的开放大语言模型作为耦合MIMO控制器整定的结构先验

Yang Shu, Jiaxuan Chen, Haonan Li

机构 * Jinling Institute of Technology(金陵科技学院) College of Water Resources and Civil Engineering, China Agricultural University(中国农业大学水利与土木工程学院) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对强耦合MIMO过程,提出利用本地部署的开源大语言模型作为结构先验,通过推理耦合关系提出非对称结构,结合经典优化器实现样本高效且可解释的控制器整定。

Comments 17 pages, 7 figures, 6 tables. Substantially revised benchmark, analysis, and presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25333 2026-07-31 cs.CL 版本更新 81%

CRMWeaver: Building Powerful Business Agent via Agentic RL and Shared Memories

CRMWeaver:通过智能体强化学习与共享记忆构建强大的商业智能体

Yilong Lai, Yipin Yang, Ting Liang, Jialong Wu, Zhenglin Wang, Jianguo Lin, Keping Yang

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Southeast University(东南大学) University of Montreal(蒙特利尔大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);language agent(abstract);分类 cs.CL

AI总结 针对商业智能体面临的数据复杂、任务异质问题,提出CRMWeaver方法,通过智能体强化学习训练与共享记忆机制提升性能,在CRMArena-Pro数据集的B2B、B2C场景中取得竞争力结果,实用价值显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27389 2026-07-31 cs.LG cs.AI 新提交 81%

FunL2O: LLM-Guided Feature Function Design for Learning to Optimize

FunL2O:面向学习优化的大语言模型引导特征函数设计

Bingheng Li, Junyang Cai, Yupeng Zhang, Bistra Dilkina, Jayant Kalagnanam, Dzung T. Phan

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出首个大语言模型驱动特征自动化设计的L2O统一框架FunL2O,经多类优化任务及四种大语言模型验证,其演化特征性能优于人工设计特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27275 2026-07-31 cs.LG cs.AI 新提交 81%

Flat Score, Amplified Failures: How the Error Budget Masks Damage in Quantized LLM Agents

Flat Score, Amplified Failures:误差预算如何掩盖量化大语言模型智能体中的损害

Jiwon Jang, Kisu Yang, Heuiseok Lim, Hyunwoo Park

专题命中 评测与基准 :LLM(title);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文以τ²-bench为基准,发现量化大语言模型智能体的分数看似平稳,但会放大原有工具调用失败,其损害被基准的10个错误预算掩盖,缩小预算可暴露该问题,相关诊断方法可与任务奖励一同报告。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12790 2026-07-31 cs.AI cs.CL cs.MA 版本更新 81%

Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents

谁来评估评估者?用于自我改进的语言模型代理的协同进化评估指标和技能

Xing Zhang, Guanghui Wang, Yanwei Cui, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究自我进化智能体系统中评估指标缺失问题,提出指标可进化,通过“双棘轮”协同进化指标与技能循环,在多任务中保留提升效果,还阐述安全性源于锚定规则与外部审核,为无可靠自动验证器场景提供架构。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Double-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20780 2026-07-31 cs.AI cs.CL cs.CV 版本更新 81%

MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models

MedHallTune:用于缓解视觉-语言模型中医患幻觉的指令调优基准

Qiao Yan, Yuchen Yuan, Xiaowei Hu, Yihan Wang, Jiaqi Xu, Xiwen Wu, Jinpeng Li, Chi-Wing Fu, Pheng-Ann Heng

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出MedHallTune基准,用于评估和缓解医疗视觉-语言模型的幻觉,实验表明用该基准微调模型可提升幻觉管理能力与下游VQA任务零样本性能,助力开发更可信的医疗视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28430 2026-07-31 cs.MA 新提交 80%

AgentRadio: Passive Awareness for Long-Horizon Multi-Agent Collaboration

AgentRadio:面向长 horizon 多智能体协作的被动感知机制

Xinxing Ren, Qianbo Zang, Ziyan Wang, Caelum Forder, Suman Deb, Peter Carroll, Zekun Guo

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对现有多智能体系统仅能在阶段间交换信息的局限,提出异步消息传递层 AgentRadio,使编码智能体保持被动感知,在 SWE-Atlas QnA 基准上多智能体任务解决率显著优于单个智能体及 Opus 4.8 版 Claude Code。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28007 2026-07-31 cs.CV cs.AI 新提交 79%

Beyond Classification: Pathology Foundation Models as Detection Encoders for Mitotic Figures

超越分类:病理学基础模型作为有丝分裂图的检测编码器

Sweta Banerjee, Alireza Teimoury, Nils Porsche, Alexandra K. Stoll, Viktoria Weiss, Niklas Hargarter, Jonas Ammeling, Thomas Conrad, Christoph Stroblberger, Christopher Kaltnecker, Robert Klopfleisch, Christof A. Bertram, Katharina Breininger, Marc Aubreville

机构 * Flensburg University of Applied Sciences(弗伦斯堡应用科学大学) University of Veterinary Medicine, Vienna(维也纳兽医大学) Freie Universität Berlin(柏林自由大学) Technische Hochschule Ingolstadt(英戈尔施塔特应用技术大学) Medical University of Vienna(维也纳医科大学) Julius-Maximilians-Universität Würzburg(维尔zburg大学) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本研究将多种病理学基础模型作为骨干网络,结合不同类型检测器在MIDOG++和TUPAC16数据集上验证其用于有丝分裂图检测的性能,发现H-optimus-0和Virchow模型表现具竞争力,相关代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-07-31 cs.CV cs.AI 版本更新 79%

PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28211 2026-07-31 cs.CV 新提交 78%

Scaling Vision-Language Models Is Not Enough to Mitigate Bias

扩大视觉-语言模型规模不足以缓解偏见

Ioannis Sarridis, Ioannis Kompatsiaris, Symeon Papadopoulos

机构 * Information Technologies Institute, CERTH(CERTH信息技术研究所)

专题命中 评测与基准 :language model(title,abstract)

AI总结 该研究通过对194个视觉-语言模型的大规模实证分析,发现扩大模型规模无法缓解偏见,训练数据属性对偏见鲁棒性更关键,架构选择效果依赖基准特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28269 2026-07-31 cs.CV cs.AI cs.MM 新提交 77%

Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation

Theia:用于无数据蒸馏的Incidents1M数据集的大规模多模态字幕生成与自动验证

Simone Giano, Lorenzo Severini, Alessandro Galdelli, Adriano Mancini

机构 * Università Politecnica delle Marche(马尔凯理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本研究针对灾害领域多模态数据集的缺陷,提出方法构建并自动验证Incidents1M数据集,生成高保真字幕,其语义一致性达78.65/100,为跨模态知识蒸馏提供了可扩展框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28037 2026-07-31 cs.LG 新提交 77%

ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents

ClawTrack:面向真实世界智能体的追踪级评估与改进

Xingjian Wu, Xuhang Zhu, Xingchen Liu, Junlin Liu, Jianing Wang, Linsen Guo, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 评测与基准 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 本研究针对现有智能体评估仅看结果的缺口,提出双评估基准ClawTrack,含320个任务及过程评分器,评估21个模型后发现其可归因推理、验证结果验证瓶颈等,助力智能体改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28039 2026-07-31 cs.CV 新提交 75%

TongueReenact: Geometry-Anchored Tongue Synthesis for Face Reenactment

TongueReenact:几何锚定的人脸重演舌部合成

MD Wahiduzzaman Khan, Mingshan Jia, Xiaolin Zhang, En Yu, Kaska Musial-Gabrys

机构 * University of Technology Sydney(悉尼科技大学) Shandong University of Science and Technology(山东科技大学)

专题命中 评测与基准 :foundation model(summary_cn,abstract_cn)

AI总结 本文提出首个跨身份舌部动态迁移框架,结合 foundation model 辅助的自举流水线与空间约束潜在掩码扩散模型,在舌部指标上较基线提升超两倍,且 VLM 评估证实其感知优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27232 2026-07-31 cs.CL cs.AI cs.CY cs.LG 新提交 75%

Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups

共情框架:跨社会人口统计群体评估AI对齐

Haran Shani-Narkiss, Michael Fire, Oren Tsur

机构 * University College London(伦敦大学学院) Ben Gurion University of the Negev(内盖夫本古里安大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究评估7款LLMs对新闻标题情感框架的理解与人类的对齐度,发现不同模型相关性差异大,领先模型总体对齐但存在人口统计组差异,凸显AI对齐的非普遍性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11518 2026-07-31 cs.IR 版本更新 75%

KuaiSearch: An E-Commerce Search Dataset with Authentic Queries and Product Texts for Recall, Ranking, and Relevance

KuaiSearch: 一个大规模电商平台搜索数据集用于召回、排序和相关性

Yupeng Li, Ben Chen, Mingyue Cheng, Zhiding Liu, Xuxin Zhang, Chenyi Lei

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出KuaiSearch,首个涵盖召回、排序和相关性评估的大型电商平台搜索数据集,通过真实用户交互数据提升电商搜索研究的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27984 2026-07-31 cs.AI 新提交 74%

Share the Judge, Learn the Deferral: Where Specialization Helps LLM Evaluation

共享评判,学习弃权:专业化在大语言模型评估中的作用

Weining Zhang

机构 * Cheung Kong Graduate School of Business(长江商学院)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 该研究探讨大语言模型评估中领域专业化的架构设计,发现将专业化置于弃权而非评判环节,通过共享学习与级联路由可提升评估准确率并降低计算量。

Comments 12 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27360 2026-07-31 cs.AI 新提交 74%

SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis

SkillMentor:基于盲点诊断的大语言模型智能体自我进化

Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang, Bo Hu, Zang Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Platform and Content Group, Tencent(腾讯平台与内容事业群) Soochow University(苏州大学)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本文提出SkillMentor,将盲点诊断作为独立于执行的可学习智能体能力,通过强化学习训练导师策略,在AppWorld和BFCLv3上使执行器性能平均提升44.2%,实现无需更新执行器的智能体自我进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28481 2026-07-31 cs.AI 新提交 70%

A Fuzzy Rule-based Neuro-Symbolic Approach for Pipe Severity Prediction in Sewer Networks

用于污水管网管道严重程度预测的基于模糊规则的神经符号方法

Ngoc Thai Le, Thanh Ma, Umberto Straccia

机构 * Can Tho University(芹苴大学) Istituto di Scienza e Tecnologie dell’Informazione, CNR - ISTI(意大利国家研究委员会信息科学与技术研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出一种基于模糊规则的神经符号框架,将神经感知与符号推理解耦,结合Swin Transformer、Weka J48算法和模糊逻辑,在污水管网管道严重程度预测任务中,较仅图像分类提升了多项关键指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27929 2026-07-31 cs.AI 新提交 70%

Meta-Task: Turning Terminal Task Synthesis into a Terminal Task for Scalable Agent Training

元任务:将终端任务综合转化为可扩展智能体训练的终端任务

Zhihong Pan, Jiyuan He, Kai Zhang, Yupeng Han, Ze Liu, Yuze Zhao, Yongcong Ye, Zhaohua Yang

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 Meta-Task框架将终端任务综合转化为Terminal-Bench格式任务,通过多阶段机制等提升任务质量,生成3221条轨迹微调Qwen3系列模型,效果优于同期方法且训练数据更少。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27895 2026-07-31 cs.AI cs.CV 新提交 70%

MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos

MMHBench:用于长视频心理健康理解的多视角基准测试集

Jinpeng Hu, Erqiang Wang, Shan Wang, Zhuo Li, Peipei Song, Xun Yang, Meng Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MMHBench多视角心理健康理解基准,含268个长视频与2184条问题,采用MAQG框架生成问题,评估22个多模态大语言模型后发现该任务仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27849 2026-07-31 eess.SY cs.LG cs.SY 新提交 70%

Safety-Gated Agentic Supervisory Control on a Coupled Distillation Benchmark: Regime Map, Auditable Gate, and Co-Design Findings

耦合精馏基准上的安全门控智能体监督控制:工况图、可审计门与协同设计发现

Christian Rosenthal

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对耦合精馏基准,提出基于规则的分叉孪生反事实安全门控机制,结合DeepSeek-V4-Flash等模型,在目标获取、扰动抑制等任务上优于基准方法,可有效遏制有害操作。

Comments 31 pages, 8 figures. Code and data: https://github.com/cgncro-cyber/IndustrialAI. Sole author; independent research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27687 2026-07-31 cs.AI 新提交 70%

Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch

Rehearse:从自改进自动研究中的置信度悬崖后退

Jiazhen Ji, Shouhong Ding

机构 * Tencent(腾讯)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究发现自动研究中存在置信度悬崖问题,提出Rehearse方法通过聚焦过往尝试结果记忆提升判断准确率,在三个任务的4000次训练运行预算下改善了终点性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27556 2026-07-31 cs.AI cs.MA 新提交 70%

Evaluating Agentic Bioinformatics through Function, Evidence, and Validation

通过功能、证据和验证评估智能体生物信息学

Phuc Pham, Truong-Son Hy

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出FEV框架评估智能体生物信息学,梳理多领域128篇文献后发现规划等进展快于科学验证相关环节,主张应基于工作流正确性评估这类系统

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27499 2026-07-31 cs.AI 新提交 70%

A dataset of rated conceptual arguments

已标注评分的概念论证数据集

Emery Cooper, Caspar Oesterheld, Linh Chi Nguyen, Alexander Kastner, Ethan Perez

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建了含多维度专家评分的概念论证数据集,提出两种评分函数并基准测试多模型,发现模型性能与通用能力排名相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27109 2026-07-31 cs.SD cs.AI 版本更新 70%

MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning

MMAC:一个用于音频字幕生成的大规模多维度基准测试集

Weijie Wu, Junbo Li, Lin Li, Jun Fang, Qingyang Hong

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对音频字幕生成评估的信息覆盖与可靠性诊断难题,构建了含5638个音频的MMAC多维度基准,评估多种AudioLLMs并将发布基准与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04227 2026-07-31 cs.CV cs.LG 版本更新 70%

Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting

视觉语言模型的持续学习:超越遗忘的综述与分类

Yuyang Liu, Qiuhe Hong, Linlan Huang, Alexandra Gomez-Villa, Dipam Goswami, Tiantian Peng, Xialei Liu, Joost van de Weijer, Yonghong Tian

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏