arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-22 至 2026-07-22 共收录 28 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 7 篇

2607.18716 2026-07-22 cs.CV 新提交 89%

Continual Video-MLLM Adaptation over Evolving Domains

在不断演变的领域上进行连续视频 - MLLM 适应

Rui Cheng, Meixing Shi, Yuxiang Cai, Jingcai Guo, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 研究视频多模态大语言模型对不断演变领域的适应问题,提出分布感知专家路由框架 DAER,通过保持领域隔离的轻量级专家、引入多种路由和优化机制,在域增量基准上评估,结果优于现有方法。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18664 2026-07-22 cs.CV 新提交 81%

DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking

DeforM:通过时空掩码实现推理引导的物理感知视频生成

Yunyi Li, Yu Qiao, Yaohui Wang, Xinyuan Chen

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 研究针对视频生成模型难以生成物理感知视频的问题,提出DeforM框架,引入VLM引导的物理推理模块及两种策略,经实验验证该框架能提高生成变形场景的真实感,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19027 2026-07-22 cs.CV 新提交 77%

Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval

缓解零样本视频时刻检索中的模态和语言风格差距

Jihyun Lee, Cheol-Ho Cho, Woojin Jun, Woojin Jeong, Jae-Pil Heo

机构 * Sungkyunkwan University(成均馆大学)

专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究零样本视频时刻检索中模态和语言风格差距问题,提出基于自相似性的时刻提议和评分方法及查询感知的多模态大语言模型推理阶段,有效缓解差距,在相关基准测试中达最优性能。

Comments ECCV 2026 (* These authors contributed equally.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18840 2026-07-22 cs.RO 新提交 75%

WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory

WorldScape Policy 2.0:通过推理增强记忆实现可控的世界行动建模

Haisheng Su, Zongdai Liu, Xin Jin, Haoxuan Dou, Chengming Hu, Baorun Li, Zhanwang Liu, Ruiyan Xu, Jianjie Fang, Xin Zhang, Zhenjie Yang, Xue Yang, Chen Gao, Junchi Yan, Yong Li, Wei Wu

专题命中 视觉推理 :VLM(abstract,abstract_cn);grounding(abstract)

AI总结 研究针对现有世界行动模型的局限,提出WorldScape Policy 2.0,用推理增强记忆,构建相关数据集,实现从高级指令自主规划及基于细粒度文本等的可控执行,在模拟和现实平台实验中展现出在多方面的卓越能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18438 2026-07-22 cs.CL cs.AI cs.LG 新提交 62%

Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains

Relay-Bench:评估大语言模型在多领域推理链上的表现

Liam Swayne

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Relay-Bench是用于评估大语言模型在多领域推理链能力的基准测试,测试集含复合问题,涵盖多领域,模型使用无限制,鼓励利用工具,领先模型GPT-5.5(xHigh)得分43.3%,问题由两到十三个子问题组成,无需多模态输入输出。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19235 2026-07-22 cs.CL cs.CV 新提交 57%

MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings

MeetingToM:在多方会议中对具有心理理论推理能力的多模态大语言模型进行评估

Ziyi Wang, Yuhang Wu, Dongxu Piao, Xingyu Liu, Tianhui Zhou, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究多方会议中多模态大语言模型的心理理论推理,引入MeetingToM基准,分层评估不同粒度社会行为推理,提供评估协议并分析模型,揭示其在整合线索、推断态度及区分共识方面的局限,为推进多模态模型的会议心理理论推理提供试验台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18777 2026-07-22 cs.LG q-bio.MN 新提交 57%

PertReason: A Knowledge-Grounded Benchmark and Framework for Cell-State-Conditioned Mechanistic Reasoning of Perturbation Effects

PertReason:用于细胞状态条件下扰动效应机制推理的知识基础基准和框架

Dongkwan Kim, Yiming Gao, Yining Yang, Yang Shen

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.LG

AI总结 研究针对科学领域机器学习评估难题,引入PertReason基准和框架套件,通过PertReasonQA测试模型,结合多数据与知识图谱,发现现有模型预测与推理差距,提出PertReasonLM,为科学系统中忠实推理失败提供诊断框架。

Comments Preprint; 31 pages; Dongkwan Kim and Yiming Gao contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉定位与Grounding 10 篇

2607.19077 2026-07-22 cs.CV 新提交 79%

Context-structured Video Anomaly Detection with Large Vision-Language Models

基于大型视觉语言模型的上下文结构视频异常检测

Dongjun Kim, Changjae Oh, Andrea Cavallaro, Jeonghoon Mo

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 研究视频异常检测难题,提出CSI-VAD方法,将视频分解为环境、对象、时间三个上下文并分别推理,免训练且不依赖文本提示和数据集调整,实验证明该方法优于基线并具竞争力。

Comments Accepted at AVSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18245 2026-07-22 cs.AI 新提交 79%

SAAG: Structured Agent Assessment and Grounding

SAAG:结构化智能体评估与基础

Ritvik Garimella, Vedant Khandelwal, Anvi Kohli, Amit Sheth

机构 * Artificial Intelligence Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) Indian AI Research Organization(印度人工智能研究组织)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 研究针对智能体调用评估问题,提出SAAG级联诊断框架,将其分解为三个阶段进行评估,能实现迭代自我修复。经实验,结构化反馈可提高参数精度、减少值幻觉,表明阶段分解诊断评估对提升智能体调用可靠性很关键。

Comments Accepted to KnowFM @ ACL 2026 workshop (Non-Archival). 16 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19011 2026-07-22 cs.CL cs.AI cs.MM 新提交 70%

Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

基于多模态语言模型的计算幽默:方法、数据集、评估及挑战

Tuo Liang, Zhe Hu, Disheng Liu, Jing Li, Yu Yin

机构 * Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.AI

AI总结 本研究聚焦于单图像和多面板作品中的视觉幽默理解,通过与先前综述对比,按能力层次组织文献,综合基准设计等内容,追溯领域转变,指出进展的主要障碍包括易出现捷径的评估、文化覆盖有限等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18801 2026-07-22 cs.CV 新提交 70%

ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting

ZeroSplat:3D高斯点云渲染中的广义指代分割

Jiayu Ding, Meilu Song, Xiaoyi Zhang, Hongbo Jin, Yichen Jin, Xiangtian Si

机构 * Peking University(北京大学) North China Electric Power University(华北电力大学) China University of Geosciences(中国地质大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 针对现有指代3D高斯点云渲染方法局限,提出ZeroSplat框架,通过多视图几何约束将2D视觉语言模型先验提升至3D空间,无需额外特征存储,在广义和单目标场景中显著优于现有方法,且效率高。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18850 2026-07-22 cs.CV cs.AI 新提交 62%

OPD-IAD: From Language Judgment to Industrial Anomaly Detection via On-Policy Self-Distillation

OPD-IAD:通过策略内自蒸馏从语言判断到工业异常检测

Shuimu Chen, Jing Jin, Nan Su, Hongbo Xu, Zebang Cheng, Wenming Yang, Fei Ma, Guijin Wang

机构 * Tsinghua University(清华大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen University(深圳大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究如何利用大型视觉语言模型进行工业异常检测,提出OPD-IAD框架,通过策略内自蒸馏和语言引导视觉锚定,将语言判断转化为像素级异常图,在相关方法中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19339 2026-07-22 cs.CV 新提交 57%

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

OmniReasoner:通过原生工具使用进行长音频-视频推理

Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对长音频-视频推理难题,OmniReasoner提出工具使用后训练框架,通过监督微调与强化学习让全模态语言模型学会调用放大工具,利用TimeAnchor保持时间参数一致性,借助时间增强数据引擎实现可训练,提升了答案准确性与时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19201 2026-07-22 cs.CL cs.AI 新提交 57%

MIRA-Ev:A Benchmark for Granular Evidence Detection and Relational Reasoning in Clinical Exams

MIRA-Ev:临床考试中颗粒证据检测和关系推理的基准

Iker De la Iglesia, Johanna Ramirez-Romero, Jose Maria Villa-Gonzalez, Irune Urroz García, Ander Barrena, Aitziber Atutxa

机构 * HiTZ Center, University of the Basque Country (EHU)(巴斯克大学HiTZ中心) Hospital Universitario de Cruces(克鲁塞斯大学医院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对临床自然语言处理评估局限,引入基于西班牙MIR执照考试案例的MIRA-Ev基准,重新注释相关关系并发布多语言版本,将评估组织为证据句子检索、论证组件提取和关系分类的三层任务层次结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19115 2026-07-22 cs.CV 新提交 57%

CR-Refiner: An Object-Centric Optimal Transport Reranker for Edit-Conditioned 3D Scene Retrieval

CR-Refiner:用于编辑条件3D场景检索的以对象为中心的最优传输重排器

Hao Wu, Jinjing Zhu, Nanyu Wu, Qianyi Cai, Heyi Lin, Hao Wang, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究编辑条件3D场景检索问题,提出CR-Refiner重排器,通过冻结语言模型解析编辑、不平衡最优传输问题评分候选对象、轴条件结构先验及语言模型验证器细化结果,在不同基础检索器上提升了硬子集检索指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18975 2026-07-22 cs.AI 新提交 57%

Mi-Memory: A Lifecycle Memory Framework for Personal AI

Mi-Memory:一种用于个人人工智能的生命周期内存框架

Xule Liu, Hanlin Teng, Chao Li, Yanan Ni, Shuo Lu, Audrey Wang, Yijun Liu, Yunfei Wang, Xiaofeng Li, Xian Yi, Yuanfa Li, Kang Zhao, Jian Liang, Yuxuan Chen, Jinyuan Chen, Heng Qu, Kun Shao, Jian Luan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对个人人工智能从聊天交互拓展至多设备持续服务的需求,提出Mi-Memory生命周期内存框架,围绕四个角色构建,通过共享审计合约及相关工件家族实现,经实例化角色在评估中取得一定成果,迈向可审计等特性的内存系统。

Comments Project page: https://darwin-agent.github.io/Mi-Memory/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18557 2026-07-22 physics.geo-ph 新提交 50%

AGENTS4GEOS: agentic platform for open-source multi-physics simulation

AGENTS4GEOS:用于开源多物理场模拟的智能体平台

Adriano M. A. Côrtes, Roberto M. Velho, Fernando A. Rochinha, Alvaro L. G. A. Coutinho, Mauricio Araya-Polo, Hervé Gross

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对多物理场模拟计算需求及训练数据集瓶颈,提出基于模型上下文协议的Agents4GEOS智能体框架,借助52个领域感知工具及协调器,自动化日常任务,助力专家专注工作挑战。

Comments 14 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 文档图表理解 2 篇

2607.18839 2026-07-22 cs.CL 新提交 75%

HPD-Parsing: Hierarchical Parallel Document Parsing

HPD解析:分层并行文档解析

Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan, Yangliu Xu, Manhui Lin, Xiaolong Ma, Cheng Cui, Tengyu Du, YY

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 研究基于统一视觉语言模型的文档解析器顺序瓶颈问题,提出HPD解析,采用分层并行解码范式,含主要布局分支和P-MTP,实验显示其吞吐量高且精度有竞争力,为高效统一文档解析开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18997 2026-07-22 cs.CV cs.CE cs.LG 新提交 62%

Benchmarking Deep Learning Approaches for AEC Engineering Drawing Layout Detection and Information Extraction

用于AEC工程图纸布局检测和信息提取的深度学习方法基准测试

Tianyang Huang, Alessio Lombardi, Ahmed Elnagar, Ahmed Zalouk, George Paul, Sepehr Najjarpour, Arvid Sigurdsson, Khalid Ismail, Mohamed Ragab, Edlira Vakaj

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究针对AEC图纸信息提取难题,构建特定数据集,对五种深度学习架构进行基准测试,RF-DETR和Qwen3-VL表现出色,而通用预训练模型有域干扰,为AEC自动化信息提取奠定技术基础。

Comments 2026 European Conference of Computing in Construction (EC3 2026), 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 3 篇

2607.18580 2026-07-22 cs.RO 新提交 82%

STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models

STeP:用于视觉语言模型动作生成精确规范的信号时序逻辑

Kasra Torshizi, Anukriti Singh, Sidharth Mathur, Khuzema Habib, Leo Du, Pratap Tokekar

机构 * University of Maryland(马里兰大学)

专题命中 GUI与屏幕智能体 :vision language model(title);VLM(abstract,abstract_cn)

AI总结 针对视觉语言动作模型缺乏可解释性及难以遵循精确自然语言指令的问题,提出用信号时序逻辑(STL)连接高级语言理解与低级机器人执行的分层框架,经实验验证该框架能提高语言条件下机器人规划的精度、可靠性和可解释性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19191 2026-07-22 cs.CV cs.AI cs.LG 新提交 75%

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

ABot-World-0:在单台桌面GPU上进行无限交互式世界展开

Fan Jiang, Zhaoxu Sun, Mengchao Wang, Ziyu Zhu, Chiyu Wang, Yunpeng Zhang, Wenlin Liu, Yun Wang, Xue Zheng, Rui Sun, Junfeng Ni, Hongyu Pan, Zhongxu Sun, Fei Yu, Zengye Ge, Mengmeng Du, Nianfei Fan, Mingchao Sun, Yu Liu, Yongchang, Yanqing Zhu, Jiahang Wang, Ning Ying, Yuze Xuan, Di Yang, Zhicheng Liu, Zhe Gao, Tingbing Xu, Jiacheng Sui, Wenjin Yang, Junnan Lai, Shufeng Liu, Yuan Liu, Zheng Zhou, Yingliang Peng, Dawei Cao, Kaifeng Sheng, Yuxiang Cai, Fei Lu, Mu Xu, Ning Guo

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 介绍ABot-World-0这一用于实时长视野闭环交互的动作条件视频世界模型,利用多源数据学习世界动态。通过多种技术提炼模型,设计控制界面与部署堆栈,在单台桌面GPU上实现高效视频流传输,实验验证其有竞争力的可控性和世界演变能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19288 2026-07-22 cs.CV cs.RO 新提交 70%

No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation

无需训练,飞行更佳:用于无人机导航的测试时缩放视觉语言模型

Feinan Cheng, Dongliang Xu, Wenli Nong, Zhiheng Zhang, Ang Liu, Tianyu Wang, Yue Yao

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 研究如何将测试时缩放应用于无人机视觉语言导航,通过迭代细化和多标准评分函数,无需额外训练,使冻结模型自我校正,生成更准确可靠飞行计划,实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 2 篇

2607.18325 2026-07-22 cs.CV cs.AI cs.RO 新提交 85%

Hazard or Anomaly? Evaluating VLMs for Understanding Dangers and Discrepancies

危险还是异常?评估用于理解危险和差异的视觉语言模型

Murali Indukuri, Mohammad Eskandari, Sree Nitya Kollu, Stephanie Lukin, Cynthia Matuszek

机构 * Interactive Robotics and Language Lab, University of Maryland Baltimore County(马里兰大学巴尔的摩县分校交互式机器人与语言实验室) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现代安全关键系统中VLM的评估问题,通过明确区分危险和异常,在两个数据集及多种提示策略下评估多个先进VLM,发现其常误判,明确区分能提供更具信息性评估并揭示失败模式。

Comments 8 pages, accepted to RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18665 2026-07-22 cs.AI 新提交 57%

SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring

SciHazard:一种通过分解危害评分来衡量科学安全风险的基准

Chunxiao Li, Yuan Xiong, Lijun Li, Tianyi Du, Wenlong Zhang, Lei Bai, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 研究针对大型语言模型可能传播有害科学知识的问题,引入SciHazard基准及评估框架,含多学科问题。开发分解评估程序计算DeHarm-Score,经专家验证和模型测试,显示该方法能有效衡量风险,还发现深度研究代理存在安全盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 4 篇

2607.19128 2026-07-22 cs.LG 新提交 89%

One Model, Many Graphs: Learning over Attributed Graphs across Heterogeneous Modalities with Vision-Language Models

一个模型,多种图:使用视觉语言模型在异构模态的属性图上进行学习

Jiayi Yang, Yifang Chen, Yuanfu Sun, Jiajin Liu, Qiaoyu Tan

机构 * New York University Shanghai(纽约大学上海分校) New York University(纽约大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.LG

AI总结 研究利用视觉语言模型解决属性图模态异质性问题,提出OMG-VLM框架,以预训练VLM为共享主干,引入结构感知图适配器,在节点分类和链接预测等任务中表现出色,优于现有基线且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18958 2026-07-22 cs.CV cs.AI 新提交 88%

Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model

用于增强大型视觉语言模型鲁棒性的对偶对抗微调

Sibo Wang, Jie Zhang, Shiguang Shan, Xilin Chen, Wen Gao

专题命中 VLM训练与架构 :vision language model(title);LLaVA(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract)

AI总结 针对大型视觉语言模型视觉输入易受攻击且现有防御方法缺乏通用性的问题,提出对偶对抗微调框架,通过联合优化视觉和语义监督信号增强模型鲁棒性,实验证明该方法在多任务对抗鲁棒性评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18615 2026-07-22 cs.CL cs.LG 新提交 84%

Stochastic Meta-Unlearning: Bridging Language Backbone and Multimodal Unlearning

随机元遗忘:连接语言主干与多模态遗忘

Zijie Liu, Jinhao Duan, Gaowen Liu, Sijia Liu, Tianlong Chen

机构 * UNC at Chapel Hill(北卡罗来纳大学教堂山分校) Cisco Research(思科研究院) Michigan State University(密歇根州立大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.LG

AI总结 研究视觉语言模型的机器遗忘问题,提出随机元遗忘框架,利用VLM级反馈学习初始化,经内、外循环更新语言主干,实验证明该方法在遗忘-保留权衡上表现最佳,能提升准确率且可迁移。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19033 2026-07-22 cs.CL 新提交 50%

Content is What Remains: Invariant Speech Tokenization from Parallel Utterances

内容是留存之物:基于平行话语的不变语音分词

Laurin Wagner, Bernhard Thallinger, Miroslav Stankovic, Mario Zusag

机构 * nyra labs(nyra实验室)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 研究针对离散语音分词器问题,提出PINT方法,通过微调SSL编码器及相关损失和增强来提取共享残差,降低条件熵,使词元保留时间基础,实验证明该方法能有效提升效果,正确不变性对高效学习很关键。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏