arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-17 至 2026-08-17 共收录 252 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 68 篇

2608.14380 2026-08-17 cs.AI 新提交 90%

AgentRewind: Recoverable Execution for Long-Horizon LLM Agents

AgentRewind:面向长 horizon LLM 智能体的可恢复执行框架

Yu Zhuang, Kefei Chen, Yitong Duan, Shuxin Zheng, Jian Li, Xu-Yao Zhang

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 AgentRewind 是面向长周期 LLM 智能体的运行时恢复框架,通过记录检查点支持状态回退,结合自建基准 MettleBench 实验,可提升智能体任务成功率与清单进度。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26460 2026-08-17 cs.CL 版本更新 90%

Theory-Grounded Evaluation Exposes the Authorship Gap in LLM Personalization

基于理论的评估揭示了LLM个性化中的作者身份差距

Yash Ganpat Sawant

机构 * April 2026(2026年4月)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过理论指导的评估方法,揭示了LLM个性化中作者身份差距的问题,采用三种测量传统评估四种个性化方法,发现理论指导的指标能提供更准确的基准。

Comments Accepted at CTB Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01793 2026-08-17 cs.CL 版本更新 89%

Research-Oriented Human-Centric Evaluation for Foundation Models

面向研究的基础模型以人为中心的评估

Yijin Guo, Kaiyuan Ji, Xiaorong Zhu, Junying Wang, Farong Wen, Chunyi Li, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) East China Normal University(华东师范大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(title,abstract);分类 cs.CL

AI总结 针对现有基础模型评估忽视用户主观体验的问题,提出Human-Centric Evaluation框架,通过604次人类评估会话及LLM-as-a-judge实验,证实人类主观评估不可替代,为基础模型研究提供新评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13835 2026-08-17 cs.CL 新提交 87%

When Lexical Change Misleads: Rethinking Dynamic Topic Model Evaluation with Traditional and LLM-Based Metrics

当词汇变化产生误导时:结合传统指标与基于大语言模型的指标重新思考动态主题模型评估

Charu Karakkaparambil James

机构 * RPTU University Kaiserslautern-Landau(莱茵兰-普法尔茨州立大学凯撒斯劳滕-兰道分校)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究针对动态主题模型评估中词汇变化误导的问题,对比传统指标与基于LLM的语义相似性指标,发现后者在CoNTM上与人工判断一致性更高,提出应结合两类指标开展感知词汇变化的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13563 2026-08-17 cs.HC cs.AI cs.SE 新提交 87%

Proxy-Validated LLM UX Micro-Simulations: An Artifact-First Protocol for Early-Stage Decision Support

代理验证的大语言用户体验微模拟:一种用于早期决策支持的工件优先协议

Alexandre Cristovão Maiorano

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究提出代理验证的LLM驱动UX微模拟流程,通过代理语料库验证模拟结果,结合多指标对比基线、消融实验分析智能体策略,提供可复现的早期UX决策支持方案。

Comments 27 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13404 2026-08-17 cs.SE cs.CR 版本更新 87%

Does Fixing Break Security? An Empirical Study of Security Degradation in Iterative LLM-Driven Infrastructure-as-Code Repair

修复会破坏安全性吗?对迭代式大语言模型驱动的基础设施即代码修复中安全性退化的实证研究

Benjamin Agyekum, Fabio Santos

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 该研究通过分析IaC-Eval基准的5968个场景,发现迭代式LLM驱动的IaC修复会引入约3.3%场景的安全退化,主要由资源重构导致,第3次迭代是最优停止点,为安全反馈设计提供指导。

Comments 20 pages, 3 figures, 5 tables. Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026). To appear in LIPIcs Vol. 394. v2: corrected the bibliographic record of one reference (preprint, not a journal article) and added the related-version link to the published LIPIcs article

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14161 2026-08-17 cs.AI 新提交 86%

BiasTrace: Linking Reasoning Behaviours to Biased Outputs in LLMs

BiasTrace:将大语言模型(LLM)中的推理行为与有偏输出关联起来

Varsha Ramineni, Hossein A. Rahmani, Jerome Ramos, Karin Sevegnani, Emine Yilmaz

机构 * University College London(伦敦大学学院) NVIDIA(英伟达)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本研究提出BiasTrace标注方案,将LLM的推理行为与有偏输出关联,构建大型标注数据集,发现有偏输出多源于微妙推理行为,且该方案可提升偏见检测与推理时缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25420 2026-08-17 cs.CL cs.AI cs.CY 版本更新 84%

SomaliBench Eval: Measuring English-to-Somali Refusal Gaps in Open-Weight Language Models

SomaliBench Eval:衡量开源语言模型中英语到索马里语的拒绝差距

Khalid Yusuf Dahir

机构 * Independent researcher(独立研究人员)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI;LLM(comments)

AI总结 通过构建索马里语有害意图基准并评估四个开源模型,发现英语到索马里语的拒绝率存在显著差距,且多数非拒绝输出为不流畅的无效内容。

Comments v2: prose rewritten; classification-pipeline correction (34 judge-declined rows manually labeled); paired bootstrap and McNemar statistics; LLM-use disclosure added

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14303 2026-08-17 cs.LG 新提交 84%

Detecting Contaminated Code-Generation Prompt Batches via Influence Functions

利用影响函数检测受污染的代码生成提示批次

Francesco Quinzan, Noor Munir, Yishun Lu, Stephen Roberts

机构 * The University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出与威胁模型无关的CodeSIFT方法,利用影响函数检测受污染的代码生成提示批次,在3B至7B参数的三个代码LLM上,中高注入率下AUROC达0.98,性能优于静态分析基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13624 2026-08-17 cs.CL cs.AI cs.SD 新提交 84%

Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation

基于语义感知偏差估计的大音频语言模型公平性测量

Zhe Liu

机构 * Meta Platforms, Inc.(元平台公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大音频语言模型公平性评估中语义与说话人混淆因素的问题,提出语义感知混合效应回归框架,经实验验证可减少虚假结论,得到更稳健的子群体性能差异估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25577 2026-08-17 eess.AS cs.AI cs.CL 版本更新 84%

Lost in Phonation: Voice Quality Variation as an Evaluation Dimension for Speech Foundation Models

语音迷失在发声中:语音质量变化作为语音基础模型的评估维度

Harm Lameris, Shree Harsha Bokkahalli Satish, Joakim Gustafson, Éva Székely

机构 * Department of Speech, Music and Hearing(语音、音乐与听觉系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究推出VQ-Bench评估套件,发现语音基础模型(SFMs)对发声类型的解释存在性能差距,还会反映或放大人类社会偏见,为确保基于语音的AI的副语言解释责任性建立了可复现框架。

Comments 5 pages, 2 figures, 3 tables, accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14016 2026-08-17 cs.CV cs.AI cs.GR 新提交 83%

Content Based Video Narration of Gameplay with Vision Language Models

基于内容的游戏玩法视频旁白:利用视觉语言模型

Mathew Varghese

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 该研究提出一种基于内容的游戏玩法视频旁白系统,利用视觉语言模型等技术生成电竞风格解说,无需游戏专用工具,支持本地化语音,还发布了可复现基线。

Comments this https URL (https://mathewvarghese.space/ai-powered-game-commentary-auto-narrating-gameplay-videos-with-gpt-4o/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14975 2026-08-17 cs.AI 版本更新 83%

CFM-Bench: A Unified Multi-Domain, Multi-Task Benchmark for Channel Foundation Models

CFM-Bench:用于信道基础模型的统一多域、多任务基准测试

Yuan Gao, Wenjun Yu, Jun Jiang, Yunfan Li, Xinyu Guo, Shugong Xu

机构 * School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究针对信道基础模型评估缺乏统一基准的问题,发布CFM-Bench,涵盖多种信道配置、官方分区,规定数据使用规则,组织六个任务组,为比较信道表示跨模型、域和任务的可迁移性提供通用平台。

Comments CFM-Bench dataset download: this https URL (https://www.chaspark.com/) \#/s/CFM-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14533 2026-08-17 cs.CR 新提交 82%

Finding Vulnerabilities via LLM-Augmented Semantics-Aware Type-Checking

基于大语言模型增强的语义感知类型检查的漏洞发现

Ruizhe Wang, Meng Xu, N. Asokan

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出语义感知类型系统SETYPE,由LLMs执行类型推断与检查,构建PYSETYPE原型,在真实Python Web应用中实现87%精度、88%准确率,识别出15个潜在零日漏洞,9个获开发者确认。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14270 2026-08-17 cs.AI 新提交 81%

TimeSage-EV: A Live Benchmark for Agentic Time Series Analysis in Evolving Environments

TimeSage-EV:面向动态环境下智能体时间序列分析的实时基准测试集

Qingren Yao, Yaxuan Kong, Yuqi Nie, Yichen Li, Stefan Zohren, Anna Vettoruzzo, Qingsong Wen, Ming Jin, Joaquin Vanschoren

机构 * Eindhoven University of Technology(埃因霍温理工大学) University of Oxford(牛津大学) VulpiVox Intelligence(VulpiVox智能公司) Squirrel Ai Learning(Squirrel AI学习公司) Griffith University(格里菲斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有时间序列基准未评估时间有效性等问题,推出动态环境智能体时间序列分析基准TimeSage-EV,含多领域真实场景,实验揭示模型性能差距及失败模式,提供研究资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14465 2026-08-17 cs.CL cs.LG 新提交 81%

You Only Pass Once: Answering and Abstaining Together in a Single Forward Pass of a Frozen Language Model

仅前向传播一次:在冻结语言模型的单次前向传播中同时完成回答与弃权(不执行)

Ziyang Luo, Zhongyao Chu, Xinjie He, Youting Wang, Xukui Qin, Runxiong Wu, Yan-Syuan Chen

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究提出YOPO系统,通过训练小型网络重构残差流,在冻结Qwen2.5模型单次前向传播中同时实现回答、引导与弃权,性能优于两次前向传播基准,且在跨域等场景表现出色。

Comments 24 pages. Ziyang Luo and Zhongyao Chu contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14227 2026-08-17 cs.AI cs.CE cs.LG 新提交 81%

Attributing Preprocessing Invariance in Spectral Foundation Models

归因于光谱基础模型中的预处理不变性

Dongjun Wei, Hongyi Wu, Yinuo Zou

机构 * ESCP Business School(ESCP商学院) OpluxCare Co., Ltd.(欧普乐康护理有限公司) The University of Hong Kong(香港大学) Nanjing University(南京大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究以拉曼光谱基础模型为例,指出其声称的预处理不变性多源于归一化而非学习,多数系统的归一化已消除相关变换,训练编码器未带来显著增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14106 2026-08-17 cs.LG cs.AI cs.CE stat.AP stat.ML 新提交 81%

Forecast Collapse in Time-Series Foundation Models

时间序列基础模型中的预测崩溃现象

Shu Wan, Miles Ma, Hank Zhu, Guangqi Liu, Stephen Wang, Qingsong Wen, Huan Liu

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对1000只美股每小时收益预测出现的预测崩溃现象,本文分析其成因,提出CalibRank目标函数平衡校准与排名,在Finance1K上提升了截面相关性。

Comments 27 pages, 3 figures, 5 tables. Dataset: this https URL (https://huggingface.co/datasets/abel-lab/finance1k)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24519 2026-08-17 cs.LG cs.AI cs.NE 版本更新 81%

A Negative-Control Protocol for Clinical EEG Foundation-Model Benchmarks: Dataset Identity and External-Cohort Stress Testing

用于临床解码的脑电图基础模型压力测试:数据集标识和目标阴性对照

Marzieh Zare

机构 * Université Laval(拉瓦尔大学) NeuroGenis Inc.(NeuroGenis公司)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究预训练脑电图基础模型在临床解码中的表现,通过多种方法在多数据集多任务上对六个模型进行基准测试,发现模型结论依赖评估单元、数据集偏移等因素,如在韩国痴呆症等任务中不同模型和方法表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09992 2026-08-17 cs.CL cs.AI 版本更新 81%

A Unified Assessment of the Poverty of the Stimulus Argument for Neural Language Models

对神经语言模型中贫乏刺激论的统一评估

Xiulin Yang, Arianna Bisazza, Nathan Schneider, Ethan Gotlieb Wilcox

机构 * Georgetown University(乔治城大学) University of Groningen(格罗宁根大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过poshbench评估了神经语言模型在贫乏刺激论中的表现,发现其泛化能力弱于儿童,但引入认知动机归纳偏置后提升语法能力,挑战了内在句法是唯一泛化途径的观点。

Comments TACL under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13956 2026-08-17 cs.IR 新提交 80%

How retriever redundancy and diversity impact RAG effectiveness

检索器冗余性与多样性如何影响检索增强生成(RAG)的有效性

Jonathan J Ross, Bevan Koopman, Anton van der Vegt, Guido Zuccon

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本研究探究RAG中检索文档的冗余性与多样性对答案正确性的影响,发现重复冗余与LLM转述无显著增益,而多样文档可将正确性提升17%-47%,并揭示其提升源于体裁多样性,为RAG检索方法优化提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13930 2026-08-17 cs.CR 新提交 80%

Extracting and Verifying Illicit Bitcoin Addresses from Underground Forum Discussions

从地下论坛讨论中提取和验证非法比特币地址

Abdoul Nasser Hassane Amadou, Arnaud Legout, Imane Fouad, Konstantin Avrachenkov, Anas Motii

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本研究提出结合LLM辅助筛选、专家审核与链上验证的可复现流程,从地下论坛HackForums构建含2438个经人工验证非法比特币地址的数据集,为相关研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02078 2026-08-17 cs.RO 版本更新 80%

Genie Sim 3.0: A High-Fidelity Comprehensive Simulation Platform for Humanoid Robot

Genie Sim 3.0:人形机器人综合仿真平台

Chenghao Yin, Da Huang, Di Yang, Jichao Wang, Nanshu Zhao, Chen Xu, Wenjun Sun, Linjie Hou, Zhijun Li, Junhui Wu, Zhaobo Liu, Zhen Xiao, Sheng Zhang, Lei Bao, Rui Feng, Zhenquan Pang, Jiayu Li, Qian Wang, Maoqing Yao

机构 * AgibotTech(Agibot科技)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 Genie Sim 3.0通过高保真场景生成和开放数据集,提升机器人学习模型的泛化能力与仿真到现实的迁移效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14361 2026-08-17 cs.CL 新提交 79%

Local and Global Regimes of Geometric Complexity in Language Model Representations

语言模型表示中几何复杂度的局部与全局 regime

Arwa Osman, Marco Baroni, Iuri Macocco

机构 * Universitat Pompeu Fabra (UPF)(庞培法布拉大学(UPF)) ICREA(加泰罗尼亚研究与高级研究所(ICREA))

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本研究探讨词汇多样性对语言模型本征维度(ID)估计的影响,发现其存在尺度依赖的局部与全局 regime 转变,推导了反转点公式,为LLMs内部流形结构研究提供了新视角。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13598 2026-08-17 cs.AI 新提交 79%

Measuring Cross-Task Behavioral Consistency in Language Model Agents

测量语言模型智能体的跨任务行为一致性

Amritesh Banerjee, Pranil Raichura

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mantis AI Research(螳螂人工智能研究院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出行为一致性指标(BCM),通过约9000条软件工程任务轨迹发现语言模型智能体的跨任务与任务内一致性是可分化的不同维度,且一致性与成功率无关,BCM可补充结果指标评估智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01856 2026-08-17 cs.AI 版本更新 79%

EchoChange: A Diffusion Language Model with Dual Pass Remasking for Factual Remote Sensing Disaster Change Captioning

EchoChange:用于事实性遥感灾害变化描述的双遍重掩蔽扩散语言模型

Dongwei Sun, Bowen Yao, Yujie Zhang, Pei Liu, Jing Yao, Xiangyong Cao

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 针对现有遥感灾害变化描述方法的级联事实错误问题,提出EchoChange扩散语言模型,经实验在RSCC基准上优于各类基线

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14320 2026-08-17 cs.AI cs.CL 新提交 79%

AnchorBench: A Multi-Pathway Benchmark for the Anchoring Effect in LLMs

AnchorBench:针对大语言模型中锚定效应的多路径基准测试

Yiderigun Borjigin, Alexander Hermann, Christian Cyron, Roland Aydin

机构 * Saarland University(萨尔大学) Hamburg University of Technology(汉堡工业大学) Helmholtz-Zentrum Hereon(亥姆霍兹中心赫伦) German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文推出针对大语言模型锚定效应的基准测试AnchorBench,经14种模型实验,揭示锚定效应的路径依赖性等特性,发现高控制准确率的前沿模型仍易受合理锚点影响。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21071 2026-08-17 cs.CL cs.AI 版本更新 79%

Fine-grained Claim-level RAG Benchmark for Law

细粒度声明级法律RAG基准

Souvick Das, Sallam Abualhaija, Domenico Bianculli

机构 * University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一个支持法语和英语的细粒度声明级法律RAG数据集ClaimRAG-LAW,用于评估检索和生成性能,揭示法律领域RAG系统的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14260 2026-08-17 eess.IV cs.MM 新提交 78%

Personalized Digital Semantic Communication for Image Transmission with Vision-Language Models

基于视觉语言模型的图像传输个性化数字语义通信

Nan Li, Li Zhou, Haijun Wang, Jun Xiong, Haitao Zhao, Jibo Wei

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。

Comments Accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14262 2026-08-17 cs.CV 新提交 78%

On the Robustness of Temporal Vision-Language Models for Surgical Endoscopy Videos

手术内窥镜视频的时间视觉语言模型的鲁棒性研究

Darakshan Rashid, Raza Imam, Ufaq Khan, Muhammad Bilal, Shazad Ashraf, Dwarikanath Mahapatra, Mohammad Yaqub, Muhammad Haris Khan, Imran Razzak, Brejesh Lall, Lena Maier-Hein, Yutong Xie

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Birmingham City University(伯明翰城市大学) University Hospitals Birmingham(伯明翰大学医院) Khalifa University(哈利法大学) German Cancer Research Center (DKFZ)(德国癌症研究中心)

专题命中 评测与基准 :language model(title,abstract)

AI总结 该研究针对手术内窥镜视频的时间视觉语言模型,构建Endo-C6基准测试其鲁棒性,提出RobustEndoCLIP,可提升模型在内窥镜损坏下的性能与鲁棒性。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏