arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-16 至 2026-07-16 共收录 239 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 22 篇

2607.13332 2026-07-16 cs.LG cs.DC 新提交 92%

Agora: Collective and Permissionless Internet-Scale Pretraining of Large Language Models

Agora:大规模语言模型的集体无许可互联网规模预训练

Gil Avraham, Violetta Shevchenko, Hadi Mohaghegh Dolatabadi, Karol Pajak, James Snewin, Harry Xi, Rodney O'Donnell, Thalaiyasingam Ajanthan, Sameera Ramasinghe, Chamin Hewa Koneputugodage, Shamane Siriwardhana, Alexander Long

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 研究旨在解决大语言模型训练资源受限问题,提出Agora系统,通过互联网级链路的带宽高效流水线并行模型分片与多方容错集体操作相结合,实现集体训练、集体所有模型,首次展示Pluralis - 8B预训练,效率达集中式基线63%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13416 2026-07-16 cs.LG 新提交 89%

EXPLORE: Exploration with Guided Search for Analog Topology Generation using Language Models

EXPLORE:使用语言模型进行引导搜索以生成模拟拓扑结构

Guanglei Zhou, Chen-Chia Chang, Yikang Shen, Jonathan Ku, Isaac Jacobson, Jingyu Pan, Yiran Chen, Xin Zhang

机构 * Duke University(杜克大学) MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室) IBM T. J. Watson Research Center(IBM T. J. 沃森研究中心)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文针对自动化模拟电路拓扑设计难题,提出EXPLORE框架,集成模拟器引导蒙特卡罗树搜索与基于变压器的解码,利用语言模型先验优化搜索,在6组件基准测试中显著提升成功率、降低均方误差,推动LLM驱动设计自动化。

Comments MLCAD 26' accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13304 2026-07-16 cs.IR cs.CL 新提交 87%

Where Does the Noise Come From? A Variance-Components Decomposition of Non-Determinism in LLM Brand Answers

噪声从何而来?大语言模型品牌答案中非确定性的方差成分分解

Dmitrij Żatuchin

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型品牌答案中非确定性的来源,通过交叉随机效应分解将响应级品牌结果总方差分为提示内重采样等四个来源,应用于多语言多模型语料库,发现查询语言是最大方差来源,跨语言和模型能提升可靠性而非重复提示。

Comments 18 pages, 6 tables, 3 code listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12712 2026-07-16 cs.SE cs.LG 版本更新 84%

Design-Specification Tiling for ICL-based CAD Code Generation

基于ICL的CAD代码生成的Design-Specification Tiling设计

Yali Du, San-Zhuo Xi, Hui Sun, Ming Li

机构 * National Key Laboratory for Novel Software Technology, School of Artificial Intelligence, Nanjing University(新型软件技术国家实验室,人工智能学院,南京大学)

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);prompting(abstract);分类 cs.LG

AI总结 本文提出DST方法,通过量化知识充分性提升CAD代码生成质量,优于现有ICL示例选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13678 2026-07-16 eess.SP 新提交 82%

M3F-UAV: A Missing-Modality Multimodal Foundation Model for Low-Altitude Wireless Sensing

M3F-UAV:一种用于低空无线传感的缺失模态多模态基础模型

Pengxuan Gao, Kai Ying, Botao Wu, Jianhua Mo, Qingsong Wen

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 针对复杂环境下单模态模型可靠性低的问题,提出M3F-UAV模型,通过特定模态预训练特征提取器、跨模态融合及缺失模态感知预训练,从多观测中学习统一表示,在LAMBDA数据集实验中性能优于单模态基线且在缺失模态下稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08949 2026-07-16 cs.CR cs.SE 版本更新 82%

SeedSmith: LLM-Driven Seed Synthesis for Directed Fuzzing

SeedSmith:用于定向模糊测试的基于大语言模型的种子合成

Junmin Zhu, Siyu Liu, Jie Hu, Fabio Gritti, Ati Priya Bajaj, Hulin Wang, Wenbo Guo, Tiffany Bao, Christopher Kruegel, Giovanni Vigna

专题命中 预训练与数据 :LLM(title,abstract);prompting(abstract)

AI总结 研究针对定向模糊测试常无法触发崩溃的问题,提出SeedSmith这一基于大语言模型的管道,通过复制分析师工作流程合成种子,提升模糊器性能,在Magma和ARVO上取得显著加速和发现新漏洞的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19802 2026-07-16 cs.CV 版本更新 82%

Evaluating Vision Foundation Models for Pixel and Object Classification in Microscopy

评估显微镜中用于像素和物体分类的视觉基础模型

Carolin Teuber, Anwai Archit, Tobias Boothe, Peter Ditte, Jochen Rink, Constantin Pape

机构 * Georg-August-University Göttingen, Institute of Computer Science Department of Tissue Dynamics Regeneration, Max Planck Institute for Multidisciplinary Sciences, Göttingen Georg-August-University Göttingen, Faculty of Biology Psychology CAIMed - Lower Saxony Center for AI \& Causal Methods in Medicine, Göttingen Cluster of Excellence Multiscale Bioimaging (MBExC), Georg-August-University Göttingen

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文评估了视觉基础模型在显微镜像素和物体分类中的应用,探讨了其在提升分类性能方面的潜力,并建立了相关基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12363 2026-07-16 cs.RO cs.LG 版本更新 79%

Pretraining in Actor-Critic Reinforcement Learning for Locomotion

在机器人运动强化学习中预训练Actor-Critic算法

Jiale Fan, Andrei Cramariuc, Tifanny Portela, Marco Hutter

机构 * Robotic Systems Lab, ETH Zürich(苏黎世联邦理工学院机器人系统实验室) Section of Microengineering, EPFL(日内瓦联邦理工学院微工程系) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本研究提出了一种在机器人运动强化学习中预训练Actor-Critic算法的方法,通过预训练模型提升样本效率和任务性能。

Comments Published in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13892 2026-07-16 cs.CV 新提交 78%

Fine-Grained Vision-Language Pretraining with Organ-Conditioned Pattern Tokens for CT Understanding

用于CT理解的基于器官条件模式令牌的细粒度视觉语言预训练

Guoliang You, Xiaomeng Chu

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 研究从CT扫描和报告进行视觉语言预训练的难题,提出OCP-CT框架,通过保留全局对比分支、引入器官模式接口等方法,在公开基准上实现零样本异常诊断,相比先前结果有显著AUROC增益。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14051 2026-07-16 cs.CL 新提交 74%

Hindcast: Replaying Prediction Markets to Evaluate LLM Forecasters

回溯:重放预测市场以评估大语言模型预测器

Xiao Ye, Jacob Dineen, Evan Zhu, Shijie Lu, Kevin Song, Ben Zhou

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 预训练与数据 :LLM(title);分类 cs.CL

AI总结 研究针对大语言模型预测器评估中答案泄露问题,提出Hindcast方法,通过设定特定过去日期评分,重放预测市场与Reddit快照,让模型读取特定时间前帖子并评分,解决泄露问题,且能随模型改进在新市场重新评估,明确检索在不同情况的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01455 2026-07-16 cs.LG cs.AI 版本更新 73%

Token Geometry

Token几何

Kathan Shah

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 发现嵌入表和LM头的梯度几何特性,提出轻量优化器Ember,在微调、强化学习和预训练中提升帕累托前沿,仅需KB级优化器状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14086 2026-07-16 cs.LG q-bio.NC 新提交 70%

Leveraging unlabelled data for generalizable neural population decoding

利用未标记数据进行可泛化的神经群体解码

Ximeng Mao, Nanda H. Krishna, Avery Hee-Woon Ryoo, Matthew G. Perich, Guillaume Lajoie

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 研究利用未标记数据进行可泛化神经群体解码的问题,提出MOJO训练框架,联合自监督学习与监督学习目标,在多数据集上评估,结果显示该框架能提升性能、产生更具可解释性表示且可推广到其他神经模态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14604 2026-07-16 cs.RO cs.CV cs.LG 版本更新 70%

Tactile Modality Fusion for Vision-Language-Action Models

触觉模态融合用于视觉-语言-动作模型

Charlotte Morissette, Amin Abyaneh, Wei-Di Chang, Anas Houssaini, David Meger, Hsiu-Chin Lin, Jonathan Tremblay, Gregory Dudek

专题命中 预训练与数据 :pretraining(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出TacFiLM,一种轻量级模态融合方法,将视觉-触觉信号整合到视觉-语言-动作(VLA)模型中。通过特征级线性调制(FiLM)对中间视觉特征进行条件化,提升接触丰富操作行为的性能。

Comments Accepted to the European Conference on Computer Vision (ECCV), 2026, 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13493 2026-07-16 cs.IR 新提交 67%

Personalizing Incremental Video Search with Hybrid Text and ID Embeddings

使用混合文本和ID嵌入个性化增量视频搜索

Vivek Kanojiya, Vishalaksh Aggarwal, Daeho Baek, Lyndon Kennedy, Xuetao Yin

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 研究针对增量视频搜索中意图不明的问题,提出结合语义与协作信号的个性化系统。通过学习文本和ID嵌入空间构建用户表示,注入相似度到排名器。实验表明离线提升了NDCG@10和MRR,在线提高了点击率、转化率和排名位置,还分析了嵌入权衡与质量。

Comments Accepted to the Industry Track of the 20th ACM Conference on Recommender Systems (RecSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13092 2026-07-16 cs.PL 新提交 67%

Executable JavaScript as a Checkable Specification Language: A JS-SAM Case Study on SysMoBench

可执行JavaScript作为一种可检查的规范语言:关于SysMoBench的JS-SAM案例研究

Jean-Jacques Dubray

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究大语言模型用不同语言为真实系统写规范的情况,以SysMoBench为平台,通过添加JS-SAM进行控制比较,涵盖多个模型和系统,发现一致性是区分模型关键,规范契约决定保真度,最小契约有转录无语义推导,将可执行JavaScript作为规范基础作案例研究。

Comments 34 pages, 9 tables, no figures. Code, trace corpora, and replication guide: https://github.com/jdubray/SysMoBench-1 (branch js-sam-tla-phase3) . Companion study on a production payment system: arXiv:2607.05076

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13565 2026-07-16 cs.CR cs.AI cs.CL 新提交 62%

UTS at ELOQUENT 2026 Voight-Kampff: structural shifts in AI writing bypass state-of-the-art detectors

UTS在2026年ELOQUENT Voight-Kampff中的表现:人工智能写作中的结构转变绕过了最先进的检测器

Dima Galat, Marian-Andrei Rizoiu

机构 * University of Technology Sydney, Australia(澳大利亚技术大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究语言模型逃避攻击在对抗性微调中的情况,利用检测器漏洞不对称性,引入新攻击家族,其愚弄率更高且能保持自然度,实验表明现有对策无效,揭示检测器在结构分布外转变下有持续漏洞并助力竞赛表现。

Comments CLEF2026, ELOQUENT2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11977 2026-07-16 cs.AI cs.CL 版本更新 62%

Optimization Is Not All You Need

优化并非你所需的全部

Minh Hua, Rita Raley

机构 * Scale AI(Scale人工智能公司) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究指出优化并非全部,以GPT - 2为例,通过追踪其预训练等环节的优化文化,发现优化程序虽能测文本可能性,但无法区分不可能性是错误还是创新,却在五年内获设定语言协议权威。

Comments This essay will be forthcoming in MFS Modern Fiction Studies, published by JHUP (Spring-Summer 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14040 2026-07-16 cs.CL 新提交 57%

Can an Old Dog Be Taught New Tricks? Taking LLMs Beyond Sentence Level Translation

老狗能学新把戏吗?让大语言模型超越句子级翻译

Alaina Brandt

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 探讨能否让大语言模型超越逐句翻译范式,提出基于RAG的PAT系统,通过与语料库结合让大语言模型进行全文翻译生成草稿,经评估发现其能朝重新表述发展,但提升重新表述有效性仍需更多工作,还讨论了相关设计与评估等要点。

Comments Accepted for publication in HCI International 2026, Late Breaking Papers Proceedings, Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13660 2026-07-16 cs.LG 新提交 57%

The Hyperspherical Geometry of CLIP Latent Space: A Semantic Mixture Model

CLIP 潜在空间的超球面几何:一种语义混合模型

Zijie Yu, Gaowen Liu, Ramana Rao Kompella, Philip S. Yu, Yue Song

机构 * Tsinghua University(清华大学) Cisco Research(思科研究院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 研究 CLIP 潜在空间,提出基于冯·米塞斯-费舍尔分布混合的密度模型,用期望最大化算法学习,实现准确可解释的密度估计,改善长尾和分布外检测,建立几何一致的概率框架。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13432 2026-07-16 cs.LG 新提交 57%

Local Redundancy: An Information-Theoretic Measure of Plasticity from Synthetic Memorization

局部冗余:一种基于合成记忆的可塑性信息论度量

Jiaxuan Cheng

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 研究神经网络可塑性度量,引入基于通用压缩理论的局部冗余,将其定义为局部模型族最坏情况冗余,证明期望平方梯度范数可作下界,实验表明该度量比现有方法更能预测下游性能并助于预训练检查点选择。

Comments 13 pages, 7 figures. ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10611 2026-07-16 cs.LG 版本更新 57%

M+Adam: Low-Precision Training via Additive-Multiplicative Optimization

M+Adam:通过加法-乘法优化进行低精度训练

Xiaoyuan Liang, Sebastian Loeschcke, Mads Toftrup, Anima Anandkumar

机构 * California Institute of Technology(加利福尼亚理工学院) University of Copenhagen(哥本哈根大学) Aarhus University(阿鲁斯大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 研究低精度训练中标准优化器的问题,提出结合加法和乘法更新的M+Adam方法,经证明在标准假设下单调下降,在多种模型预训练中持续改善低精度训练。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13178 2026-07-16 cs.CV 新提交 50%

A Masked Autoencoder Approach to Unsupervised Steel Surface Defect Recognition

一种用于无监督钢表面缺陷识别的掩码自动编码器方法

Shrey Patel

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对钢表面缺陷识别中标记数据稀缺问题,采用基于Transformer的掩码自动编码器,通过随机掩码部分图像块让轻量级解码器重建,联合辅助缺陷定位目标训练编码器,聚类预训练编码器特征,取得较高匹配准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 15 篇

2510.26707 2026-07-16 cs.CL cs.CY cs.LG 版本更新 92%

Value Drifts: Tracing Value Alignment During LLM Post-Training

价值漂移:在大语言模型训练后追踪价值对齐

Mehar Bhatia, Shravan Nayak, Gaurav Kamath, Marius Mosbach, Karolina Stańczak, Vered Shwartz, Siva Reddy

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) ETH Zurich(苏黎世联邦理工学院) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);LLM(title);preference optimization(abstract)

AI总结 研究大语言模型训练后价值对齐问题,通过实验区分训练后算法和数据集影响,测量价值漂移,发现SFT阶段确立模型价值,后续偏好优化难重对齐,不同算法在偏好数据不变时也有不同结果,为相关选择提供见解。

Comments TACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13864 2026-07-16 cs.SD 新提交 90%

Rethinking Speech Foundation Model Fine-tuning: Better SFT or Better Match?

重新思考语音基础模型微调:更好的监督微调还是更好的匹配?

Wangjin Zhou, Yizhou Zhang, Yichi Wang, Tatsuya Kawahara

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究生院)

专题命中 指令微调 :SFT(title,summary_cn);foundation model(title)

AI总结 研究语音基础模型微调,通过对3个SUPERB分类任务、9个预训练检查点的8种SFT变体进行系统研究,发现SFT结果强烈依赖预训练实例,顶级SFT方法常因检查点而异,下游增益多为实例和种子依赖的匹配,非普遍性能提升。

Comments Accept by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13350 2026-07-16 physics.chem-ph 新提交 89%

How Well Can Frontier Large Language Models Generate Structures? High Quality Prediction of Molecular Geometries with Help from Fine-Tuning

前沿大语言模型在生成结构方面表现如何?通过微调实现分子几何结构的高质量预测

Joseph M. Cavanagh, Jonathan B. Arnold, Giovanni Battista Alteri, Andrew Gritsevskiy, Teresa Head-Gordon

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究探索大语言模型用于学习分子几何结构语言的微调方法,利用笛卡尔坐标或Z矩阵微调,能准确预测小分子平衡结构等,Z矩阵效果更好,且混入自然语言对微调可增强预测能力并保留预训练语言能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20379 2026-07-16 cs.AI 版本更新 83%

Policy of Thoughts: Scaling Test-Time Training for LLM Reasoning via Online Policy Evolution

思维策略:通过在线策略进化扩展大语言模型推理的测试时训练

Zhengbo Jiao, Hongyu Xian, Qinglong Wang, Yunpu Ma, Zhebo Wang, Zifan Zhang, Dezhang Kong, Meng Han

机构 * Binjiang Institute, Zhejiang University(浙江大学滨江学院) Shanghai University of Finance and Economics(上海财经大学) South China Normal University(华南师范大学) LMU Munich(慕尼黑大学) Wuhan University(武汉大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型复杂推理难题,提出思维策略(PoT)框架,通过高效探索机制生成候选解,用组相对策略优化更新LoRA适配器,实现推理策略实时进化,显著提升模型性能。

Comments Under Review, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13433 2026-07-16 cs.CL cs.CY 新提交 81%

When Rubrics Change: Cross-Rubric Generalization for Critical Thinking Essay Scoring

当评分标准改变时:批判性思维作文评分的跨评分标准泛化

Nischal Ashok Kumar, Payu Wittawatolarn, Sana Kang, Marisa C. Peczuh, Blair Lehman, Ryan Baker, Caitlin Mills, Sherry Lachman, Ruochen Sun, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Minnesota(明尼苏达大学) Brighter Research(更光明研究公司) Adelaide University(阿德莱德大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究跨评分标准泛化问题,采用含评分标准无关中间表示和目标作文监督的大语言模型微调框架,在增强数据集上实验,结果表明基于特征的中间结构和受控监督可提升对未见过评分标准的泛化能力。

Comments Published in AI for Education Day at SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30248 2026-07-16 cs.CV cs.LG 版本更新 81%

Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation

你的数据流形实际上是一个奖励模型:Shell-LCC 用于文本到视频生成

Shihao Zhang, Yunzhi Li, Yuguang Yan, Junzhe Zhang, Wei Zhao, Bohan Wang, Hanwang Zhang

机构 * Huawei Central Research Institute(华为中央研究院) Guangdong University of Technology(广东技术大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.LG

AI总结 提出 Shell-LCC 方法,通过建模高质量 SFT 数据的流形结构,提供密集、可微且几乎零成本的奖励信号,以提升文本到视频生成质量,减少低层失真。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23531 2026-07-16 cs.RO 版本更新 80%

BiliVLA: Scene-Aware Vision-Language-Action Model with Reinforcement Learning for Autonomous Biliary Endoscopic Navigation

BiliVLA: 基于强化学习的场景感知视觉-语言-动作模型用于自主胆道内镜导航

Jinsong Lin, Chi Kit Ng, Zhiyong Xiong, Zikang Pan, Yihan Hu, Tabassum Tamima, Ziyi Hao, Eddie Cheung, Jiewen Lai, Huxin Gao, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院) University of Cambridge(剑桥大学) University of California, Davis(加州大学戴维斯分校)

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 提出BiliVLA框架,将胆道内镜导航建模为指令条件化的视觉运动学习问题,结合场景感知监督和两阶段训练(SFT+GRPO),在ERCP子任务中实现91.96%的动作精度和84.85%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18685 2026-07-16 cs.CV cs.RO 版本更新 80%

Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents

超越描述:为具身智能体进行细粒度动作的认知基准测试

Dayong Liu, Chao Xu, Weihong Chen, Suyu Zhang, Juncheng Wang, Jiankang Deng, Baigui Sun, Yang Liu

机构 * Zhejiang University(浙江大学) Wolf 1069 b(沃尔夫1069b) Sany Group(三一集团) The Hong Kong Polytechnic University(香港理工大学) Imperial College London(帝国理工学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CFG-Bench基准测试,旨在评估具身智能体在物理交互中的细粒度动作能力,揭示现有MLLMs在高层次推理中的不足,并通过监督微调提升其性能。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏