arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-18 至 2026-03-18 共收录 285 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 44 篇

2603.15923 2026-03-18 stat.ML cs.LG 70%

Learning to Recall with Transformers Beyond Orthogonal Embeddings

基于非正交嵌入的Transformer学习回忆

Nuri Mert Vural, Alberto Bietti, Mahdi Soltanolkotabi, Denny Wu

机构 * University of Toronto and Vector Institute(多伦多大学和向量研究所) Flatiron Institute(Flatiron研究所) University of Southern California(南加州大学) New York University and Flatiron Institute(纽约大学和Flatiron研究所)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在非正交嵌入条件下,单层Transformer在简单token检索任务中的存储容量,揭示了样本量、嵌入维度和序列长度之间的乘积关系。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23592 2026-03-18 cs.RO cs.AI cs.SE 70%

KEEP: A KV-Cache-Centric Memory Management System for Efficient Embodied Planning

KEEP: 一种面向高效具身规划的KV缓存中心化内存管理系统

Zebin Yang, Tong Xie, Baotong Lu, Shaoshan Liu, Bo Yu, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits, Peking University(集成电路学院,北京大学) Shenzhen Institute of Artificial Intelligence(深圳人工智能研究院) Microsoft Research(微软研究院) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进创新中心)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出KEEP系统,通过静态动态内存构建算法、多跳内存重计算算法和层平衡内存加载,提升具身规划效率,实验表明在ALFRED数据集上速度提升2.68倍,优于CacheBlend方法。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16818 2026-03-18 cs.PF 67%

Leveraging LLMs for Structured Information Extraction and Analysis from Cloud Incident Reports (Work In Progress Paper)

利用LLMs进行云事件报告的结构化信息提取与分析(工作进展论文)

Xiaoyu Chu, Shashikant Ilager, Yizhen Zang, Sacheendra Talluri, Alexandru Iosup

专题命中 效率与部署 :LLM(abstract);prompting(abstract)

AI总结 本文探讨利用先进LLM从非结构化云事件报告中提取关键信息,通过6种提示策略和6种LLM模型评估,发现轻量模型在准确率、成本和延迟上具有更好的平衡,而SotA模型在准确性上更高但代价更大。

Journal ref 17th ACM/SPEC International Conference on Performance Engineering (ICPE Companion 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16008 2026-03-18 cs.HC cs.CY 67%

CoDesignAI: An AI-Enabled Multi-Agent, Multi-User System for Collaborative Urban Design at the Conceptual Stage

CoDesignAI:一种基于AI的多智能体、多用户系统,用于概念阶段的协同城市设计

Zhaoxi Zhang, Ruolin Wu, Feiyang Ren, Sridevi Turaga, Tamir Mendel

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出CoDesignAI,通过整合大语言模型与空间映射服务,支持城市设计概念阶段的多用户协作,提升公众参与效率与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15618 2026-03-18 cs.CV 67%

Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models

先看再行动:增强视觉基础表示以用于视觉-语言-动作模型

Yulin Luo, Hao Chen, Zhuangzhe Wu, Bowen Sui, Jiaming Liu, Chenyang Gu, Zhuoyang Liu, Qiuxuan Feng, Jiale Yu, Shuo Gu, Peng Jia, Pheng-Ann Heng, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Simplexity Robotics(Simplexity机器人公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与部署 :LLM(abstract);foundation model(abstract)

AI总结 本文提出DeepVision-VLA框架,通过视觉-语言混合变压器提升视觉表示,引入动作引导视觉剪枝技术,实现在模拟和现实任务中提升9.0%和7.5%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15298 2026-03-18 cs.SE cs.HC 67%

The Impact of AI-Assisted Development on Software Security: A Study of Gemini and Developer Experience

AI辅助开发对软件安全的影响:对Gemini和开发者经验的研究

Nadine Jost, Benjamin Berens, Manuel Karl, Stefan Albert Horstmann, Martin Johns, Alena Naiakshina

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 研究探讨AI工具Gemini对代码安全的影响,发现编程经验显著提升安全性,无法完全被AI替代。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19570 2026-03-18 cs.CV 67%

VALD: Multi-Stage Vision Attack Detection for Efficient LVLM Defense

VALD:为高效LVLM防御的多阶段视觉攻击检测

Nadav Kadvil, Malak Fares, Ayellet Tal

机构 * Technion – Israel Institute of Technology(技术学院 – 以色列理工学院)

专题命中 效率与部署 :LLM(abstract);language model(abstract)

AI总结 本文提出VALD方法,通过图像变换与智能数据整合快速过滤清洁输入,结合文本嵌入空间和LLM解决攻击问题,实现高效准确的LVLM防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14177 2026-03-18 cs.LG cs.AI 62%

Artificial intelligence-enabled single-lead ECG for non-invasive hyperkalemia detection: development, multicenter validation, and proof-of-concept deployment

人工智能赋能的单导联ECG用于无创高钾血症检测:开发、多中心验证与概念验证部署

Gongzheng Tang, Qinghao Zhao, Guangkun Nie, Yujie Xiao, Shijia Geng, Donglin Xie, Shun Huang, Deyun Zhang, Xingchen Yao, Jinwei Wang, Kangyin Chen, Luxia Zhang, Shenda Hong

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文开发了基于AI的单导联ECG系统Pocket-K,用于无创高钾血症筛查,并通过多中心研究验证其性能,展示了在慢性肾病和心力衰竭患者中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15190 2026-03-18 cs.LG cs.AI 62%

Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning

遮蔽自回归变分加速:快速推理使强化学习实用

Yuxuan Gu, Weimin Bai, Yifei Wang, Weijian Luo, He Sun

机构 * Peking University(北京大学) Rice University(Rice大学) hi-lab, Xiaohongshu Inc(小红书实验室,小红书公司)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MARVAL框架,通过压缩扩散链为单步自回归生成,提升推理效率并使强化学习实用化,实现了生成模型的快速采样和偏好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02314 2026-03-18 cs.AR cs.AI cs.LG 62%

NeuroSim V1.5: Improved Software Backbone for Benchmarking Compute-in-Memory Accelerators with Device and Circuit-level Non-idealities

NeuroSim V1.5:用于评估计算在内存加速器的改进软件基础架构

James Read, Ming-Yen Lee, Wei-Hsing Huang, Yuan-Chun Luo, Anni Lu, Shimeng Yu

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology(电子工程学院,佐治亚理工学院)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 NeuroSim V1.5通过整合TensorRT量化流程、灵活噪声注入方法、扩展设备支持和优化仿真速度,提升了计算在内存加速器的设计与验证能力。

Comments 15 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16738 2026-03-18 cs.AI 57%

MedCL-Bench: Benchmarking stability-efficiency trade-offs and scaling in biomedical continual learning

MedCL-Bench:评估生物医学持续学习中的稳定性-效率权衡和扩展性

Min Zeng, Shuang Zhou, Zaifu Zhan, Rui Zhang

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本文提出MedCL-Bench,通过十个生物医学NLP数据集评估十一种持续学习策略,揭示不同方法在保留率、迁移能力和计算成本上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16368 2026-03-18 cs.RO cs.LG 57%

Encoding Predictability and Legibility for Style-Conditioned Diffusion Policy

为风格条件扩散策略编码可预测性和可读性

Adrien Jacquet Crétides, Mouad Abrini, Hamed Rahimi, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique (ISIR), CNRS UMR7222, Inserm ERL U1150, Sorbonne Université, Paris, France(智能系统与机器人研究所(ISIR),法国国家科学研究中心(CNRS)UMR7222,法国国家医学研究院(Inserm)ERL U1150,索邦大学,巴黎,法国)

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 本文提出SCDP框架,通过环境配置约束预训练扩散模型轨迹生成,平衡效率与透明运动,在低歧义场景中保持最优效率,提升可读性。

Comments Submitted to the 18th International Conference on Social Robotics (ICSR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05413 2026-03-18 cs.SD 50%

Building Enterprise Realtime Voice Agents from Scratch: A Technical Tutorial

从零构建企业级实时语音代理:技术教程

Jielin Qiu, Zixiang Chen, Liangwei Yang, Ming Zhu, Zhiwei Liu, Juntao Tan, Wenting Zhao, Rithesh Murthy, Roshan Ram, Akshara Prabhakar, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 效率与部署 :LLM(abstract)

AI总结 本文介绍如何从零构建企业级实时语音代理,通过Deepgram、vLLM和ElevenLabs实现端到端流程,展示最佳实践与代码实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22896 2026-03-18 cs.RO 50%

DySL-VLA: Efficient Vision-Language-Action Model Inference via Dynamic-Static Layer-Skipping for Robot Manipulation

DySL-VLA:通过动态-静态层跳过实现高效的视觉-语言-动作模型推理以用于机器人操作

Zebin Yang, Yijiahao Qi, Tong Xie, Bo Yu, Shaoshan Liu, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits, Peking University(集成电路学院,北京大学) Shenzhen Institute of Artificial Intelligence(深圳人工智能研究所) School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出DySL-VLA框架,通过动态跳过视觉-语言-动作层来降低计算成本,提升机器人操作任务的实时性能,实验表明在Calvin数据集上成功长度提升2.1%,参数减少85.7倍,速度提升3.75倍。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11130 2026-03-18 cs.CV cs.RO 50%

Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matching

快速基础立体视觉:实时零样本立体匹配

Bowen Wen, Shaurya Dewan, Stan Birchfield

机构 * NVIDIA

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出Fast-FoundationStereo,首次在实时帧率下实现强零样本泛化能力,通过知识蒸馏、神经网络架构搜索和结构剪枝,提升效率并保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 21 篇

2603.15643 2026-03-18 cs.AI 90%

GSI Agent: Domain Knowledge Enhancement for Large Language Models in Green Stormwater Infrastructure

GSI代理:面向绿色雨水基础设施的大语言模型领域知识增强

Shaohuang Wang

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

AI总结 本文提出GSI代理,通过监督微调、检索增强生成和代理推理流程,提升大语言模型在绿色雨水基础设施任务中的领域知识能力,实验表明其在领域任务中的表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12131 2026-03-18 cs.LG cs.HC 90%

SolarGPT-QA: A Domain-Adaptive Large Language Model for Educational Question Answering in Space Weather and Heliophysics

SolarGPT-QA: 一个用于空间天气和太阳物理学教育问答的领域自适应大语言模型

Santosh Chapagain, MohammadReza EskandariNasab, Onur Vural, Shah Muhammad Hamdi, Soukaina Filali Boubrahimi

机构 * Utah State University(犹他州立大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 SolarGPT-QA基于LLaMA-3基础模型构建,通过科学文献和大规模问答数据训练,提升空间科学教育中的问答能力,展现领域自适应在科学准确性和教育效果上的平衡。

Comments This is preliminary work towards a broader SolarGPT framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16325 2026-03-18 cs.SE cs.AI 89%

A Human-Centred Architecture for Large Language Models-Cognitive Assistants in Manufacturing within Quality Management Systems

面向制造业质量管理体系的以人为本的大型语言模型-认知助手架构

Marcos Galdino, Johanna Grahl, Tobias Hamann, Anas Abdelrazeq, Ingrid Isenhardt

机构 * Laboratory for Machine Tools and Production Engineering (WZL) of RWTH Aachen University(鲁姆哈根工业大学机械加工与生产工程实验室)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出一种基于组件的架构,用于将LLM-CAs集成到制造业QMS中,提升灵活性、可扩展性和知识管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16567 2026-03-18 cs.CL cs.AI 86%

Characterizing Delusional Spirals through Human-LLM Chat Logs

通过人类-大语言模型聊天日志表征妄想螺旋

Jared Moore, Ashish Mehta, William Agnew, Jacy Reese Anthis, Ryan Louie, Yifan Mai, Peggy Yin, Myra Cheng, Samuel J Paech, Kevin Klyman, Stevie Chancellor, Eric Lin, Nick Haber, Desmond C. Ong

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) University of Chicago(芝加哥大学) Independent Researcher(独立研究者) Harvard Belfer Center(哈佛贝尔弗中心) University of Minnesota(明尼苏达大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析19名受聊天机器人影响用户的历史对话日志,揭示了妄想螺旋中用户与聊天机器人互动模式及心理危害,提出28项代码用于评估对话中的妄想、自伤和AI拟人化现象。

Comments To appear at ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00917 2026-03-18 cs.CL cs.AI 86%

Prompt Sensitivity and Answer Consistency of Small Open-Source Language Models for Clinical Question Answering in Low-Resource Healthcare

小开源语言模型在低资源医疗场景中的提示敏感性与答案一致性

Shravani Hariprasad

机构 * Independent Researcher(独立研究者)

专题命中 领域大模型 :language model(title,abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了五种开源模型在三个医疗问答数据集上的表现,发现一致性与准确性独立,Llama 3.2在准确性与可靠性上表现最佳,但领域预训练不足以保证结构化医疗问答的正确性。

Comments 30 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16526 2026-03-18 cs.AI 85%

Exploring different approaches to customize language models for domain-specific text-to-code generation

探索不同方法以定制语言模型用于领域特定的文本到代码生成

Luís Freire, Fernanda A. Andaló, Nicki Skafte Detlefsen

机构 * Technical University of Denmark(丹麦技术大学) The LEGO Group(乐高集团)

专题命中 领域大模型 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文探讨了如何通过合成数据集定制小型语言模型用于领域特定的代码生成,比较了少样本提示、检索增强生成和LoRA微调三种方法,发现LoRA在准确性和领域对齐上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16236 2026-03-18 cs.IR cs.LG 85%

ReFORM: Review-aggregated Profile Generation via LLM with Multi-Factor Attention for Restaurant Recommendation

ReFORM:基于LLM与多因素注意力的评论聚合资料生成用于餐厅推荐

Moonsoo Park, Seulbeen Je, Donghyeon Park

机构 * University of Southern California, USA(美国南加州大学) Sejong University, South Korea(韩国世宗大学)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ReFORM框架,利用LLM和多因素注意力机制从评论中生成用户和物品资料,提升餐厅推荐的鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16622 2026-03-18 cs.CL 83%

Domain Mixture Design via Log-Likelihood Differences for Aligning Language Models with a Target Model

通过对数似然差异设计领域混合以对齐语言模型与目标模型

Ryo Kishino, Riku Shiomi, Hiroaki Yamagiwa, Momose Oyama, Hidetoshi Shimodaira

机构 * Kyoto University(京都大学) RIKEN(理化学研究所)

专题命中 领域大模型 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文通过设计训练数据的领域混合,利用对数似然空间对齐模型方向,减少KL散度并提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04017 2026-03-18 cs.AI cs.LG physics.ao-ph 82%

Zephyrus: An Agentic Framework for Weather Science

Zephyrus:一种用于气象科学的代理框架

Sumanth Varambally, Marshall Fisher, Jas Thakker, Yiwei Chen, Zhirui Xia, Yasaman Jafari, Ruijia Niu, Manas Jain, Veeramakali Vignesh Manivannan, Zachary Novack, Luyu Han, Srikar Eranky, Salva Rühling Cachay, Taylor Berg-Kirkpatrick, Duncan Watson-Parris, Yi-An Ma, Rose Yu

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出Zephyrus框架,结合大语言模型与天气数据交互,解决传统模型缺乏语言推理的问题,通过新基准测试展示其在天气任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11098 2026-03-18 cs.CV cs.RO 82%

Vision-Language Models for Infrared Industrial Sensing in Additive Manufacturing Scene Description

面向增材制造场景的红外工业感知的视觉-语言模型

Nazanin Mahjourian, Vinh Nguyen

机构 * Department of Mechanical and Aerospace Engineering, Michigan Technological University(机械与航空航天工程系,密歇根技术大学)

专题命中 领域大模型 :language model(title,abstract);foundation model(abstract)

AI总结 本文提出VLM-IRIS框架,通过预处理红外图像为RGB兼容输入,利用CLIP编码器实现无监督的零样本工作件存在检测,展示了在热成像中的高精度应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15840 2026-03-18 cs.LG cs.AI cs.CL stat.ML 80%

When Stability Fails: Hidden Failure Modes Of LLMS in Data-Constrained Scientific Decision-Making

当稳定性失效:在数据受限的科学决策中LLM的隐藏故障模式

Nazia Riasat

机构 * North Dakota State University(北达科他州立大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示LLM在数据受限科学决策中稳定性不足的问题,通过控制评估框架发现其在正确性、提示敏感性和输出有效性方面的缺陷。

Comments 13 pages, 5 figures. Accepted at ICLR 2026 Workshop: I Can't Believe It's Not Better (ICBINB 2026). OpenReview: https://openreview.net/pdf?id=vf8vs2ibso

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15688 2026-03-18 cs.SD cs.LG 79%

PulmoVec: A Two-Stage Stacking Meta-Learning Architecture Built on the HeAR Foundation Model for Multi-Task Classification of Pediatric Respiratory Sounds

PulmoVec:基于HeAR基础模型的两阶段堆叠元学习架构,用于儿童呼吸音的多任务分类

Izzet Turkalp Akbasli, Oguzhan Serin

机构 * Department of Pediatric Intensive Care Medicine, Life Support Center, Hacettepe University(儿科重症医学科、生命支持中心、哈切塔佩大学) Department of Pediatric Emergency Medicine, Life Support Center, Hacettepe University Faculty of Medicine(儿科急诊医学科、生命支持中心、哈切塔佩大学医学院)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出PulmoVec框架,基于HeAR模型实现儿童呼吸音的多任务分类,通过堆叠元学习提升分类性能,展示了其在儿科呼吸医学中的应用潜力。

Comments 14 pages, 2 figures, 4 tables; supplementary material included (4 tables, 3 multi-panel figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25117 2026-03-18 cs.SE 78%

Towards Reliable Generation of Executable Workflows by Foundation Models

面向通过基础模型生成可执行工作流的可靠性

Sogol Masoumzadeh, Keheliya Gallaba, Dayi Lin, Ahmed E. Hassan

专题命中 领域大模型 :foundation model(title,abstract)

AI总结 本文提出利用静态分析反馈改进基础模型生成的工作流,通过Timon静态分析器检测并修复缺陷,提升工作流的可靠性与自动化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16411 2026-03-18 cs.CL eess.AS 77%

RECOVER: Robust Entity Correction via agentic Orchestration of hypothesis Variants for Evidence-based Recovery

RECOVER:通过假设变体的代理协作进行证据驱动的实体纠正

Abhishek Kumar, Aashraya Sachdeva

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对ASR中罕见和领域特定术语的实体识别难题,RECOVER框架通过代理协作利用多个假设,结合LLM纠正,提升实体识别准确率和召回率。

Comments Under review. Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16372 2026-03-18 cs.CV 75%

InViC: Intent-aware Visual Cues for Medical Visual Question Answering

InViC:面向医疗视觉问答的意图感知视觉线索

Zhisong Wang, Ziyang Chen, Zanting Ye, Hongze Zhu, Yefeng Zheng, Yong Xia

机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, School of Computer Science and Engineering, Northwestern Polytechnical University, Xi’an 710072, China(集成空天地海大数据应用技术国家工程实验室,计算机科学与工程学院,西北工业大学,西安710072,中国) Westlake University(西湖大学) Southern Medical University(南方医科大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出InViC框架,通过引入Cue Tokens Extraction模块和两阶段微调策略,提升医疗视觉问答中意图对齐的视觉证据利用,验证了瓶颈化训练在提高可信度上的有效性。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏