arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-31 至 2026-03-31 共收录 405 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 107 篇

2603.27526 2026-03-31 cs.LG 57%

Q-BIOLAT: Binary Latent Protein Fitness Landscapes for QUBO-Based Optimization

Q-BIOLAT:基于QUBO的二进制隐式蛋白质适应度景观优化

Truong-Son Hy

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出Q-BIOLAT框架,利用二进制隐式空间优化蛋白质适应度景观,通过QUBO模型结合预训练嵌入和结构化表示,提升组合优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27251 2026-03-31 cs.CV cs.AI 57%

Zero-shot Vision-Language Reranking for Cross-View Geolocalization

跨视图地理定位的零样本视觉-语言重排序

Yunus Talha Erzurumlu, John E. Anderson, William J. Shuart, Charles Toth, Alper Yilmaz

机构 * The Ohio State University(俄亥俄州立大学) US Army Corps of Engineers Geospatial Research Lab(美国陆军工程兵团地理空间研究实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出两阶段框架,利用零样本视觉语言模型进行重排序,通过对比实验发现基于成对比较的策略能有效提升跨视图地理定位的Top-1准确率。

Comments 7 pages, 4 figures. Accepted to XXV ISPRS Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27187 2026-03-31 cs.LG 57%

Omni-Modal Dissonance Benchmark: Systematically Breaking Modality Consensus to Probe Robustness and Calibrated Abstention

多模态不和谐基准:系统性打破模态共识以探测鲁棒性及校准的回避

Zabir Al Nazi, Shubhashis Roy Dipta, Md Rizwan Parvez

机构 * University of California, Riverside(加州大学河滨分校) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 评测与基准 :prompting(abstract);分类 cs.LG

AI总结 本文提出OMD-Bench,通过系统性破坏多模态一致性来评估模型的鲁棒性和校准能力,发现模型在模态冲突时存在过度回避或严重回避的问题,且链式推理提示虽提升回避一致性,但加剧了过度自信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27101 2026-03-31 cs.CV cs.LG 57%

PRUE: A Practical Recipe for Field Boundary Segmentation at Scale

PRUE:一种大规模田界边界分割的实用配方

Gedeon Muhawenayo, Caleb Robinson, Subash Khanal, Zhanpei Fang, Isaac Corley, Alexander Wollam, Tianyi Gao, Leonard Strnad, Ryan Avery, Lyndon Estes, Ana M. Tárano, Nathan Jacobs, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) Microsoft AI for Good(微软人工智能公益) Washington University in St. Louis(圣路易斯华盛顿大学) Oregon State University(俄勒冈州立大学) Wherobots Clark University(克拉克大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出一种结合U-Net和复合损失函数的分割方法,提升田界分割的性能和鲁棒性,实现了76%的IoU和47%的object-F1,为大规模可靠田界分割提供了实用框架。

Comments 12 pages, 3 figures, supplementary material. Accepted at CVPR 2026 (IEEE/CVF Conference on Computer Vision and Pattern Recognition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26994 2026-03-31 cs.LG q-bio.QM 57%

ImmSET: Sequence-Based Predictor of TCR-pMHC Specificity at Scale

ImmSET:基于序列的TCR-pMHC特异性预测方法

Marco Garcia Noceda, Matthew T Noakes, Andrew FigPope, Daniel E Mattox, Bryan Howie, Harlan Robins

机构 * Adaptive Biotechnologies

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出ImmSET模型,通过多序列交互建模提升TCR-pMHC特异性预测精度,展示了其在不同数据规模下的鲁棒性和性能优势。

Comments Accepted to ML4H 2025 (Proceedings Track). To appear in PMLR 297

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11967 2026-03-31 cs.CV cs.AI cs.RO 57%

Securing the Skies: A Comprehensive Survey on Anti-UAV Methods, Benchmarking, and Future Directions

守护天空:反无人机方法的全面调查、基准测试与未来方向

Yifei Dong, Fengyi Wu, Sanjian Zhang, Guangyu Chen, Yuzhi Hu, Masumi Yano, Jingdong Sun, Siyu Huang, Feng Liu, Qi Dai, Zhi-Qi Cheng

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文综述了反无人机领域,探讨了分类、检测与跟踪等核心方法,分析了数据合成、多模态融合等新兴技术,并指出实时性能、 stealth 检测等领域的不足,旨在推动下一代防御策略的发展。

Comments Accepted to CVPR 2025 Anti-UAV Workshop (Best Paper Award), 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26690 2026-03-31 cs.RO cs.AI cs.CV 57%

SpatialPoint: Spatial-aware Point Prediction for Embodied Localization

SpatialPoint: 体感-aware 点预测用于具身定位

Qiming Zhu, Zhirui Fang, Tianming Zhang, Chuanxiu Liu, Xiaoke Jiang, Lei Zhang

机构 * Visincept Research(Visincept 研究院) Tsinghua University(清华大学) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA))

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出SpatialPoint框架,通过整合结构化深度信息提升具身定位性能,采用260万样本RGB-D数据集进行训练与评估,在真实机器人部署中验证了其在抓取、放置和导航任务中的有效性。

Comments 19 pages, 12 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26670 2026-03-31 cs.IR cs.CL 57%

SRAG: RAG with Structured Data Improves Vector Retrieval

SRAG:基于结构化数据的RAG改进向量检索

Shalin Shah, Srikanth Ryali, Ramasubbu Venkatesh

机构 * Anvai AI

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 SRAG通过引入结构化信息提升向量检索性能,实验显示在问答系统中提升30%的评分,尤其在比较、分析和预测类问题上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28363 2026-03-31 cs.CV 50%

SEA: Evaluating Sketch Abstraction Efficiency via Element-level Commonsense Visual Question Answering

SEA:通过元素级常识视觉问答评估草图抽象效率

Jiho Park, Sieun Choi, Jaeyoon Seo, Minho Sohn, Yeana Kim, Jihie Kim

机构 * Dongguk University(东国大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出SEA指标,通过元素级常识视觉问答评估草图抽象效率,引入CommonSketch数据集,验证了草图抽象效率的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28012 2026-03-31 cond-mat.mtrl-sci 50%

A Comparative Study of Molecular Dynamics Approaches for Simulating Ionic Conductivity in Solid Lithium Electrolytes

分子动力学方法在模拟固态锂电解质离子导电性中的比较研究

Dounia Shaaban Kabakibo, Félix Therrien, Yoshua Bengio, Michel Côté, Hongyu Guo, Homin Shin, Alex Hernandez-Garcia

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文比较了密度泛函理论和通用机器学习互原子势在模拟21种固态锂电解质离子导电性中的性能,发现两者表现相当,尽管MACE在GPU上比DFT快350倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20770 2026-03-31 cs.CV 50%

OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspective

OccuFly:一种用于从空中视角进行语义场景补全的3D视觉基准

Markus Gross, Sai B. Matha, Aya Fahmy, Rui Song, Daniel Cremers, Henri Meess

机构 * Fraunhofer Institute IVI(弗劳恩霍夫交通与基础设施系统研究所) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) UCLA(加州大学洛杉矶分校)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出OccuFly基准,通过无LiDAR相机数据生成框架,提供21类语义的20000+样本,评估视觉模型在空中场景中的局限性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13953 2026-03-31 cs.CV 50%

From Unlearning to UNBRANDING: A Benchmark for Trademark-Safe Text-to-Image Generation

从去学习到去品牌化:一个商标安全的文本到图像生成基准测试

Dawid Malarz, Filip Manjak, Maciej Zięba, Przemysław Spurek, Artur Kasymov

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究所)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出去品牌化任务,通过细粒度去除商标和隐含结构特征,同时保持语义连贯性,并构建基准数据集和评估框架,解决现有品牌检测器无法捕捉抽象商标的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08282 2026-03-31 cs.CV cs.MM cs.SD 50%

PAVAS: Physics-Aware Video-to-Audio Synthesis

PAVAS:物理感知的视频到音频合成

Oh Hyun-Bin, Yuhta Takida, Toshimitsu Uesaka, Tae-Hyun Oh, Yuki Mitsufuji

机构 * POSTECH(浦项科技大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团公司) KAIST(韩国科学技术院)

专题命中 评测与基准 :language model(abstract)

AI总结 PAVAS通过引入物理推理,结合物理参数估计器和物理驱动音频适配器,生成符合物理规律的音频,优于现有视频到音频生成模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08673 2026-03-31 cs.CV 50%

Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation

通过摄像头思考:一个统一的多模态模型用于以摄像头为中心的理解与生成

Kang Liao, Size Wu, Zhonghua Wu, Linyi Jin, Chao Wang, Yikai Wang, Fei Wang, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) SenseTime Research(商汤科技研究院) University of Michigan(密歇根大学) Max-Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 评测与基准 :instruction tuning(abstract)

AI总结 本文提出Puffin模型,通过将摄像头视为语言,实现以摄像头为中心的多模态理解与生成,结合语言回归和扩散生成,提升空间感知能力,实验表明其在跨视角任务中表现优异。

Comments Accepted by ICLR2026. Project Page: https://kangliao929.github.io/projects/puffin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27697 2026-03-31 cs.CV 50%

Can Unsupervised Segmentation Reduce Annotation Costs for Video Semantic Segmentation?

无需标注的分割能否减少视频语义分割的标注成本?

Samik Some, Vinay P. Namboodiri

机构 * University of Bath(巴斯大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文探讨利用未标注视频帧和粗略标注降低视频分割标注成本的方法,通过SAM和SAM 2模型实现自动掩码生成,减少约三分之一的标注需求,同时发现数据集帧多样性比数量更重要。

Comments Published in ICVGIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27011 2026-03-31 cs.SI 50%

ParsCN: A Persian Dataset for Counter-Narrative Generation to Combat Online Hate Speech

ParsCN:一种针对网络仇恨言论的Persian数据集用于生成反叙事以对抗在线仇恨言论

Zahra Safdari Fesaghandis, Suman Kalyan Maity

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出ParsCN数据集,用于生成对抗网络仇恨言论的反叙事,通过结合文化导向的人工标注与少样本LLM增强生成,提升低资源语言的反叙事质量。

Comments Accepted at the International AAAI Conference on Web and Social Media (ICWSM 2026); Paper Information: 16 pages, 3 Figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26938 2026-03-31 cs.CV 50%

From 3D Pose to Prose: Biomechanics-Grounded Vision--Language Coaching

从3D姿态到 prose:基于生物力学的视觉-语言指导框架

Yuyang Ji, Yixuan Shen, Shengjie Zhu, Yu Kong, Feng Liu

机构 * Department of Computer Science, Drexel University(德雷塞尔大学计算机科学系) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

专题命中 评测与基准 :LLM(abstract)

AI总结 BioCoach通过融合视觉和3D骨骼运动学,提出一种生物力学导向的视觉-语言框架,利用三阶段流程生成精准文本反馈,提升健身指导的个性化和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24903 2026-03-31 cs.CV 50%

Self-Supervised Learning for Knee Osteoarthritis: Diagnostic Limitations and Prognostic Value of Hospital Data

自监督学习在膝骨关节炎中的应用:医院数据的诊断局限性与预后价值

Haresh Rengaraj Rajamohan, Yuxuan Chen, Kyunghyun Cho, Cem M. Deniz

机构 * Department of Physics, J.K. Institute of Science(物理系,J.K. 科学研究所) World Scientific University(世界科学大学) University of Intelligent Studies(智能研究大学) Center for Data Science, New York University(数据科学中心,纽约大学) Bernard and Irene Schwartz Center for Biomedical Imaging, New York University Langone Health(伯纳德和艾琳·施瓦茨生物医学成像中心,纽约大学朗格尼健康中心) Department of Radiology, New York University Langone Health(放射学系,纽约大学朗格尼健康中心) Perlmutter Cancer Center, New York University Langone Health(珀尔马特癌症中心,纽约大学朗格尼健康中心)

专题命中 评测与基准 :pretraining(abstract)

AI总结 本研究评估自监督学习是否能提升膝骨关节炎的诊断与预后建模,发现医院数据在诊断分级中表现有限,但对预后预测有显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11410 2026-03-31 cs.CV 50%

Seeing Isn't Orienting: A Cognitively Grounded Benchmark Reveals Systematic Orientation Failures in MLLMs Supplementary

看见并不意味着定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yang, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出DORI基准,通过分解定向为四个维度,揭示多模态模型在物体定向任务中的系统性不足,指出其依赖分类启发式而非几何推理。

Comments This is a replacement and updated version for submission arXiv:2505.21649 : Right Side Up? Disentangling Orientation Understanding in MLLMs with Fine-grained Multi-axis Perception Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24265 2026-03-31 cs.IR cs.HC 50%

Beyond the Click: A Framework for Inferring Cognitive Traces in Search

超越点击:一种从行为日志中推断认知轨迹的框架

Saber Zerhoudi, Michael Granitzer

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出一种基于信息觅食理论的框架,通过标注公开数据集生成认知标签,验证认知轨迹在行为特征薄弱时的显著提升效果,并开源工具和代码以支持未来认知感知用户模拟研究。

Journal ref Proceedings of the 48th European Conference on Information Retrieval (ECIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22950 2026-03-31 cs.CV cs.RO 50%

RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video

RobotSeg: 一种用于图像和视频中分割机器人的模型和数据集

Haiyang Mei, Qiming Huang, Hai Ci, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出RobotSeg模型和数据集,解决机器人分割的挑战,通过结构增强的记忆关联器、机器人提示生成器和标签高效训练策略,实现结构感知、自动化的高效分割。

Comments CVPR 2026. Project page: https://github.com/showlab/RobotSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26934 2026-03-31 cs.CV 50%

Leveraging Avatar Fingerprinting: A Multi-Generator Photorealistic Talking-Head Public Database and Benchmark

利用虚拟形象指纹:一个多生成者逼真说话头公共数据库和基准

Laura Pedrouzo-Rodriguez, Luis F. Gomez, Ruben Tolosana, Ruben Vera-Rodriguez, Roberto Daza, Aythami Morales, Julian Fierrez

机构 * BiometricsAI, Universidad Autónoma de Madrid(马德里自治大学生物识别人工智能实验室)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出AVAPrintDB数据库和基准,用于研究虚拟形象指纹识别,分析不同生成器和数据集迁移对身份验证的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26926 2026-03-31 cs.GR 50%

TopoCtrl: Post-Optimization Topology Editing Toward Target Structural Characteristics

TopoCtrl: 向目标结构特性进行后优化拓扑编辑

Hongrui Chen, Dat Quoc Ha, Josephine V. Carstensen, Faez Ahmed

专题命中 评测与基准 :foundation model(abstract)

AI总结 TopoCtrl通过后优化控制框架,利用预训练拓扑基础模型的潜在空间,实现对结构特性如成员厚度、特征成员长度等的显式引导编辑,提升结构设计的可控性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26751 2026-03-31 cs.CV 50%

Survey on Remote Sensing Scene Classification: From Traditional Methods to Large Generative AI Models

遥感场景分类综述:从传统方法到大生成AI模型

Qionghao Huang, Can Hu

专题命中 评测与基准 :foundation model(abstract)

AI总结 综述探讨了遥感场景分类从传统方法到大生成AI模型的演变,涵盖深度学习和生成AI的核心方法及最新进展,强调了自监督基础模型和多模态数据融合的挑战与未来方向。

Comments Accepted in Journal of King Saud University Computer and Information Sciences

Journal ref Journal of King Saud University Computer and Information Sciences, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 62 篇

2603.26796 2026-03-31 cs.LG cs.AI stat.ML 90%

Robust Batch-Level Query Routing for Large Language Models under Cost and Capacity Constraints

在成本和容量限制下大型语言模型的鲁棒批量级查询路由

Jelena Markovic-Voronov, Kayhan Behdin, Yuanda Xu, Zhengze Zhou, Zhipeng Wang, Rahul Mazumder

机构 * LinkedIn(领英) MIT(麻省理工学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种考虑资源的批量级查询路由框架,通过优化模型分配以提高鲁棒性和效率,实验显示在对抗性批处理下性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26735 2026-03-31 cs.CV cs.AI 89%

Distilled Large Language Model-Driven Dynamic Sparse Expert Activation Mechanism

distilled 大语言模型驱动的动态稀疏专家激活机制

Qinghui Chen, Zekai Zhang, Zaigui Zhang, Kai Zhang, Dagang Li, Wenmin Wang, Jinglin Zhang, Cong Liu

机构 * Laoshan Laboratory(崂山实验室) Jinan Inspur Data Technology Co., Ltd(济南浪潮数据技术有限公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出 DS-MoE 框架,通过文本引导的动态路由和轻量多尺度理解,解决跨类模糊问题,实验证明其在 PCB 等数据集上优于现有纯视觉模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28576 2026-03-31 cs.CE 89%

Tiered Super-Moore's Law: Price Evolution, Production Frontiers, and Market Competition in Large Language Model Inference Services

分层超级摩尔定律:大型语言模型推理服务中的价格演变、生产前沿与市场竞争

Mingdeng Du

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文系统分析了大型语言模型推理市场中token定价,发现token价格下降约600倍,并提出分层超级摩尔假说,揭示软件和架构创新驱动价格下降,而非硬件进步。

Comments 23 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02343 2026-03-31 cs.LG cs.AI 88%

MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models

MicroMix:基于微缩格式的高效混合精度量化用于大语言模型

Wenyuan Liu, Haoqian Meng, Yilun Luo, Yafei Zhao, Peng Zhang, Xindian Ma

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 MicroMix通过引入微缩格式实现大语言模型的高效混合精度量化,平衡精度与效率,实现接近FP16的性能,且在多个任务中保持无损准确性。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27094 2026-03-31 cs.CR cs.AI cs.LG 88%

Sovereign Context Protocol: An Open Attribution Layer for Human-Generated Content in the Age of Large Language Models

主权上下文协议:大型语言模型时代的人类生成内容开放归属层

Praneel Panchigar, Torlach Rush, Matthew Canabarro

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Sovereign Context Protocol,旨在为大型语言模型提供开放的归属层,解决人类生成内容在价值链中的可见性问题,通过标准化LLM与创作者数据的连接方式,实现访问事件的记录、许可和归属。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27650 2026-03-31 cs.CV 88%

V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models

V-CAST:面向高效视频大语言模型的曲率感知时空剪枝

Xinying Lin, Xuyang Liu, Yiyu Wang, Teng Ma, Wenqi Ren

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shenzhen Loop Area Institute(深圳河套学院) Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出V-CAST,一种无需训练的视频长上下文推理剪枝策略,通过曲率引导的时空分配模块和双锚点空间选择机制,提升视频大语言模型的效率与性能。

Comments Code: \url{https://github.com/xinyouu/V-CAST}

详情

展开后加载摘要…

URL PDF HTML 收藏