arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-11 至 2026-05-11 共收录 415 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 30 篇

2512.05967 2026-05-11 cs.IR cs.AI cs.CL cs.LG 75%

Enhancing Retrieval-Augmented Generation with Entity Linking for Educational Platforms

通过实体链接增强教育平台的检索增强生成

Francesco Granata, Francesco Poggi, Misael Mongiovì

机构 * Department of Mathematics and Computer Science, University of Catania, Italy(卡塔尼亚大学数学与计算机科学系) Institute of Cognitive Sciences and Technologies (ISTC), National Research Council of Italy (CNR)(意大利国家研究委员会认知科学与技术研究所(ISTC))

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ELERAG架构,通过实体链接增强事实信号,提升教育问答系统在意大利语领域的准确性,实验显示其在专业领域表现优异,但通用领域效果不如交叉编码器。

Journal ref Big Data and Cognitive Computing, 10(4), 120. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07677 2026-05-11 cs.IR cs.AI cs.CL 73%

TRACE: Tourism Recommendation with Accountable Citation Evidence

TRACE:基于可问责引用证据的旅游推荐

Zixu Zhao, Sijin Wang, Yu Hou, Yuanyuan Xu, Yufan Sheng, Xike Xie, Wenjie Zhang, Won-Yong Shin, Xin Cao

机构 * UNSW Sydney(新南威尔士大学悉尼分校) University of Adelaide(阿德莱德大学) Yonsei University(延世大学) USTC(中国科学技术大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 TRACE通过多轮对话结合评论引用和显式拒绝机制,解决旅游推荐中信任、可验证性和适应性问题,提出三项能力差距并验证评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06859 2026-05-11 cs.CV cs.AI cs.LG 73%

Knowledge Transfer Scaling Laws for 3D Medical Imaging

三维医学影像中的知识迁移扩展定律

Ho Hin Lee, Dongna Du, Chu Wang, Yuankai Huo, Shi Gu, James C. Gee, Yifan Wu

机构 * Vanderbilt University(范德比大学) Zhejiang University(浙江大学) McGill University(麦吉尔大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 领域大模型 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了三维医学影像中不同域的预训练扩展规律,提出基于可转移性的数据分配方法,提升跨域迁移效果,实验表明该方法在疾病分类和器官分割任务中表现更优。

Comments 20 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07613 2026-05-11 cs.CL 70%

Intent-Driven Semantic ID Generation for Grounded Conversational News Recommendation

基于意图的语义ID生成用于 grounded 对话新闻推荐

Hongyang Su, Beibei Kong, Lei Cheng, Chengxiang Zhuo, Zang Li, Chenyun Yu

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Platform and Content Group, Tencent(腾讯平台与内容部)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出意图驱动的语义ID生成方法,通过多任务对齐和GPT-4链式推理蒸馏,实现意图到层级SID前缀的映射,提升新闻推荐的 grounded 性和冷启动用户推荐效果。

Comments Accepted at ACL 2026 Industry Track (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07039 2026-05-11 cs.LG 70%

PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents

PACEvolve++: 提高进化搜索代理的测试时学习

Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Shuo Chen, Zhankui He, Noveen Sachdeva, Weili Wang, Ed H. Chi, Shivaram Venkataraman, Wang-Cheng Kang, Derek Zhiyuan Cheng, Beidou Wang

机构 * Google(谷歌) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google DeepMind(谷歌DeepMind)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PACEvolve++通过强化学习框架提升进化搜索代理的测试时策略适应能力,采用可训练顾问生成并评估假设,结合前沿模型生成可执行候选,实现更快收敛和更稳定的测试时训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07447 2026-05-11 cs.CV cs.AI cs.CL cs.LG 67%

Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs

稀疏自编码器作为视觉语言模型中对抗攻击检测的即插即用防火墙

Hao Wang, Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh, Daisuke Kawahara

机构 * Magellan Technology Research Institute (MTRI)(马杰伦技术研究 institute) Waseda University(早稻田大学)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于稀疏自编码器的轻量级对抗攻击检测框架SAEgis,通过插入预训练VLM中的稀疏自编码模块,利用学习到的稀疏潜在特征检测对抗扰动输入,实验显示其在跨领域和跨攻击设置中表现优异,且无需额外对抗训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07443 2026-05-11 cs.DC 67%

RcLLM: Accelerating Generative Recommendation via Beyond-Prefix KV Caching

RcLLM:通过超越前缀KV缓存加速生成推荐

Zhan Zhao, Yuxin Wang, Amelie Chi Zhou

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 RcLLM通过超越前缀KV缓存技术,解决长个性化提示处理延迟问题,提升生成推荐的实时性与准确性。

Comments Accepted by ICDCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09850 2026-05-11 cs.CV 67%

Towards Explainable Industrial Anomaly Detection via Knowledge-Guided Latent Reasoning

面向可解释性工业异常检测的基于知识引导的潜在推理

Peng Chen, Chao Huang, Yunkang Cao, Chengliang Liu, Wei Wang, Wenqiang Wang, Mingbo Yang, Li Shen, Wenqi Ren, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 本文提出Reason-IAD框架,通过引入领域特定文本描述和熵驱动的潜在推理机制,提升工业异常检测的准确性和可解释性,实验表明其在多个任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07485 2026-05-11 cs.LG cs.AI 62%

Excluding the Target Domain Improves Extrapolation: Deconfounded Hierarchical Physics Constraints

排除目标领域提升外推:去偏分层物理约束

Tsuyoshi Okita

机构 * Kyushu Institute of Technology(九州理工大学)

专题命中 领域大模型 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出去偏分层门机制,通过识别温度偏倚污染,提升物理约束外推性能,实验显示排除目标域数据可提升39%的外推表现。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07345 2026-05-11 cs.CL cs.LG 62%

Mean-Pooled Cosine Similarity is Not Length-Invariant: Theory and Cross-Domain Evidence for a Length-Invariant Alternative

均值池化余弦相似度并非长度不变:理论和跨领域证据支持一种长度不变的替代方案

Sibayan Mitra, Dhruv Kumar

机构 * Birla Institute of Technology(比拉理工学院)

专题命中 领域大模型 :LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 研究指出均值池化余弦相似度在现代Transformer表示中并非长度不变,通过实验验证了其在跨语言Python接近性中的解释力,并提出中心核对齐(CKA)作为更优的替代方法。

Comments 9 pages, 6 figures. Submitted to the Mechanistic Interpretability Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07471 2026-05-11 cs.LG hep-ex 57%

Transfer Learning Across Fast- and Full-Simulation Domains in High-Energy Physics

在高能物理中跨快速模拟与全模拟领域的迁移学习

Matthias Schott, Lucie Flek

机构 * Institute of Physics, University of Bonn(波恩大学物理研究所) Bonn-Aachen International Center for Information Technology (b-it)(波恩-亚琛国际信息科技中心(b-it))

专题命中 领域大模型 :foundation model(abstract);分类 cs.LG

AI总结 本文研究了在LHC环境中快速模拟与全模拟数据集之间的迁移学习,通过三个任务验证了预训练模型在减少数据需求和提升性能方面的优势。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06879 2026-05-11 cs.LG q-bio.QM 57%

Better Protein Function Prediction by Modeling Survivorship Bias

通过建模幸存者偏差更好地预测蛋白质功能

Zhongmou Chao, Poompol Buathong, Ekaterina Selivanovitch, Susan Daniel, Peter I. Frazier

机构 * Smith School of Chemical and Biomolecular Engineering, Cornell University, USA(卡内基梅隆大学斯密斯化学与生物分子工程学院,美国)

专题命中 领域大模型 :language model(abstract);分类 cs.LG

AI总结 本文提出Evo-PU框架,利用突变知识建模幸存者偏差,提升单物种序列数据的功能预测性能,优于传统PU学习、OCC和PLMs。

Comments 29 pages, 12 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08040 2026-05-11 cs.HC 50%

ECNUClaw: A Learner-Profiled Intelligent Study Companion Framework for K-12 Personalized Education

ECNUClaw:面向K-12个性化教育的 learner-Profiled 智能学习伴侣框架

Yizhou Zhou, Jiayin Li, Zhi Zhang

专题命中 领域大模型 :LLM(abstract)

AI总结 ECNUClaw 通过构建五维学习者画像,实现个性化学习伴侣的实时适应,结合中国教育技术理论,支持七种中文大模型提供商。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 21 篇

2511.06571 2026-05-11 cs.CL cs.AI cs.LG 92%

Rep2Text: Decoding Full Text from a Single LLM Token Representation

Rep2Text:从单个LLM标记表示解码完整文本

Haiyan Zhao, Zirui He, Yiming Tang, Fan Yang, Ali Payani, Dianbo Liu, Mengnan Du

机构 * New Jersey Institute of Technology(新泽西理工学院) National University of Singapore(国立新加坡大学) Cisco Research(思科研究) Wake Forest University(威克森林大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨如何从LLM单个最后标记表示恢复原始文本,提出Rep2Text框架,通过可训练适配器将目标模型的最后标记表示映射到解码语言模型的token嵌入空间,实现文本自回归重建,实验显示在16-token序列中约半数token可被恢复且保持语义连贯。

Comments 18 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07271 2026-05-11 cs.CL cs.AI 91%

Understanding Performance Collapse in Layer-Pruned Large Language Models via Decision Representation Transitions

通过决策表示过渡理解层剪枝大型语言模型中的性能崩溃

Boyu Shi, Chang Liu, ChuanBao Gao, Xu Yang, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用重点实验室(东南大学),教育部,中国)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文通过决策表示过渡分析层剪枝对大型语言模型性能的影响,提出决策边际和选项频率两个指标,揭示剪枝导致决策阶段转变的机制,发现剪枝沉默阶段会引发性能崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06812 2026-05-11 cs.AI 90%

Towards Security-Auditable LLM Agents: A Unified Graph Representation

迈向安全可审计的LLM代理:一种统一的图表示

Chaofan Li, Lyuye Zhang, Jintao Zhai, Siyue Feng, Xichun Yang, Huahao Wang, Shihan Dou, Yu Ji, Yutao Hu, Yueming Wu, Yang Liu, Deqing Zou

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) Donghua University(东华大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Agent-BOM统一图表示,用于解决LLM代理系统中执行意图与物理事件间的语义鸿沟问题,通过构建分层属性有向图实现安全审计与风险评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03182 2026-05-11 cs.SE cs.LG 89%

Understanding Robustness of Model Editing in Code LLMs

理解代码LLM中模型编辑的鲁棒性

Vinaik Chhetri, Moghis Fereidouni, A. B Siddique, Umar Farooq

机构 * Louisiana State University(路易斯安那州立大学) University of Kentucky(肯塔基大学)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究代码LLM在API更新下的模型编辑鲁棒性,评估不同方法在单次和连续编辑下的性能,发现多数方法在泛化和特定性上表现不佳,且连续编辑导致性能显著下降。

Comments 26 pages, 14 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09839 2026-05-11 cs.AI cs.LG 88%

Steered LLM Activations are Non-Surjective

引导的LLM激活不是满射的

Aayush Mishra, Daniel Khashabi, Anqi Liu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了激活引导是否能通过文本提示实现,证明引导行为在实际中无法通过提示复现,区分了白盒引导与黑盒提示的差异。

Comments 10 pages main text. ICLR 2026 Workshops (Sci4DL, Re-Align)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06765 2026-05-11 cs.CL cs.AI 86%

VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing

VITA-QinYu:用于角色扮演和演唱的表达性口语语言模型

Jiacheng Xu, Heting Gao, Liufei Xie, Zhenchuan Yang, Lijiang Li, Yiting Chen, Bin Zhang, Meng Chen, Chaoyu Fu, Weifeng Zhao, Wenjiang Zhou

机构 * QinYu Team(秦宇团队) VITA-Team(VITA团队)

专题命中 知识编辑与模型理解 :language model(title,abstract);SLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 VITA-QinYu是首个支持角色扮演和演唱生成的端到端口语语言模型,通过混合语音-文本范式和多代码本音频令牌提升表达性,优于同类模型7个百分点,在演唱和对话任务中均取得显著成果。

Comments https://tme-lyra-lab.github.io/VITA-QinYu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07148 2026-05-11 cs.CV 85%

Uncovering and Shaping the Latent Representation of 3D Scene Topology in Vision-Language Models

揭示和塑造视觉-语言模型中3D场景拓扑的潜在表示

Haoming Wang, Wei Gao

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 知识编辑与模型理解 :language model(title,abstract);SFT(abstract,abstract_cn)

AI总结 本文研究了视觉-语言模型是否能构建3D环境的拓扑表示,通过隔离空间子空间并数学塑造潜在表示,证明其与场景3D高斯核图的拉普拉斯特征映射一致,并在空间任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07209 2026-05-11 cs.CL cs.AI cs.LG 84%

Hallucination Detection via Activations of Open-Weight Proxy Analyzers

通过开放权重代理分析器的激活进行幻觉检测

Akshita Singh, Prabesh Paudel, Siddhartha Roy

机构 * Khoury College of Computer Sciences(科里学院计算机科学学院) Northeastern University(东北大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种代理分析器框架,通过本地部署的小型开放权重模型检测大语言模型的幻觉,采用变压器文本处理特性构建18种特征,并在多个模型架构上训练堆叠集成模型,最终在RAGTruth数据集上取得优于ReDeEP的AUC和F1分数。

Comments 12 pages, 4 figures. Code available at https://github.com/hallu-detect/llm_hallucination_detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08045 2026-05-11 cs.CL 81%

Uncertainty-Aware Structured Data Extraction from Full CMR Reports via Distilled LLMs

基于蒸馏LLM的全CMR报告不确定性感知结构化数据提取

Yi Yu, Parker Martin, Zhenyu Bu, Yixuan Liu, Yi-Yu Zheng, Orlando Simonetti, Yuchi Han, Yuan Xue

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本文提出CMR-EXTR框架,通过蒸馏LLM将自由文本CMR报告转为结构化数据并提供字段置信度,实现无监督推理和不确定性整合,达到99.65%的变量级准确率。

Comments Accepted to ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07935 2026-05-11 cs.AI cs.MA 81%

TraceFix: Repairing Agent Coordination Protocols with TLA+ Counterexamples

TraceFix:基于TLA+反例的智能体协调协议修复

Shuren Xia, Qiwei Li, Taqiya Ehsan, Jorge Ortiz

机构 * Rutgers University(新泽西州普林斯顿大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TraceFix通过TLA+反例迭代修复智能体协调协议,实现高效验证与执行,提升任务完成率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04447 2026-05-11 cs.LG cs.AI 81%

Mixture of Masters: Sparse Chess Language Models with Player Routing

大师混合:具有玩家路由的稀疏国际象棋语言模型

Giacomo Frisoni, Lorenzo Molfetta, Davide Freddi, Gianluca Moro

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Mixture-of-Masters模型,通过稀疏专家网络实现国际象棋生成的多样化与可控性,优于传统密集模型和GPT基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07748 2026-05-11 cs.CL 79%

TextLDM: Language Modeling with Continuous Latent Diffusion

TextLDM:基于连续潜在扩散的语言建模

Jiaxiu Jiang, Jingjing Ren, Wenbo Li, Bo Wang, Haoze Sun, Yijun Yang, Jianhui Liu, Yanbing Zhang, Shenghe Zheng, Yuan Zhang, Haoyang Huang, Nan Duan, Wangmeng Zuo

机构 * Joy Future Academy(京东探索研究院) HIT(Harbin Institute of Technology) HKUST(GZ)(Hong Kong University of Science and Technology (Guangzhou))

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 TextLDM将视觉潜在扩散框架应用于文本生成,通过Representation Alignment提升文本表示质量,在OpenWebText2上训练后优于现有扩散语言模型,匹配GPT-2性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06885 2026-05-11 cs.LG cs.AI 73%

Don't Retrain, Align: Adapting Autoregressive LMs to Diffusion LMs via Representation Alignment

无需再训练,对齐:通过表征对齐将自回归语言模型适应到扩散语言模型

Fred Zhangzhi Peng, Alexis Fox, Anru R. Zhang, Alexander Tong

机构 * Duke University(杜克大学) AITHYRA

专题命中 知识编辑与模型理解 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出REPR-ALIGN方法,通过表征对齐将自回归模型转换为扩散模型,实现4倍训练加速,尤其在低数据情况下效果显著。

Comments Code available at https://github.com/pengzhangzhi/Open-dLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07622 2026-05-11 cs.CL 70%

Is She Even Relevant? When BERT Ignores Explicit Gender Cues

她真的相关吗?当BERT忽视显性性别线索时

Jonas Klein, Chiara Manna, Eva Vanmassenhove

机构 * Department of Computational Cognitive Science, Tilburg University(蒂尔堡大学计算认知科学系)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了荷兰BERT模型在训练过程中性别信息的出现时机,发现模型在短句模板中难以更新性别表示,导致默认男性解读。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06610 2026-05-11 cs.LG cs.CV 70%

SoftSAE: Dynamic Top-K Selection for Adaptive Sparse Autoencoders

SoftSAE: 动态Top-K选择用于自适应稀疏自编码器

Jakub Stępień, Marcin Mazur, Jacek Tabor, Przemysław Spurek

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SoftSAE通过动态Top-K机制调整稀疏自编码器的激活特征数量,以适应不同输入复杂度,提升表示匹配度和解释长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07019 2026-05-11 cs.CV cs.AI 70%

LensVLM: Selective Context Expansion for Compressed Visual Representation of Text

LensVLM:压缩文本视觉表示的选取性上下文扩展

Roy Xie, Dan Friedman, Donghan Yu, Bowen Pan, Christopher Fifty, Jang-Hyun Kim, Xianzhi Du, Zhe Gan, Vivek Rathod, Bhuwan Dhingra

机构 * Apple(苹果公司) Duke University(杜克大学)

专题命中 知识编辑与模型理解 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 LensVLM通过选择性上下文扩展提升压缩视觉表示的准确性,在4.3倍压缩下表现优异,且在多模态任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07825 2026-05-11 cs.MM cs.CV 67%

Anisotropic Modality Align

各向异性模态对齐

Xiaomin Yu, Yijiang Li, Yuhui Zhang, Hanzhen Zhao, Yue Yang, Hao Tang, Yue Song, Xiaobin Hu, Chengwei Qin, Shuicheng Yan, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) NUS(国立新加坡大学) UCSD(加州大学圣地亚哥分校) Stanford(斯坦福大学) PKU(北京大学) THU(清华大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文研究了多模态模型中模态间转换的可行性,提出各向异性模态对齐方法,通过几何修正框架提升单模态数据的多模态训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏