Latent Alignment and Variational Attention
专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.LG
Comments accepted by NIPS 2018
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.LG
Comments accepted by NIPS 2018
专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV
Comments arXiv admin note: text overlap with arXiv:1406.2227
专题命中 VLM训练与架构 :VLM(abstract,comments)
Comments Minor changes to match published version. 11 pages incl. 3 figures. A&A in press. Latex processing requires A&A style file (l-aa.sty) and epsf.sty for the figures (both macros can be obtained from http://xxx.lanl.gov/ftp/hep-th/papers/macros/ ). Postscript and dvi+figures versions can be obtained via anonymous ftp to ftp://cdsxba.u-strasbg.fr/pub/incoming/kerins/vlm/
Journal ref Astron.Astrophys.322:709,1997
专题命中 VLM训练与架构 :VLM(abstract,comments)
Comments 16 pages, 7 figures, contributed chapter for Planets and Protostars V meeting (October 2005); full table of VLM binaries can be obtained at http://paperclip.as.arizona.edu/~nsiegler/VLM_binaries
基于大语言模型的生成式检索用于Snapchat内容推荐
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 该研究针对将预训练LLM转化为生成式检索器的挑战,设计了SnapLGR系统,通过三项核心优化实现了Snapchat短视频推荐效果的提升。
BridgeAlign:面向人文社科的偏好对齐框架
机构 * Alibaba Group(阿里巴巴集团) ; Ant Group(蚂蚁集团)
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 该研究针对人文社科领域的偏好对齐需求,提出BridgeAlign框架,经21万+合成偏好样本对齐后,使Qwen3-8B在17个基准测试中优于11个强基线,且人工偏好与知识能力无权衡。
TA-RAG:将语气感知作为检索增强生成的设计要务
机构 * Swinburne University of Technology(斯威本科技大学)
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 该研究针对标准RAG系统存在的语境脱耦问题,提出TA-RAG框架,将交流对齐与事实准确性并列为核心设计目标,明确语气感知是高风险语境下RAG系统的设计要务。
M³Prune:面向高效多模态多智能体检索增强生成的分层协同剪枝
专题命中 VLM训练与架构 :MLLM(abstract_cn)
AI总结 M³Prune是优化多模态多智能体检索增强生成的分层协同剪枝框架,通过剪枝冗余通信边提升性能与token效率,实验中优于单智能体及多智能体基准系统。
Comments Accepted by ACM MM2026
ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。
Comments Submitted to Journal of Biomedical Informatics (under review)
面向组合式电商查询的需求-证据对齐
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 针对现有电商查询重排序器忽略组合需求约束的问题,提出REAlign框架,通过区分需求状态、优化排序,在电商基准上提升了重排序效果。
PALMs:使用多构造基础理由对大语言模型中的群体偏好进行建模
机构 * University of Southern California(南加州大学) ; Information Sciences Institute(信息科学研究所)
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 该研究提出了群体对齐语言模型PALMs,通过结合心理与文化构造的理由进行偏好调优,在多维度评估中优于基准模型,且下游任务泛化能力强
学习目标调控感知窄化:自监督语音编码器的跨语言、分层、十种子研究
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 该研究通过十种子实验发现,自监督语音编码器的学习目标(而非架构)是感知窄化型表征变化的首要决定因素,重构与预测目标对非母语音素辨别能力的影响相反。
Comments 11 pages, 6 figures
TAB-PO:面向Token关键结构化生成的具有Token级自适应障碍的偏好优化
机构 * Yale University(耶鲁大学) ; Texas State University(德克萨斯州立大学)
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 针对结构化预测中偏好与拒绝对象仅少数token不同导致的梯度稀释和token侵蚀问题,提出基于混淆感知偏好构建和Token级自适应障碍的TAB-PO方法,在SciERC任务上显著提升关键指标。
基于Aries实验框架重新思考智能体服务系统的AI云基础设施
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 该研究针对自主智能体对传统LLM服务的挑战,提出Aries全栈实验框架,通过实验揭示服务系统的关键瓶颈,探讨智能体原生服务系统的设计愿景。
ZeroR@CHiPSAL 2026:用于尼泊尔表情包分类的对比学习两阶段视觉-语言适配
机构 * Pulchowk Campus, Institute of Engineering, Tribhuvan University(特里布万大学工程学院普尔乔克校区)
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 该研究针对尼泊尔表情包多模态仇恨言论与情感检测任务,适配RA-HMD框架,采用两阶段视觉-语言对比学习方法,取得两项任务的优异排名,为低资源南亚语言适配大模型提供了见解。
Comments 9 pages, 2 figures, system description paper for the CHiPSAL 2026 shared task at LREC 2026
Journal ref Proceedings of the Second Workshop on Challenges in Processing South Asian Languages (CHiPSAL 2026) @ LREC 2026, pages 275-283, Palma, Mallorca, Spain, 16 May 2026. ELRA Language Resources Association (ELRA). ISBN 978-2-493814-66-1
PMC-InterCPT:重新思考用于多模态持续预训练的医学交错数据
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Sun Yat-sen University(中山大学) ; InfiX.ai ; PolyU-Daya Bay Technology and Innovation Research Institute(PolyU-大亚湾技术与创新研究院)
专题命中 VLM训练与架构 :LLaVA(abstract)
AI总结 针对医学多模态持续预训练中图像-文本对数据存在的上下文缺失、结构噪声等问题,提出PMC-InterCPT交错语料库,通过恢复缺失标题、清洗文本、重建交错样本及LLM监督过滤,结合模态感知重采样,有效提升医学与通用多模态性能。
紧凑的任务对齐模仿学习用于实验室自动化
机构 * Spatial Robotics Research Center, Fujitsu Limited.(富士通株式会社空间机器人研究中心) ; Faculty of Science and Engineering, Waseda University(早稻田大学理工学部) ; National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 本文提出了一种紧凑的模仿学习框架,通过小基础模型和扩散变换器专家实现高效实验室自动化,实验显示其在三个任务中的高成功率。
迈向无监督预训练与监督神经知识图谱学习的统一统计理论
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 本研究针对知识图谱学习中数据与理论问题,提出含无监督预训练与监督学习的两阶段框架,建立非渐近风险界,经合成与真实实验验证其有效性。
Comments 49 pages, 5 figures, 7 tables
SalesSim:多模态语言模型作为零售用户模拟器的基准测试与对齐
机构 * Salesforce Research(Salesforce研究院) ; University of California Los Angeles(加州大学洛杉矶分校)
专题命中 VLM训练与架构 :multimodal large language model(abstract)
AI总结 SalesSim通过多轮多模态对话评估多模态大语言模型在模拟真实用户行为中的能力,发现模型在词汇多样性及决策一致性方面存在不足,并提出UserGRPO方法提升对话流畅度与决策对齐度。
反对用于检索的生成式模型:判别式语言模型作为有效的检索器
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 研究探讨大语言模型用于检索的问题,通过将其作为语义表示主干重振双塔检索架构,引入创新的双塔框架,经实验评估,该架构在公共基准和生产系统中表现出色,证明传统双塔范式结合现代学习后在工业检索中仍具竞争力。
Zing:大语言模型的社交智能
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 研究大语言模型社交智能,提出Zijing框架,含测量基准SoMBench、训练方法Zing及推理架构Actio,通过实验证明社交智能大语言模型在评估、内化和落地方面需协同发展。
EGR:使用共享语言模型的嵌入原生生成式检索
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 研究针对生成式检索在推荐和广告系统中的问题,提出EGR框架,利用共享语言模型在同一嵌入空间学习项目与用户表示,经联合对比训练,在多场景评估中表现出色,提升了转化率,简化了系统设计。
Comments Accepted to RecSys 2026
一种基于MLIR的大语言模型编译方法
机构 * Sophgo Inc(算能科技有限公司)
专题命中 VLM训练与架构 :InternVL(abstract)
AI总结 针对大语言模型在专用硬件部署的挑战,提出基于MLIR的编译方法,用TopOp和TpuOp方言表示模型,分阶段编译,在TPU-MLIR编译器等项目实现,支持多种模型及量化部署形式。
使用分层控制词汇表理解历史照片集中CLIP检索失败的原因
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 研究探讨用AAT词汇表的根面类型和层次深度解释CLIP在历史照片集检索的成败及微调作用,通过三个标注集研究视觉连贯性等指标,发现两指标可区分失败模式,根面类型有区分作用,微调对层次浅的术语更有效。
内容是留存之物:基于平行话语的不变语音分词
机构 * nyra labs(nyra实验室)
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 研究针对离散语音分词器问题,提出PINT方法,通过微调SSL编码器及相关损失和增强来提取共享残差,降低条件熵,使词元保留时间基础,实验证明该方法能有效提升效果,正确不变性对高效学习很关键。
Comments Accepted at Interspeech 2026
VENOMREC: 多模态交互性污染用于多模态大语言模型推荐系统中的定向推广
专题命中 VLM训练与架构 :multimodal large language model(abstract)
AI总结 VENOMREC通过跨模态交互性污染技术,在多模态大语言模型推荐系统中实现定向推广,有效提升推荐性能。
Squid:长上下文作为节能设备端语言模型的新模态
机构 * Nexa AI
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 研究针对设备端语言模型处理长上下文能耗高、延迟大的问题,提出Dolphin架构,用紧凑解码器提炼上下文信息,结合图像嵌入投影仪编码长文本,经实证评估,该方法提升了能源效率,降低了延迟,为设备端语言模型发展做贡献。
多头潜在控制:大语言模型智能体决策的统一接口
机构 * University of Alberta(阿尔伯塔大学) ; Huawei Technologies Canada Co., Ltd.(华为加拿大技术有限公司)
专题命中 VLM训练与架构 :VLM(abstract)
AI总结 研究大语言模型作智能体时的决策控制问题,提出多头潜在控制方法,通过读取冻结模型的隐藏状态轨迹生成控制信号,能在不修改模型的情况下进行事后适配,改善多模型系统质量成本权衡,减少大模型使用并提高工具使用决策质量。
VistaVLA:用于机器人操作的几何和语义感知3D高斯基础VLA
机构 * EmPACT Lab, Nanyang Technological University(南洋理工大学EmPACT实验室) ; Institute for Infocomm Research (I2R), A*STAR(资讯通信研究院(I2R),新加坡科技研究局)
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 研究针对VLA模型缺乏3D表示的问题,提出VistaVLA框架,通过3D高斯原语构建几何和语义感知的3D认知表示,利用MtQ机制压缩令牌,在模拟和真实环境评估中有效提升VLA性能,尤其在真实场景中显著提高成功率。
完美演示造就差劲教师:从关键运动片段学习鲁棒对齐
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)) ; Nanjing University(南京大学)
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 针对精细操作中流畅演示因压缩关键对齐动作导致策略学习不足的问题,提出数据级重采样和表示级STAIR特征,利用稠密运动感知监督提升策略鲁棒性。