From Prompts to Preferences: An Open-Source Platform for Generative AI-Enhanced Conjoint Analysis
从提示到偏好:生成式AI增强联合分析的开源平台
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 提出一个开源、自托管的联合分析调查平台,利用生成式AI(大语言模型和文本到图像模型)创建集成刺激格式,降低研究门槛,并通过概念验证研究展示其有效性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
从提示到偏好:生成式AI增强联合分析的开源平台
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 提出一个开源、自托管的联合分析调查平台,利用生成式AI(大语言模型和文本到图像模型)创建集成刺激格式,降低研究门槛,并通过概念验证研究展示其有效性。
复用设计空间:理论、方法与应用
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 提出一种针对特定应用约束的复用设计空间探索方法,以机器学习工作流中多个二维标量场分析为例,通过三步设计流程和预设计步骤,识别出相对最优的默认复用设计及用户可控的微小变体。
通过波斯谚语条件故事生成实现LLM中的约束语义解压缩
机构 * Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究所,卡塔姆大学,伊朗) ; School of Electrical and Computer Engineering, College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,工程学院,德黑兰大学,伊朗)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 提出约束语义解压缩任务,通过波斯谚语条件故事生成测试大语言模型的抽象到实现能力,构建PAND数据集,发现解压缩差距,并表明显式推理和迭代细化可部分缓解。
帮助图表讲述它们的故事!基于论文的视频生成解释复杂科学图表
机构 * University of Maryland, College Park(马里兰大学学院市分校)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 提出MINARD流水线,从图表及其论文生成基于区域分解的叙述性视频,并发布FigTalk基准,在自动和人工评估中优于现有方法。
Comments Webpage: https://minard.vercel.app/
利用可解释深度学习发现太阳风流相互作用区的新前兆
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 提出轻量级Transformer模型SIREN,基于11个太阳风参数逐时间步检测流相互作用区,通过自注意力机制和积分梯度归因揭示质子密度和磁场强度为主要前兆,并发现横向速度分量作为新特征。
Comments Manuscript Under Review. 22 pages with 8 figures, including appendix and references
PP-OCRv6: 从1.5M到34.5M参数,在OCR任务上超越十亿级视觉语言模型
机构 * PaddlePaddle Team, Baidu Inc.(百度公司飞桨团队)
专题命中 文档图表理解 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出轻量级OCR系统PP-OCRv6,通过统一MetaFormer架构和结构化重参数化,在服务器到边缘设备上以少数量级参数超越十亿级VLM,中模型识别准确率83.2%,检测Hmean 86.2%。
放大关键信息:面向视觉文本理解的注意力引导自适应渲染
机构 * Michigan State University(密歇根州立大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 针对视觉语言模型在视觉文本理解任务中存在的定位与利用脱节问题,提出无需训练、模型无关的注意力引导自适应渲染方法AGAR,通过放大关键文本跨度提升模型性能。
GAE: 利用可泛化动作专家释放VLM的物理潜力
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 提出通用动作专家(GAE),通过稀疏几何接口将VLM的高层意图转化为连续动作轨迹,采用动作预训练-点云微调(APPF)方案解耦动作动力学与几何基础,实现跨视觉域、视角和指令的强泛化。
Goal2Pixel: 将目标锚定到像素以实现视觉语言导航
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Nanyang Technological University(南洋理工大学)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);grounding(title,abstract);vision-language model(abstract);分类 cs.CV
AI总结 提出Goal2Pixel范式,通过将连续环境中的视觉语言导航(VLN-CE)重新定义为可导航像素锚定,利用图像平面作为统一空间接口,预测可见导航像素并反投影为3D航点,结合可见性感知关键帧记忆和坐标感知辅助损失,在减少VLM调用次数的同时实现竞争性性能。
Comments 8 pages
基于多模态大语言模型的移动用户体验推理:任务、基准与方法
机构 * Ant Group(蚂蚁集团)
专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 提出UXBench基准(2000个VQA样本)评估多模态大模型在UI推理上的能力,并设计UI-UX模型,通过奖励路由和不对称过渡奖励机制在UXBench上达到0.7963准确率,超越Claude-4.5-Sonnet。
Comments 10 pages, 6 figures, Accepted at CVPR 2026 Findings
MaskWAM:统一掩码提示与预测的世界-动作模型
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Tencent Robotics X(腾讯机器人X实验室) ; Tsinghua University(清华大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.LG
AI总结 提出MaskWAM,通过统一掩码输入与预测的混合Transformer架构,解决世界-动作模型的空间瓶颈,提升策略泛化能力,在LIBERO等任务上显著优于基线。
V-JEPA 2.1: 解锁视频自监督学习中的密集特征
机构 * FAIR at Meta(Meta的FAIR) ; Universidad de Zaragoza(萨拉戈萨大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 提出V-JEPA 2.1系列自监督模型,通过密集预测损失、深度自监督、多模态分词器和有效缩放,学习图像和视频的密集高质量视觉表示,在多个基准上取得最优性能。
测量塑性:面向视觉-语言模型的传感器级自适应
机构 * University of Seoul(首尔大学)
专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV
AI总结 提出多视角物理提示(MVP)用于测试时自适应,通过将相机曝光三角(ISO、快门速度、光圈)作为物理提示,在传感器层面进行自适应,无需梯度或模型修改,在ImageNet-ES上优于数字方法。
Comments Accepted to the ICML 2026 Workshop on Continual Adaptation at Scale
一种用于自动混凝土护栏设计的轻量级多智能体框架
机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) ; Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑系) ; School of Architecture, University of Miami(迈阿密大学建筑学院)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI
AI总结 提出基于AutoGen的“生成-评估-优化”闭环多智能体框架,实现混凝土护栏自动设计,准确率超98%,且8B参数轻量模型可优于631B旗舰模型。
RGB-S: 用于鲁棒灵巧操作的图像对齐触觉显著性
机构 * ShanghaiTech University(上海科技大学) ; Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV
AI总结 提出RGB-S框架,通过正向运动学和相机标定将触觉传感器位置投影到RGB图像平面,生成力调制高斯显著性图,显式对齐触觉与视觉,在严重遮挡下灵巧操作成功率提升26.7个百分点。
Comments 20 pages, 7 figures
RAG投毒的影响因素
专题命中 幻觉与鲁棒性 :grounding(abstract)
AI总结 通过432种配置的全因子实验,研究数据集、检索器类型、检索深度、数据库组成、分块策略和生成模型对RAG系统投毒鲁棒性的影响,发现检索器架构、数据集和检索深度是主要因素,且投毒脆弱性源于多组件交互。
Comments 10 pages, 3 figures, 2 Tables, conference KES-2026 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems
NOVA: 面向RAG系统中鲁棒大语言模型的噪声感知言语置信度校准
机构 * HKUST(香港科技大学) ; UIUC(伊利诺伊大学香槟分校) ; Northwestern University(西北大学)
专题命中 幻觉与鲁棒性 :grounding(abstract)
AI总结 提出NOVA框架,通过规则引导的监督微调,解决检索增强生成中噪声上下文导致的过度自信问题,在域内和域外分别提升ECE 10.9%和8.0%。
GeoWorld-VLM:从世界模型中获取几何结构用于视觉-语言模型
机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) ; Kempner Institute for the Study of Natural and Artificial Intelligence(凯普纳自然与人工智能研究 institute) ; Harvard University(哈佛大学)
专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 GeoWorld-VLM通过将冻结的摄像机条件视频世界模型的几何结构转移到视觉-语言模型中,提升空间关系推理能力,实验显示在两个不同架构上均提升了约4%的性能。
自进化视觉语言模型用于图像质量评估:基于投票与排序
机构 * City University of Hong Kong(香港城市大学) ; ByteDance Inc.(字节跳动公司)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV
AI总结 提出EvoQuality框架,通过自一致性生成伪标签,利用群体相对策略优化迭代提升VLM的图像质量感知能力,无监督下在多个IQA基准上超越监督方法。
Comments Published as a conference paper at ICLR 2026
SeamEdit: 一种用于大图像语义编辑的黑盒VLM无关流水线
机构 * Technische Universität Darmstadt(达姆施塔特工业大学) ; Fine-Arts Educator, Yuncheng Middle School(运城中学美术教师)
专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV
AI总结 提出SeamEdit,一种无需训练、模型无关的流水线,通过五阶段后处理解决大图像分块编辑中的语义变形、对齐漂移和接缝伪影问题,实现高质量语义编辑。
Comments 19 pages, 9 figures, 2 tables
OpenMedQ:面向医学视觉语言模型的广泛开放预训练
机构 * Stanford University(斯坦福大学) ; Stanford University School of Medicine(斯坦福大学医学院) ; Ghent University(根特大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出OpenMedQ,在14个数据集(约335万样本)上预训练医学视觉语言模型,在PathVQA上BLEU-1达75.9,超越562B参数的Med-PaLM M,并在8个未见医学分类任务上取得最高平均macro-F1(0.757)。
Comments Medical Imaging with Deep Learning (MIDL) 2026, Short Paper Track
跨模态掩码组合概念建模以增强视觉-语言组合性
机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部脑启发智能感知与认知重点实验室) ; Independent Researcher(独立研究员)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出MACCO框架,通过掩码一个模态的组合概念并从另一模态完整上下文重建,增强视觉-语言模型的组合理解能力,在五个基准上显著提升。
Comments Accepted to ACL 2026 Main Conference, 25 pages
CausalMoE:基于模式路由异构专家的十亿规模多模态基础模型用于格兰杰因果发现
机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) ; National Institute of Health Data Science, and Institute for Artificial Intelligence, Peking University(北京大学健康医疗大数据国家研究院、人工智能研究院)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出CausalMoE,一种十亿规模多模态格兰杰因果基础模型,通过模式路由混合异构专家解耦动态机制,结合因果自注意力与LLM/VLM先验,实现稀疏因果图恢复,在监督和少样本场景中达到最优。
MLUBench: 多模态大语言模型终身遗忘评估基准
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 提出MLUBench基准,评估多模态大模型在连续遗忘请求下的性能,发现现有方法存在累积退化,并揭示多模态对齐保持的挑战,提出LUMoE方法缓解退化。
Comments 36 pages, accepted to the ICML 2026
基于贝叶斯条件先验的多标签测试时自适应
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.LG
AI总结 提出贝叶斯条件先验估计(BCP),一种无梯度的测试时自适应方法,通过在线估计锚定条件先验注入标签依赖性,提升冻结视觉语言模型在多标签识别中的分布偏移鲁棒性。
Comments accepted by ICML2026
分析与改进医学LVLMs中的细粒度偏好优化
机构 * York University(约克大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Queen’s University(女王大学)
专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 针对医学大视觉语言模型在事实一致性、视觉定位和临床对齐方面的不足,提出一种结合双向令牌级KL正则化和视觉对比定位目标的细粒度在线偏好优化框架,通过最小编辑模型输出构建偏好对,仅修正临床错误片段,显著提升诊断准确性。
MultiToP:学习修补视觉令牌以减轻视频大型多模态模型中的幻觉
机构 * Zhejiang University(浙江大学) ; Sun Yat-sen University(中山大学) ; East China Normal University(华东师范大学)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 提出MultiToP框架,通过轻量级视觉令牌修补器动态替换不可靠视觉令牌,结合信息引导排名校准和稀疏正则化,在不修改原模型情况下减少视频多模态模型幻觉,显著提升F1分数和问答准确率。
Comments Preprint
VISTA:视频交互时空分析基准
机构 * University of Central Florida(中央佛罗里达大学) ; BITS Pilani(比特斯理工学院) ; Ho Chi Minh City University of Science(胡志明市科学大学) ; Amazon GenAI Project(亚马逊生成人工智能项目)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出VISTA基准,通过分解视频为实体、动作和关系,实现开放集多实体多动作的时空理解评估,揭示传统指标掩盖的偏差。
Comments Accepted to CVPR 2026 Workshop on Pixel-level Video Understanding in the Wild (PVUW)
ECA:面向开放图像到文本生成的高效持续对齐
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.CV、cs.LG
AI总结 提出ECA方法,通过混合查询模块、Fisher动态扩展和字典重放,实现无需旧数据的持续对齐,缓解灾难性遗忘,提升开放图像到文本生成的增量学习性能。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)
通过检索增强强化微调进行类比推理学习
机构 * Meta Superintelligence Labs(Meta超级智能实验室) ; Rice University(莱斯大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 提出RA-RFT框架,通过黄金相关性蒸馏训练检索器,并结合强化微调利用类比推理轨迹,提升数学推理性能。