Sycamore: Characterizing Synthetic Personas for Evaluating Genomics Visualization Retrieval
Sycamore:用于评估基因组可视化检索的合成身份表征
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 Sycamore通过三种条件探针设计评估基因组可视化检索系统,探讨合成身份在真实用户反馈中的表现及影响。
Comments 8 pages, 6 figures
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
Sycamore:用于评估基因组可视化检索的合成身份表征
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 Sycamore通过三种条件探针设计评估基因组可视化检索系统,探讨合成身份在真实用户反馈中的表现及影响。
Comments 8 pages, 6 figures
复制者-优化机制:一种面向持久条件动力学的尺度相对形式化及其在基于同意的元伦理学中的应用
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出一种尺度相对的形式化框架,统一复制者-突变动力学与价格选择-传输模型,通过摩擦、合法性和信念传递三个核心概念,从社会契约论独立推导出与生物学相同的结构,并建立描述性动力学与工具性规范性的桥梁,避免实然-应然谬误。
Comments 67 pages, 1 table, Lean 4 verification appendix (machine-checked). v2: substantially expanded from v1; adds formal-verification and identifiability sections and corrects references
基于机载视觉语言模型的多智能体机器人控制
机构 * Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙技术大学数学与信息科学学院)
专题命中 GUI与屏幕智能体 :vision-language model(title);vision language model(abstract)
AI总结 研究针对视觉语言模型用于机器人控制的挑战,提出多智能体系统架构,在机载硬件部署智能体,用紧凑型VLMs并经微调及新型编排智能体,经硬件在环模拟验证,证明该机载架构可行高效,有实际应用潜力且模拟环境已开源。
Comments 6 pages, 2 figures, accepted to 24th International Conference on Practical applications of Agents and Multi-Agent Systems (PAAMS'26)
迈向可靠的空地车辆协作:用于实地部署的集成规划与自主框架
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; DEVCOM Army Research Laboratory(陆军研究实验室)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision language model(abstract)
AI总结 研究针对无人机长时间任务飞行续航受限问题,提出集成规划与自主框架。通过深度强化学习规划器解决协同路由问题,引入标准化API弥合规划与执行差距,还有轻量级重新规划器,经实验验证系统在动态任务中有强大协同导航和适应性。
用于无人机机器人和双手操作的视觉语言动作(VLA)模型综述
机构 * Chef Robotics ; RovifyLab ; IT Application Research Center, Jeonbuk Regional Branch ; Department of Electrical, Computer and Software Engineering(电气与计算机软件工程系)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 综述2017 - 2026年183篇文献,围绕视觉语言动作模型在无人机机器人和双手操作方面的应用,涵盖多维度,表明双手VLA相关策略可转移至无人机系统,还确定了两领域的14个研究方向。
Comments 56 pages, 11 figures, 16 tables
GUI代理是否足够专注?通过语义层面的UI元素注入实现自动化干扰
机构 * SAIS, UCAS(中国科学院大学人工智能学院) ; SIST, ShanghaiTech University(上海科技大学信息科学与技术学院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 本文提出语义层面UI元素注入方法,通过在截图上叠加安全对齐且无害的UI元素来误导代理的视觉基础。实验显示,该方法在五个受害者模型上提升了攻击成功率,并证明注入元素可作为持久吸引器。
Comments Accepted by ECCV 2026, public code at https://github.com/HashTAG00002/UI-Injection
基于中间谱子空间视角的视觉语言模型对抗脆弱性研究
机构 * University of the Bundeswehr Munich(慕尼黑联邦国防军大学) ; University of Wrocław(弗罗茨瓦夫大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究基于Transformer的视觉语言模型对抗脆弱性,提出白盒谱子空间引导攻击(SSGRA),通过将中间表示与特定子空间对齐来攻击,实验显示其比现有基线更有效,还为模型对抗脆弱性提供谱解释,助力提升鲁棒性。
人工智能中的递归自我改进:从有界自我优化到自主研究循环
机构 * University of California, Riverside (UCR)(加州大学河滨分校) ; AlphaAvatar(阿尔法阿凡达) ; Illinois Institute of Technology (IIT)(伊利诺伊理工学院)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI
AI总结 研究人工智能系统自身改进,通过对1250篇论文调查区分有界自我优化与开放式递归自我改进(RSI),考察评估器设计空间并排序信号,发现自我改进强度与层次相关,失败模式源于违规,指出治理级测量是薄弱环节。
Comments 42 pages, 6 figures
人工智能理解成像吗?计算成像任务中智能体人工智能的系统基准测试
机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校) ; Glass Imaging(玻璃成像公司)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI
AI总结 研究人工智能在计算成像任务中的表现,提出ImagingBench基准测试,涵盖五类20个任务及三种评估设置,对多模态系统测试发现智能体模型比专门方法弱,该基准可测差距与跟踪进展。
Comments 14 pages, 11 figures. Preprint / work in progress. Paper Webpage: https://cirp-lab.github.io/imagingbench
POPS:通过提示优化参数抖动恢复多模态大语言模型中未学习的多模态知识
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; DEVCOM Army Research Laboratory(陆军研究实验室)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.LG
AI总结 研究针对多模态大语言模型中隐私敏感信息擦除不彻底问题,提出POPS对抗策略,通过提示后缀优化生成潜在私人示例并微调模型,实验揭示现有MMU算法弱点,POPS能近乎完全恢复敏感信息,暴露隐私保护漏洞。
面向冻结视觉语言模型的VLM感知元光学前端设计
机构 * Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系) ; School of Computational Science and Engineering, Georgia Institute of Technology(佐治亚理工学院计算科学与工程学院) ; Department of Electronic Engineering, Hanyang University(汉阳大学电子工程系)
专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title);分类 cs.CV
AI总结 提出CODA框架,通过可微成像和伴随梯度更新优化连续密度元光学前端,直接优化冻结CLIP分类器的交叉熵损失,在ImageNet-100上将零样本准确率从53.75%提升至65.41%,并跨模型和数据集泛化。
Comments 18 pages, 6 figures, 3 tables
视觉语言模型中的奖励估值:快感缺乏背后的因果机制
机构 * EPFL(苏黎世联邦理工学院)
专题命中 VLM训练与架构 :vision language model(title,abstract);vision-language model(abstract);分类 cs.LG
AI总结 研究探讨视觉语言模型中奖励估值情况,基于神经科学观点,通过有针对性扰动识别奖励预期单元,测试其因果作用,发现模型存在奖励估值和预期缺陷,结果反映了人工智能模型与人类平行的奖励估值回路。
用于PET引导的全身MRI转换的异质性自适应扩散薛定谔桥
机构 * The University of Sydney(悉尼大学) ; Fudan University Shanghai Cancer Center(复旦大学附属上海肿瘤医院) ; Beijing Normal University(北京师范大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对PET-MR扫描时间长的问题,提出异质性自适应扩散薛定谔桥(HA-DSB)框架,通过整合视觉语言模型嵌入及PET先验,利用双阶段引导机制,实现全身MRI转换,提升不同区域尤其是病变区域的转换质量。
Comments Accepted at MICCAI 2026
忠实视觉归因只需一个良好的初始化
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)
专题命中 VLM训练与架构 :LLaVA(abstract);MLLM(abstract);分类 cs.CV
AI总结 研究忠实视觉归因中掩码优先问题,介绍CoPAIR和TRACE两种仅向前方法,用于构建紧凑的top-k证据掩码。在多个模型和任务上实验,初始化搜索方法达新前沿,TRACE+贪心在多模态语言模型归因中表现优,直接的TRACE掩码有高修复率。
利用基础模型提升材料分类的准确性
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Duke University(杜克大学) ; Waseda University(早稻田大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出一种利用基础模型克服数据限制并提升分类准确性的新框架,通过生成高质量数据集和融合视觉语言模型先验知识,有效提高材料分类性能。
MedPMC:一种用于为基础模型扩展高保真医学多模态数据的系统框架
机构 * Yale University(耶鲁大学) ; Korea University(韩国大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; The University of Queensland(昆士兰大学) ; The University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心) ; University of Washington(华盛顿大学) ; Microsoft Research(微软研究院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 研究针对医学多模态基础模型受高质量临床数据限制问题,提出MedPMC框架,将文献转化为高保真基础设施。经实验,该框架整理大量图像-文本对,在多方面评估表现出色,训练模型在多基准测试和临床场景中效果显著,还公开相关资源。
Video2Reaction:将视频映射到自然环境中的观众反应分布
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Dolby Laboratories(杜比实验室)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.LG
AI总结 研究旨在通过Video2Reaction数据集实现视频到观众反应分布预测,开发仅用开源语言模型的两阶段多智能体管道,建立基准,发现预训练模型零样本失败,微调可提升性能,但任务仍具挑战。
从内容到受众:一种多模态注释框架用于广播电视分析
机构 * Dipartimento di Elettronica, Informazione e Bioingegneria, Politecnico di Milano, Italy(意大利米兰理工大学电子、信息与生物工程系)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种多模态注释框架,用于广播电视内容分析,通过构建特定领域的基准测试,评估不同管道架构在广播新闻中的表现,展示了框架在受众分析中的应用价值。
视觉编码器的激活量化需要前缀寄存器
机构 * POSTECH ; Dankook University(Dankook 大学) ; Google(谷歌)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出RegCache算法,通过引入前缀标记减少视觉编码器中的异常值,提升低比特量化模型性能,尤其在极低比特情况下效果显著。
Comments Accepted to ECCV 2026. Code: https://github.com/spbob0418/RegCache
摩擦产生创造力:用于探索性结构设计的人机交互
机构 * Block Research Group, Department of Architecture, ETH Zurich(建筑系,苏黎世联邦理工学院) ; IVIA Lab, Department of Computer Science, ETH Zurich(计算机科学系,苏黎世联邦理工学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
AI总结 探讨当前生成式AI目标与结构设计师等创作者需求的偏差,提出允许受限人机共同创作的系统设计维度,通过试点设计界面和专家研究,展示其对设计空间探索的支持及设计师看法。
Comments Accepted at ICML 2026, Workshop on Human-AI Co-Creativity
基于3D感知语言模型的自我-人类运动预测
机构 * Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV
AI总结 研究从自我中心视角预测人类运动问题,提出Ego3DLM模型,基于准确运动预测需3D环境理解及姿势语言整体预测原则,通过三阶段训练,在相关任务中取得领先性能,实现跨模态和时间一致的运动预测。
Comments Accepted to ECCV 2026
TIR-Agent:训练一个探索性且高效的图像修复代理
机构 * Tsinghua University(清华大学) ; China Unicom(中国联通) ; Hunan University(湖南大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出TIR-Agent,通过监督微调和强化学习两阶段训练,解决图像修复中任务调度和工具组合的效率问题,实验表明其在多个基准上表现优异且推理速度提升显著。