CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding
CodeShrink:面向高效多模态代码理解的自适应视觉压缩
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
AI总结 CodeShrink是含无空白渲染、自适应压缩配置、主导令牌选择的自适应视觉压缩框架,可减少代码理解的视觉令牌用量,在三类代码任务上优于基线。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
CodeShrink:面向高效多模态代码理解的自适应视觉压缩
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
AI总结 CodeShrink是含无空白渲染、自适应压缩配置、主导令牌选择的自适应视觉压缩框架,可减少代码理解的视觉令牌用量,在三类代码任务上优于基线。
具有自适应验证器的多模态强化学习
机构 * Microsoft Research(微软研究院) ; UMass Amherst(马萨诸塞大学阿默斯特分校) ; ETH Zurich(苏黎世联邦理工学院) ; UW–Madison(威斯康星大学麦迪逊分校)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出Argos验证器,通过结合SFT数据筛选与RL训练,提升多模态推理模型在空间推理、视觉幻觉及机器人任务中的性能,同时减少奖励黑客问题。
SeekBrain:用于加速神经科学发现的自主多智能体系统
专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 SeekBrain是用于加速神经科学发现的自主多智能体框架,通过分层规划与跨模态分析生成分析流程,在BrainArena基准上优于现有智能体,实际研究中成功揭示了斑马鱼与小鼠的神经表征规律。
HAM-VLN:利用分层智能体记忆实现零样本视觉与语言导航
专题命中 多模态Agent :multimodal(abstract,abstract_cn)
AI总结 本研究提出HAM-VLN零样本VLN方法,通过分层智能体记忆缓解长程导航的记忆与推理瓶颈,提升导航指标并缩短上下文长度,在多个基准数据集上取得优异零样本性能。
面向神经多样性儿童的数字词汇学习干预方案设计:发育性语言障碍儿童的经验与思路
专题命中 多模态Agent :multimodal(abstract)
AI总结 该研究针对发育性语言障碍儿童,采用定制化参与式设计方法,设计词汇学习干预方案,明确了多模态等关键设计要求,为相关干预开发提供了宝贵见解。
Comments 56 pages, 7 tables, 7 figures
专题命中 多模态Agent :multi-modal(abstract)
Comments Minor corrections. 12 pages, 2 figures, 3 tables; 20 pages with appendix and references
Journal ref Foundations of Science, 30(4), 971-1002 (2025)