Infinity-Parser2 Technical Report
Infinity-Parser2技术报告
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 针对文档解析语料库稀缺问题,Infinity-Parser2结合可控数据合成与多任务强化学习。贡献包括构建合成引擎及开源语料库,引入多任务奖励系统,发布Infinity-Parser2-Flash和Infinity-Parser2-Pro两个变体,后者在多项任务中达先进水平。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
Infinity-Parser2技术报告
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 针对文档解析语料库稀缺问题,Infinity-Parser2结合可控数据合成与多任务强化学习。贡献包括构建合成引擎及开源语料库,引入多任务奖励系统,发布Infinity-Parser2-Flash和Infinity-Parser2-Pro两个变体,后者在多项任务中达先进水平。
GHOST:不透明表面纹理的几何引导幻觉
机构 * School of Software, Northeastern University, Shenyang, China(软件学院,东北大学,沈阳,中国)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV
AI总结 针对透明物体给深度估计和3D重建带来的挑战,提出几何引导预处理框架GHOST,利用视觉基础模型,经多步骤处理分离属性、恢复法线先验并整合多模态线索,合成不透明RGB图像,显著提升相关模型对透明物体的处理精度。
轻量级隐式神经表示的误差感知分布预测
机构 * Vanderbilt University(范德堡大学) ; University of Arizona(亚利桑那大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究针对隐式神经表示的预测误差问题,提出轻量级方法,将基于回归的INR训练转为分类任务,通过离散连续目标为bins实现灵活分布建模,经分析权衡表明该方法能通过不确定性估计获高重建质量和误差感知。
迈向节能领域特定人工智能模型和智能体的愿景
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究提出下一代人工智能应是轻量级领域特定多模态模型,能在动态环境中推理决策并持续进化。核心方法是重新设计硬件提升能源效率。主要贡献是为未来人工智能系统发展提供新愿景,推动从大数据训练的大模型向节能领域特定智能体转变。
无需标注的高分辨率大多模态模型视觉推理技术
机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室) ; Institute of Brain-inspired Intelligence(脑启发式智能研究院) ; Shenzhen Research Institute of Nanjing University(南京大学深圳研究院)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 HART通过闭环框架和AP-GRPO方法,实现无需外部标注的高分辨率视觉推理,提升多模态模型在高分辨率任务中的性能。
大型癌症助手(LCA):用于肿瘤学中可扩展临床决策支持的模型无关编排框架
机构 * Ghassen MARRAKCHI(独立研究者) ; Basarab MATEI(独立研究者)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究针对肿瘤学多模态深度学习模型设计局限,提出模型无关的LCA编排框架。利用算法不可渗透原则等方法,经概念验证验证其编排逻辑、算法不可渗透性等,为临床决策支持提供高度适应性基础,利于电子病历互操作性。
Comments 22 pages, 6 figures, 8 tables, 9 appendices, 14 references, Elsevier JBI format
基于原始校正的渐进推理用于组合零样本学习
机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; Key Laboratory of Big Data & Artificial Intelligence in Transportation (Ministry of Education)(交通运输大数据与人工智能教育部重点实验室)
专题命中 其他多模态 :MLLM(abstract);分类 cs.CV
AI总结 研究组合零样本学习问题,提出PRPC框架,通过逐步推理明确建模属性和对象间双向依赖性,对原语相互校正,将其公式化为结构化推理过程并结合强化学习后训练,在基准测试中达最优性能。
GIPO:高斯重要性采样策略优化
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 该研究提出了一种基于截断重要性采样的策略优化目标GIPO,通过使用基于对数比率的高斯信任权重替代硬裁剪,以软化极端重要性比率同时保持非零梯度,从而提高数据效率,实验表明GIPO在多种回放缓冲区大小下均取得最佳性能,表现出优越的偏差-方差权衡、高训练稳定性及改进的样本效率。
GenHOI:具有遮挡意识的通用手-物体姿态估计
机构 * Hunan University(湖南大学) ; Lancaster University(兰卡斯特大学) ; University of Western Australia(西澳大学) ; University of Trento(特伦托大学) ; National University of Singapore(新加坡国立大学)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出GenHOI框架,通过整合层次语义知识与手部先验,提升在遮挡条件下手-物体姿态估计的泛化能力,实验表明在DexYCB和HO3Dv2基准上达到SOTA性能。
Comments European Conference on Computer Vision (ECCV), 2026
ASPIRE: 面向机器人的智能体技能发现
机构 * NVIDIA(英伟达) ; UMich(密歇根大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; UC Berkeley(加州大学伯克利分校) ; CMU(卡内基梅隆大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 提出ASPIRE系统,通过闭环执行、技能库积累和进化搜索,自主编写和优化机器人控制程序,在扰动、多机器人协作和长时域任务上显著超越现有方法,并实现零样本泛化与仿真到现实的技能迁移。
Comments 43 pages, 12 figures, 9 tables. Project page: https://research.nvidia.com/labs/gear/aspire/
ENSAM:一种高效的交互式3D医学图像分割基础模型
机构 * Akershus University Hospital(阿克什胡斯大学医院)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 ENSAM结合SegResNet编码器、提示编码器和掩码解码器,通过潜在交叉注意力、相对位置编码等技术,在有限数据和算力下实现高效3D医学图像分割,优于现有基线模型。
Structured SIR: 高效且富有表现力的重要性加权推断用于高维图像配准
机构 * University of Sussex(萨塞克斯大学) ; University College London(伦敦大学学院) ; University of Bath(巴斯大学)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV
AI总结 提出Structured SIR方法,结合采样重要性重采样与低秩加稀疏Cholesky精度因子的协方差参数化,实现高维3D图像配准中高效且多模态的不确定性量化。
基于物理世界建模的感知3D仿真
机构 * Stanford University(斯坦福大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出P3Sim系统,结合学习型物理世界模型、几何条件模块和持久场景记忆,在部分观测和不完整3D变换信号下模拟未来场景状态,实现多任务泛化。
Comments Published as a conference paper at CVPR 2026
OverFlowLight:城市交叉口实时防锁死与交通信号优化
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Electronic Science and Technology of China(电子科技大学) ; South China University of Technology(华南理工大学) ; Beijing Xiaocheng Intelligent Computing(北京小城智能计算) ; Tsinghua University(清华大学) ; Lanzhou University(兰州大学)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI
AI总结 针对城市交通中队列溢出导致级联锁死的问题,提出OverFlowLight框架,利用多模态传感实时检测溢出并动态插入专用相位,结合规则与强化学习混合控制,实际部署43个路口减少60.4%溢出事件并提升18.2%网络吞吐量。
从LLM中蒸馏答案集编程规则用于神经符号视觉问答
机构 * Vienna University of Technology ( TU Wien )(维也纳技术大学) ; Jönköping University(约克灵厄普大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 提出从大语言模型中蒸馏答案集编程规则的方法,以可解释的方式扩展视觉问答系统的推理能力,仅需少量示例即可生成正确规则。
Comments Under consideration in Theory and Practice of Logic Programming (TPLP)
Rheos: 分层3D场景图中的连续运动动态建模
机构 * University of Turku(图尔库大学) ; Centre for Artificial Intelligence, Zürich University of Applied Sciences(应用科学大学人工智能中心) ; Instituto Tecnológico de Aragón (ITA) and the University of Zaragoza(阿拉贡理工大学和萨拉戈萨大学) ; University of Zaragoza(萨拉戈萨大学) ; School of Electrical Engineering, Aalto University(艾尔沃斯大学电气工程学院)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出Rheos框架,将连续方向运动模型嵌入分层3D场景图的动态层,通过半包裹高斯混合模型捕获多模态方向流,并采用水库采样和贝叶斯信息准则实现在线操作,优于离散基线方法。
Comments Accepted at IROS 2026, 8 pages
利用人类阅读过程中产生的认知信号增强微博关键词抽取
专题命中 其他多模态 :multimodal(abstract);分类 cs.CL
AI总结 研究利用脑电图(EEG)和眼动追踪信号增强微博关键词抽取(AKE),发现EEG特征带来最大性能提升,两种信号部分互补但存在冗余。
Journal ref IPM, 2024
面向5G上XR中实时化身控制的集成感知与通信
机构 * IDLab, University of Antwerp - imec(ID实验室,安特卫普大学 - imec) ; IDLab, Ghent University - imec(ID实验室,根特大学 - imec) ; Lighting Technology Lab, KU Leuven(照明技术实验室,鲁汶大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 提出结合5G毫米波ISAC与表面肌电信号的多模态感知架构,实现从身体到手指的多尺度手势识别,支持XR实时化身控制。
咬合定位夹板对颞下颌关节状况定量影响的评估
机构 * Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(波兰科学院理论与应用信息研究所)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出一种利用咬合定位夹板分析颞下颌关节配置的计算方法,通过多模态数据建模夹板作为下颌的刚体变换,评估定位精度并模拟关节空间变化。
Comments 28 pages, 9 figures
OphthaDT:用于眼科视力轨迹预测的生成式数字孪生
机构 * Computational Sciences Center of Excellence, Roche, Penzberg, Germany(计算科学卓越中心,罗氏,彭茨贝格,德国) ; Computational Health Center, Helmholtz Munich, Munich, Germany(计算健康中心,亥姆霍兹慕尼黑,慕尼黑,德国) ; Department of Biology, Ludwig Maximilian University of Munich, Munich, Germany(生物学系,路德维希-马克西米利安-慕尼黑大学,慕尼黑,德国) ; Computational Sciences Center of Excellence, Roche, Basel, Switzerland(计算科学卓越中心,罗氏,巴塞尔,瑞士) ; Department of Biochemistry and Pharmacology, Bio21 Molecular Science and Biotechnology Institute, The University of Melbourne, Parkville, Australia(生物化学与药理学系,Bio21分子科学与生物技术研究所,墨尔本大学,帕克维尔,澳大利亚) ; Technical University of Munich, Munich, Germany(慕尼黑工业大学,慕尼黑,德国)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出基于LLM的数字孪生OphthaDT,通过序列化纵向患者历史预测最佳矫正视力,在nAMD和DME数据集上分别降低MAE 6.0%和2.6-6.9%,尤其擅长处理高变异性轨迹。
通过形式化理解隐私
机构 * University of Luxembourg(卢森堡大学) ; University of Bergen(卑尔根大学)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI
AI总结 本文使用多模态逻辑形式化不同隐私理论及其原则,探讨作为认知权利的隐私权在规范位置理论中的含义。
Comments Published in Proceedings of the 17th International Conference on Juris-informatics, JURISIN 2023
使用深度卷积网络进行美国手语手势识别
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出利用深度卷积网络对美国手语中的字母和数字图像进行分类,探索神经网络在手语识别中的应用。
Comments 12 figures
CABLE: 面向V2X系统的云辅助带宽高效LMM编码框架
机构 * College of Engineering, University of Georgia(佐治亚大学工程学院)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出CABLE框架,通过边缘端利用自我运动补偿和残差运动线索传播云分割掩码,生成感兴趣区域(ROI)并仅上传ROI掩码图像,形成掩码-ROI-LMM反馈循环,在五个数据集上实现73-87%的ROI像素覆盖减少和5-8倍LMM预填充加速。
基于性别的连接组网络特异性差异:基于Krakencoder的分析
机构 * Centre for Brain Research, Indian Institute of Science(印度科学研究所大脑研究中心) ; Dept. of Artificial Intelligence, Amrita School of Artificial Intelligence, Amrita Vishwa Vidyapeetham(阿姆里塔大学阿姆里塔人工智能学院人工智能系)
专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV
AI总结 使用Krakencoder框架模拟脑连接组模态间缺陷传播,分析702名健康被试的结构和功能连接组,发现默认模式网络扰动最大,感觉运动网络最小,完整预测连接组保留更多性别判别信息。
镜像标记任务中带有自我先验的主动推理
机构 * The University of Tokyo(东京大学) ; Laboratory for Intelligent Systems and Informatics(智能系统与信息学实验室)
专题命中 其他多模态 :cross-modal(abstract);分类 cs.AI
AI总结 提出一种基于自我先验的计算模型,通过主动推理驱动标记导向行为,无需外部奖励即可模拟镜像自我识别。
Comments 8 pages, 5 figures, Accepted to IEEE ICDL 2026
RGB-S: 用于鲁棒灵巧操作的图像对齐触觉显著性
机构 * ShanghaiTech University(上海科技大学) ; Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)
专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV
AI总结 提出RGB-S框架,通过正向运动学和相机标定将触觉传感器位置投影到RGB图像平面,生成力调制高斯显著性图,显式对齐触觉与视觉,在严重遮挡下灵巧操作成功率提升26.7个百分点。
Comments 20 pages, 7 figures
GRAR: LiDAR点云中玻璃引起的反射伪影去除
机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) ; School of Design, Hunan University(湖南大学设计学院) ; School of Finance and Statistics, Hunan University(湖南大学金融与统计学院)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV
AI总结 提出两阶段框架,先利用多模态视觉基础模型和几何线索精确分割玻璃区域,再基于物理驱动的反射感知局部-全局几何相似性描述符去除反射伪影,在多个公开数据集上优于现有方法。
SPACE: 面向多模态大语言模型的无源代理锚点概念擦除
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 提出SPACE框架,首个针对多模态大语言模型的无源机器遗忘方法,通过文本引导的代理锚点选择和双约束语义隔离,在不访问目标数据的情况下擦除概念,并保持模型性能。
单光纤积分场单元光谱学
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI
AI总结 提出一种多模态概率基础模型,利用掩码自编码器从宽带图像预测星系任意空间位置的高分辨率光谱,无需IFU训练数据,性能与监督基线相当。
Comments Accepted for Conference on Physics and AI at Stanford University (PAI 2026)
重新审视视觉问答中的贪婪解码:一种校准视角
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Toronto(多伦多大学) ; MBZUAI(穆桑比克人工智能研究所)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CL
AI总结 针对视觉问答任务,从校准角度理论证明贪婪解码优于随机采样,并提出适用于推理模型的贪婪解码方法,实验验证其有效性。