Can Multimodal Large Language Models Understand OCT?
多模态大语言模型能理解光学相干断层扫描(OCT)吗?
专题命中 规划决策 :workflow(abstract);分类 cs.CL
AI总结 研究探讨多模态大语言模型能否理解OCT,引入OCT - Bench基准,包含多维度细粒度任务,基于多个数据集构建大量选择题,评估20个代表性模型,发现当前模型理解OCT能力不足,为评估模型和推动OCT理解提供基础。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
多模态大语言模型能理解光学相干断层扫描(OCT)吗?
专题命中 规划决策 :workflow(abstract);分类 cs.CL
AI总结 研究探讨多模态大语言模型能否理解OCT,引入OCT - Bench基准,包含多维度细粒度任务,基于多个数据集构建大量选择题,评估20个代表性模型,发现当前模型理解OCT能力不足,为评估模型和推动OCT理解提供基础。
EA-RMENet——使用深度学习进行城市环境中的路径损耗预测
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究城市环境中路径损耗预测,提出EA-RMENet模型,采用含EfficientNetB5编码器、AG跳跃连接和ASPP的U-Net框架,平衡了准确性与效率,在相关数据集和挑战赛中有良好表现,展现出在实际无线电地图估计中的潜力。
FST.ai 2.5:用于奥运会和跆拳道决策支持、运动员数字孪生及联合会规模分析的可解释且具有不确定性感知的人工智能
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 针对精英运动数字化中现有方案零散问题,提出FST.ai 2.5框架,通过整合多源数据,实现战术诊断、运动员监测等功能,其原型部署可行,方法广泛适用于搏击等体育环境中的可解释AI、数字孪生及可靠决策支持。
Comments 14 pages, 4 figures
ViPSAM:使用Segment Anything模型的视觉提示医学图像分割
机构 * Department of Artificial Intelligence, Sungkyunkwan University, Republic of Korea(人工智能系,成均馆大学,大韩民国) ; Department of Radiation Oncology, Samsung Medical Center, Sungkyunkwan University School of Medicine, Republic of Korea(放射肿瘤科,三星医疗中心,成均馆大学医学院,大韩民国) ; Department of MetaBioHealth, Sungkyunkwan University, Republic of Korea(元生物健康系,成均馆大学,大韩民国)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 针对质子治疗计划中NCCT图像病变分割因对比度低而困难的问题,提出ViPSAM框架,基于SAM模型,利用视觉提示编码器和视觉引导交叉注意力模块整合跨模态信息,实验证明其在肝脏病变分割上优于其他方法,能实现更准确稳健的分割。
Comments Accepted at MICCAI 2026
用于时态知识图谱推理中高效面向目标路径探索的可达性感知预训练
机构 * Artificial Intelligence Research Center, Chang Gung University(长庚大学人工智能研究中心) ; Graduate Institute of Oral Biology, National Taiwan University(国立台湾大学口腔生物学研究所) ; National Taiwan University of Science and Technology(国立台湾科技大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 针对时态知识图谱推理中外推设置下RL训练奖励稀疏、探索效率低的问题,提出RAPTOR自监督预训练方法,通过学习估计可达性减少无前景路径探索,为RL微调提供初始化,实验证明该方法能提高训练效率并优于传统基线。
基于时间序列机器学习的事件发生时间模型预测肌萎缩侧索硬化症进展及医疗保健利用情况
机构 * Harrison College of Pharmacy, Auburn University(奥本大学哈里森药学院) ; Fisk University(菲斯克大学) ; Lewis Katz School of Medicine, Temple University(天普大学刘易斯·卡茨医学院) ; Emory University(埃默里大学) ; Barnett College of Public Health, Temple University(天普大学巴尼特公共卫生学院)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究针对ALS预测临床有意义事件的挑战,开发受数字孪生启发的事件发生时间框架,整合多源数据,经聚类、建模等确定功能域及预测因素,构建TTE模型,能生成个性化生存曲线,为ALS相关决策支持提供可行方法。
李雅普诺夫引导:稳定生成流的统一框架
机构 * Imperial College London(伦敦帝国理工学院) ; Fudan University(复旦大学) ; Stanford University(斯坦福大学) ; MicroCyto(微赛生物)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究针对流匹配重新训练计算昂贵、现有训练后引导方法无稳定性保证的问题,提出LyaGuide框架,将流引导作为李雅普诺夫控制问题,统一多种引导策略,经实验验证其在多方面有改进且保持计算效率。
Comments 25 pages, 13 figures
生物有机体和未来具身人工智能中的基础世界模型
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 研究探讨生物有机体中基础世界模型,通过五个神经回路例子揭示当前具身人工智能缺失的特征,如内在动力学作用等,还讨论了生物系统原则对未来具身人工智能的影响。
通过原子运动生成音乐驱动的舞蹈
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) ; School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) ; National Institute of Health Data Science, Peking University(北京大学健康数据科学研究所) ; State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) ; Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) ; School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 研究音乐驱动的舞蹈生成问题,提出结构感知框架,将编排建模为原子运动序列,经数据分割、聚类及大语言模型处理得到原子运动注释,设计两阶段生成框架,提升舞蹈生成的结构连贯性、节奏对齐和自然度,增强可解释性与可控编辑性。
释放多模态大语言模型用于野外无训练的人机交互检测
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)
专题命中 规划决策 :agentic(abstract);分类 cs.AI
AI总结 该研究针对传统人机交互检测方法在开放世界和组合场景中泛化能力受限的问题,提出无训练的AgentHOI框架,利用基础模型多模态推理能力,通过上下文感知多轮推理和多方面交互定位机制,在实际场景中取得优于现有监督和弱监督方法的性能。
用于脑肿瘤进化预测和治疗计划安排的人工智能增强自适应数字孪生建模
机构 * Florida Institute of Technology(佛罗里达理工学院) ; Department of Mathematics and Systems Engineering(数学与系统工程系)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 针对脑肿瘤进化预测和治疗计划难题,提出人工智能增强自适应数字孪生框架,集成多种模型与方法。实验表明该框架能有效提升预测准确性,降低肿瘤负荷,为患者特异性治疗优化提供统一框架,奠定向现实治疗计划转化基础。
用于贝叶斯说服的结构化强化学习:在智能交互驾驶中的应用
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 研究智能交互驾驶中主导者引导智能体决策的问题,提出在线结构化强化学习框架,贡献包括为单调智能体提出算法、确定相关条件、提出SQP,数值分析显示该方法在优化行驶奖励上比现有方法成本效率高30%。
用于BioASQ A+和B阶段的成本实用质量门控和选择融合多模型组合器
机构 * University of Technology Sydney(悉尼科技大学)
专题命中 规划决策 :agent(abstract);分类 cs.CL
AI总结 该研究针对BioASQ任务14B 2026系统,围绕检索弱时的重新检索及多模型答案组合展开。采用混合与代理驱动管道结合质量门控,成本实用策略提升效果。还分解多模型集成,解析器在召回方面表现出色,团队在初步排行榜上成绩优异。
Comments CLEF2026, BioASQ2026
学习用于可变形物体模拟的物理引导残差动力学
机构 * UIUC(伊利诺伊大学厄巴纳 - 香槟分校) ; Columbia University(哥伦比亚大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 研究针对可变形物体模拟中动力学预测难的问题,提出物理引导残差动力学(PGRD)框架,结合物理与学习方法优势,采用特定架构和公式,在多物体模拟上结果更准,还展示了其在操作规划和交互式模拟中的应用效用。
Comments Website: https://pgrd-robot.github.io/
大规模零售需求预测中保持准确性的稳定性正则化
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究大规模零售需求预测,提出在训练时对连续序列内变化施加惩罚的方法,结合多种特征评估稳定性。实验表明稳定性感知混合模型能提高预测稳定性得分,且RMSE变化小,拓展了零售预测从点误差最小化到准确性-稳定性权衡的评估视角。
Comments 9 pages, 5 figures, accepted for presentation at ICEME 2026
HRO:用于基于大语言模型的零样本目标导航的分层房间到物体框架
机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) ; Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) ; Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 针对零样本目标导航问题,提出LLM驱动的分层房间到物体(HRO)框架,引导智能体粗到细探索导航至目标物体,实验表明该框架在Gibson和HM3D数据集上优于现有基于LLM的方法。
Comments Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems, Man, and Cybernetics 2026 (IEEE SMC 2026)
BAT-RM:一种用于临床部署的宫颈癌放疗自动轮廓勾画的具有区域感知多向曼巴的边界感知变换器
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 研究针对宫颈癌放疗自动轮廓勾画问题,提出BAT-RM混合架构,集成多种技术。该架构在多机构数据实验中性能卓越,提升了初级肿瘤学家的交并比并减少轮廓勾画时间,临床部署后缩短患者等待时间,体现了严格研究流程对患者的益处。
基于验证器的热能存储控制推理模型强化微调
机构 * The University of Tokyo(东京大学) ; Tokyo University of Science(东京理科大学)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究针对建筑物热能存储控制中模型难以扩展的问题,采用基于可验证奖励的强化学习,通过强化微调训练开放权重推理模型,在简单办公楼TES基准测试中取得较好效果,明确了规划模式转移情况,推动了相关测试与验证器发展。
Comments 29 pages, 8 figures
强化学习中用于策略-环境协同设计的环境参数梯度定理
机构 * Faculty of Mechanical Engineering, Indian Institute of Technology Delhi(机械工程系,印度理工学院德里)
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 研究在环境可变的强化学习中联合优化策略与环境设计参数的问题,通过建立环境参数梯度定理及广义动作值函数,开发无模型算法,在无人机网络设计中证明可联合学习最优放置与路由以降低通信成本。
Comments 6 pages, 1 figure, 1 table
基于学习的场景模型预测控制加速
机构 * Department of Electrical and Computer Engineering, University of Central Florida(电气与计算机工程系,中央佛罗里达大学)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 针对场景模型预测控制计算复杂的问题,提出学习加速的交替方向乘子法,通过重新表述问题、利用并行计算和莫罗包络学习加速求解,在微电网能量管理问题上评估,相比其他求解器有显著计算加速且保持控制性能。
押注于特征:条件分位数预测器的随时有效且特征感知审计
机构 * Julius-Maximilians-Universität Würzburg(维尔茨堡大学朱利叶斯 - 马克西米利安斯大学) ; Zaragoza Logistics Center(萨拉戈萨物流中心) ; INSEAD(欧洲工商管理学院)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究针对黑箱条件分位数预测器,开发无分布且基于博弈论的测试框架,通过形式化校准概念、识别可实现功效的替代方案集,得出有限时间检测保证,能在特征层面解释证据过程,实证发现流行预测器存在校准错误。
速度调度流匹配
机构 * Cherkasy State Technological University(切尔卡瑟国立技术大学)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究提出速度调度流匹配(VSFM)方法,放宽流匹配中样本恒速移动的隐含选择。通过特定多项式轮廓,预训练模型推理时无需重新训练和额外计算,FID降低,从零开始训练也有进一步提升,增益源于欧拉积分器局部截断误差。
地球观测回归任务的不确定性量化:建筑物高度、树冠高度和地上生物量估计
机构 * Division of Geoinformatics, KTH Royal Institute of Technology(地理信息学部,瑞典皇家理工学院)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 针对地球观测回归任务中多数深度学习模型缺乏可靠性指示的问题,利用哨兵 -1 SAR和哨兵 -2 MSI时间序列建模偶然不确定性,提出高斯和分位数两种互补方法,在三个任务上评估,结果优于基准和现有产品,树冠高度估计表现更优。
深入了解与智能机器人的长期物理共存
机构 * Astribot Team(Astribot团队)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 研究与智能机器人长期物理共存问题,提出基于机器人网关抽象的多机器人代理PHILIA,解耦代理推理与机器人执行,实现即插即用集成,在Astribot S1机器人上验证架构,展示用例,强调人机交互流程对有效协助的重要性。
EasyOPD:一种易于使用的大语言模型在线策略蒸馏框架
机构 * University of Science and Technology of China(中国科学技术大学) ; Tencent(腾讯) ; Shanghai Innovation Institute(上海创新研究院) ; National University of Singapore(新加坡国立大学)
专题命中 规划决策 :tool-use(abstract);分类 cs.CL
AI总结 研究针对传统语言模型蒸馏问题,提出基于verl构建的EasyOPD框架,分离用户配置等,为三种OPD设置实例化方法,经多基准测试,其实现可通过同一后端执行,还发布了相关配置、文档及演示包。
Comments 10 pages, 2 figures
Q学习实验室:通过学习者生成的轨迹分析教授强化学习
机构 * Computer Science Program Faculty of Sciences and Liberal Arts Rajamangala University of Technology Isan(计算机科学系 法学院及文科院 瑞亚玛芒拉大学技术学院伊桑)
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 该研究提出Q学习实验室工具,通过学习者生成的轨迹分析教授表格Q学习。工具具可视化及记录功能,核心是学习-导出-分析循环。通过三项评估验证工具,还与现有工具比较、阐述教学法基础并提供教案,工具和代码公开。
Comments 12 pages, 5 figures
检测人工智能生成的视频:视觉-语言双视角综述
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学中关村人工智能学院) ; Harvard University(哈佛大学)
专题命中 规划决策 :agentic(abstract);分类 cs.CL
AI总结 综述人工智能生成视频检测,将任务重定义为事实保真度验证,提出视觉-语言双视角分类法,基于对221篇论文回顾,综合生成范式、审视检测方法、回顾评估指标,讨论挑战并指出未来方向。
Comments 51 pages, accepted by ACL 2026
Journal ref Association for Computational Linguistics 2026 pages 32221 to 32255
清晰的直觉还是真正的分析?评估大语言模型作为评审员的同行评审中的认知可靠性基准
机构 * National University of Singapore(新加坡国立大学)
专题命中 规划决策 :agentic(abstract);分类 cs.CL
AI总结 研究大语言模型评审员与人类评审员对同行评审评估的差异,将卡尼曼双过程理论转化为评分标准并发布Kahneman4Review基准,通过多方面发现揭示问题,强调可靠基准应区分分析形式与认知功能并给出设计选择。
Comments Preprint
TopoExplore:基于存档探索的拓扑判别
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 研究针对基于存档探索方法未考虑边界后区域能否进入的问题,提出TopoExplore,通过周期性拓扑遍历增强单元格选择,在MiniGrid套件等实验中取得加速效果,证明拓扑感知选择在区分封闭结构及开放覆盖区域均有优势。
基于数据并行吉布斯采样的非参数贝叶斯逆强化学习
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究针对多专家示范下逆强化学习问题,采用狄利克雷过程先验的非参数贝叶斯方法,通过数据并行吉布斯采样联合推断潜在奖励类型及奖励,在ObjectWorld评估效果良好,还实现并行加速并刻画权衡。
Comments 6 pages, 5 figures