Innovating with Generative AI: A Human Bottleneck Framework
生成式AI助力创新:人类瓶颈框架
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本研究提出人类瓶颈框架,分析生成式AI对创新过程各阶段瓶颈的影响,区分瓶颈类型并探讨AI对传统创新流程的挑战。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
生成式AI助力创新:人类瓶颈框架
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本研究提出人类瓶颈框架,分析生成式AI对创新过程各阶段瓶颈的影响,区分瓶颈类型并探讨AI对传统创新流程的挑战。
先理解再检测:用于全域红外小目标检测的视觉-语言学习
机构 * National University of Defense Technology(国防科技大学) ; College of Computer Science, Nankai University(南开大学计算机学院) ; Peking University(北京大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 针对全域红外小目标检测的域偏移问题,提出“先理解再检测”范式及JinSight方法,构建视觉-语言数据集OmniIRST-VL,实现跨异构红外域的泛化检测。
MuST-VAD:用于视频异常检测的互结构化学习
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 MuST-VAD是用于弱监督视频异常检测的互结构化学习框架,通过检测器与LVLM的双向知识交换,在UCF-Crime数据集上显著提升了检测精度,AP优于现有最优方法。
用于SAM3图像分割的通用概念干扰
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 针对SAM3图像分割的对抗鲁棒性空白,提出通用概念干扰(UCD)攻击方法,在多数据集上显著降低SAM3的分割性能,且扰动可跨SAM3.1及视频推理迁移,仅有限恢复。
当特权指导出现错位:面向多轮智能体的状态匹配路由与语境化自蒸馏
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 针对多轮智能体特权指导的状态-参考不匹配问题,提出SMRC-SD方法,通过状态匹配路由与语境化自蒸馏提升了ALFWorld和WebShop任务的成功率。
文本到图像模型中的明喻理解:一个评估框架
机构 * The University of Tokyo(东京大学) ; Nara Institute of Science and Technology(奈良科学技术研究所) ; Chungnam National University(忠南国立大学) ; Institute of Science Tokyo(东京科学大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 针对文本到图像模型常混淆明喻喻体与本体的问题,提出含受控数据集、YOLO指标及Diffusion Lens分析的评估框架,实验发现模型存在字面化失败模式并讨论了缓解策略。
Comments Accepted as a full paper at ACM Multimedia 2026
基于锚点思考:接地且高效的文档推理
机构 * Georgia Tech(佐治亚理工学院) ; CMU(卡内基梅隆大学) ; Adobe(奥多比公司) ; ZJU(浙江大学) ; NUIST(南京信息工程大学) ; SEU(东南大学) ; Physion Labs(Physion实验室) ; Columbia University(哥伦比亚大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 该研究提出面向推理的ADOPD 2026数据集,将多类文档元素转化为视觉锚点,支持区域语义标注、统一视觉-语言接地等能力,解决现有模型在文档计数任务上的不足,推动文档理解向锚点接地的智能方向发展。
FinProBench:基于专业交付物衍生的角色基准评估金融AI智能体
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究推出FinProBench金融AI智能体基准及RGRC角色基准构建流程,实验显示RGRC在角色专业化角色评估上优于仅提示方法,角色级复用基准可大幅减少工作量。
UniEvo-RS:基于代表性示例驱动原型演化的全提示统一遥感分割
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 UniEvo-RS是配备代表性示例驱动原型演化的全提示统一遥感分割框架,通过多指令提示数据集与原型演化机制,在批量标注中对未见过的类别实现无需训练的精度提升,性能达当前最优。
Comments 18 pages, 8 figures, 9 tables
多元CIR过程的摊销干预预测
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 本文针对多元CIR过程,提出摊销干预预测框架CIR-ACTIVA,可估计因果效应、预测多horizon冲击响应,在CDS利差测试中优于基线,能解答观测型方法无法处理的假设性查询。
面向预算约束的忠实摘要生成:解耦生成与选择
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究针对摘要式模型的事实不一致等问题,提出解耦生成与选择的模块化框架,在多数据集上提升了事实性,仅参考重叠分数略有降低。
跨研究社区的AI辅助同行评审:从评审人AI政策到大语言模型评审质量
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究调研111个顶尖AI/NLP会议及医学期刊的AI评审政策,评估ICLR 2026和《自然·通讯》的AI评审质量,发现AI评审存在系统性缺陷,主张采用多维度评估。
Comments 30 pages, 19 figures, 10 tables. Currently under peer review. GitHub link for code and data is given in the paper
VR3D:面向空地行人重识别的视角鲁棒3D表示学习
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 本文针对空地行人重识别的视角偏差问题,提出VR3D框架,通过视角鲁棒3D表示交互与可靠性感知融合技术,在三个基准数据集上实现了优于现有方法的性能,CARGO数据集Rank-1提升5.63%。
Comments 12 pages, 10 figures
VC-Tooler:学习组合式与自适应视觉工具使用
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 VC-Tooler是一种学习组合式与自适应视觉工具使用的模型,通过分层合成轨迹库与两阶段训练,在通用和具身基准上达到开源模型最优性能,且具良好迁移能力。
SVGEval:用于文本到SVG生成中感知质量基准测试与评估的视觉基础框架
机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) ; School of Integrated Circuits (School of Information Science and Electronic Engineering), Shanghai Jiao Tong University(上海交通大学集成电路学院(信息科学与工程学院)) ; Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 研究针对文本到SVG生成评估的缺陷,提出视觉基础的SVGEval基准,发现多模态模型在几何布局判断上的差距,训练出可解释的SVG质量评分器,为SVG生成评估改进提供支撑。
Comments Accepted by ECCV 2026
ProtoAct:将湿实验室协议转化为具身机器人动作
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究针对湿实验室协议难转化为机器人动作的问题,提出ProtoAct框架,结合ProtoRAG、RefineChecker、ActSchema处理协议,引入BioP2E数据集,经多模型评估与消融实验验证,可实现仿真及真实机器人的协议执行。
Comments 15 pages, 13 figures
PixVL:通过统一掩码-文本一致性循环进行像素级多模态大语言模型的自监督训练
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV
AI总结 PixVL作为自监督后训练框架,通过统一掩码-文本一致性循环及语义验证等策略,解决像素级MLLMs的优化干扰问题,同时提升区域理解与分割任务性能。
图语言:知识图谱如何与大语言模型对话
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究针对知识图谱与大语言模型融合的挑战,提出GRALAN模型,通过关系令牌实现KG在LLM语义空间的适配,在问答任务中显著优于现有方法,为KG-LLM融合提供新范式。
Comments Accepted to ISWC 2025
大型语言模型可提高医师准确率,但会导致错误依赖
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本研究开发智能体式检索增强型LLM CORA,发现其可将46名医师的诊断准确率从70.8%提升至82.6%,但存在错误答案获引用支持时医师抵抗大幅下降的安全风险。
AgentMemBench:用于评估对话AI智能体长期记忆管理策略的系统基准
机构 * Sofrecom(索弗雷科姆)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究构建了AgentMemBench基准,评估五种记忆策略及两款现有系统,发现外部键值存储(EKV)在长程对话记忆任务中表现最优,但存在内存占用成本,同时公开了全部可复现资源。
Comments 22 pages, 3 figures submitted on Neural Computing and Applications
COSI-Lab:用于建模多视角多模态社会意图的会议生活实验室
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 COSI-Lab构建了含32名学者的会议多模态数据集,提出表观意图推理任务及相关标注、分析、基准等贡献,助力智能系统处理主观感知。
RefCaptioner:多参考图像接地的视频字幕生成
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 本文提出多参考图像接地的视频字幕生成新任务,构建语料库与MRVBench基准,提出RefCaptioner框架,实验证实其性能最优且生成字幕更忠实。
针对AI引发的同质化问题实现个性化研究构思的多样化
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究针对AI辅助研究构思的同质化问题,提出DivAlign四阶段流程,在保留研究者-方向适配性的同时降低社区研究组合冗余,相关成果代码与数据已公开。
通过鲁棒3D化身放置学习理解肢体语言
机构 * National University of Science and Technology “Politehnica” Bucharest(布加勒斯特理工国立大学) ; “Simion Stoilow” Institute of Mathematics of the Romanian Academy(罗马尼亚科学院“西米翁·斯托伊洛夫”数学研究所) ; NORCE Norwegian Research Centre AS(挪威NORCE研究中心)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 该研究推出Drones2BodyLanguage数据集,结合轻量几何世界模型训练12种架构,可提升空中机器人对人类交际意图的感知准确率,为社交智能无人机提供数据支撑与方法。
ProgFormer:用于纵向脑部MRI预测的分层体素扩散Transformer
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 ProgFormer是一种分层体素扩散Transformer,通过粗-细通路结合条件流匹配,在ADNI等三个基准上实现了更优的纵向脑部MRI预测性能。
低信噪比环境下基于神经网络辅助CLEAN的信道建模
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 针对低信噪比信道建模,该研究提出混合框架NN-CLEAN,结合神经网络与CLEAN算法,在5dB SNR下精度超96%,计算复杂度大幅降低,可作为MIMO系统实时信道估计方案。
AHA-Memes:用于理解阿拉伯语表情包中仇恨内容的细粒度多模态基准
机构 * Qatar Computing Research Institute(卡塔尔计算研究所) ; Hamad Bin Khalifa University(哈马德·本·哈利法大学) ; Northwestern University in Qatar(卡塔尔西北大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI
AI总结 该研究推出首个带细粒度多标签标注的阿拉伯语仇恨表情包基准AHA-Memes,构建含5000张人工标注及6.6万张银标的数据集,对多类模型基准测试并发布资源以推动相关研究。
Comments 26 pages, 14 figures, 15 tables
Speech2Grasp:面向人形机器人的文本条件抓取检测到语音的高效数据迁移
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 本研究提出Speech2Grasp框架,以数据高效方式将文本条件抓取检测模型迁移至语音输入,通过轻量级MLP投影器适配,在人形机器人实验中性能优于级联ASR流水线且延迟更低,为文本系统扩展到语音提供实用范式。
基于配准的光谱融合用于未配准的WLI/NBI内镜病灶分割
机构 * The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院) ; School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院) ; School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 针对未配准的WLI/NBI内镜病灶分割问题,提出可靠性感知复域融合框架,通过拓扑正则化特征对应与可靠性引导的选择性融合,提升病灶分割性能。
Comments 11 pages
易陷阱:为何大语言模型低估由误解驱动的难度
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究发现,用于教育评估难度估计的LLM会系统性低估由学习者误解驱动的数学题难度,提出“易陷阱”现象,其仅能捕捉难度大致排序,无法反映学生实际认知难度。
Comments This paper poster presented on 19th Educational Data Mining Conference 2026