Diversifying Personalized Research Ideation against AI-Induced Homogenization
针对AI引发的同质化问题实现个性化研究构思的多样化
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究针对AI辅助研究构思的同质化问题,提出DivAlign四阶段流程,在保留研究者-方向适配性的同时降低社区研究组合冗余,相关成果代码与数据已公开。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
针对AI引发的同质化问题实现个性化研究构思的多样化
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究针对AI辅助研究构思的同质化问题,提出DivAlign四阶段流程,在保留研究者-方向适配性的同时降低社区研究组合冗余,相关成果代码与数据已公开。
通过鲁棒3D化身放置学习理解肢体语言
机构 * National University of Science and Technology “Politehnica” Bucharest(布加勒斯特理工国立大学) ; “Simion Stoilow” Institute of Mathematics of the Romanian Academy(罗马尼亚科学院“西米翁·斯托伊洛夫”数学研究所) ; NORCE Norwegian Research Centre AS(挪威NORCE研究中心)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 该研究推出Drones2BodyLanguage数据集,结合轻量几何世界模型训练12种架构,可提升空中机器人对人类交际意图的感知准确率,为社交智能无人机提供数据支撑与方法。
ProgFormer:用于纵向脑部MRI预测的分层体素扩散Transformer
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 ProgFormer是一种分层体素扩散Transformer,通过粗-细通路结合条件流匹配,在ADNI等三个基准上实现了更优的纵向脑部MRI预测性能。
低信噪比环境下基于神经网络辅助CLEAN的信道建模
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 针对低信噪比信道建模,该研究提出混合框架NN-CLEAN,结合神经网络与CLEAN算法,在5dB SNR下精度超96%,计算复杂度大幅降低,可作为MIMO系统实时信道估计方案。
AHA-Memes:用于理解阿拉伯语表情包中仇恨内容的细粒度多模态基准
机构 * Qatar Computing Research Institute(卡塔尔计算研究所) ; Hamad Bin Khalifa University(哈马德·本·哈利法大学) ; Northwestern University in Qatar(卡塔尔西北大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI
AI总结 该研究推出首个带细粒度多标签标注的阿拉伯语仇恨表情包基准AHA-Memes,构建含5000张人工标注及6.6万张银标的数据集,对多类模型基准测试并发布资源以推动相关研究。
Comments 26 pages, 14 figures, 15 tables
Speech2Grasp:面向人形机器人的文本条件抓取检测到语音的高效数据迁移
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 本研究提出Speech2Grasp框架,以数据高效方式将文本条件抓取检测模型迁移至语音输入,通过轻量级MLP投影器适配,在人形机器人实验中性能优于级联ASR流水线且延迟更低,为文本系统扩展到语音提供实用范式。
基于配准的光谱融合用于未配准的WLI/NBI内镜病灶分割
机构 * The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院) ; School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院) ; School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 针对未配准的WLI/NBI内镜病灶分割问题,提出可靠性感知复域融合框架,通过拓扑正则化特征对应与可靠性引导的选择性融合,提升病灶分割性能。
Comments 11 pages
易陷阱:为何大语言模型低估由误解驱动的难度
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究发现,用于教育评估难度估计的LLM会系统性低估由学习者误解驱动的数学题难度,提出“易陷阱”现象,其仅能捕捉难度大致排序,无法反映学生实际认知难度。
Comments This paper poster presented on 19th Educational Data Mining Conference 2026
HiSkill:利用分层技能图增强大语言模型智能体
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; China Mobile Group Shaanxi Co., Ltd(中国移动通信集团陕西有限公司) ; Ant Group(蚂蚁集团)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究提出HiSkill分层技能图框架,将交互轨迹组织成有向图,连接高级技能与可执行动作模板并捕捉多种关系。推理时检索子图引导任务执行,实验表明其在减少推理令牌消耗方面优于基线,有效弥合技能与动作差距。
超越认知:认知分裂症与作为技术符号机器的大语言模型
机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。
CD-RMOT-Bench:跨域引用多目标跟踪基准测试
机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) ; Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳先进技术大学计算机科学与人工智能学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 研究跨域引用多目标跟踪(CD-RMOT)问题,构建CD-RMOT-Bench基准并提供QCA框架,实验发现域转移严重影响RMOT性能,QCA建立基线,CD-RMOT-Bench为跨视觉域的鲁棒语言引导跟踪开辟新方向。
RSMeM:用于遥感智能体的知识增强记忆进化及系统评估
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究针对现有遥感智能体问题,提出RSMeM机制,通过分层知识基础和失败感知经验提炼两个组件,迭代吸收领域知识转化为执行经验,经实验验证能提升工具使用性能和答案质量,具有强大知识密度。
Comments Accepted to ACL 2026 Main. Code: https://github.com/AI9Stars/RSMeM
评估法国移民法的RAG:一项基准和基线研究
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究法国国际招聘的法律框架,通过公开基准比较参数化语言模型基线与密集检索增强在两种模型规模下对52个合成档案的效果,发现检索能改进行政指导,凸显检索基础的重要性,推动混合检索策略研究。
Journal ref International workshop on AI for Human Resources and Public Employment Services (ECML-PKDD 2026)
从专有模型到开源模型:通过智能体搜索中的多智能体协议蒸馏弥合分布差距
机构 * Beijing Institute of Technology(北京理工大学) ; East China Normal University(华东师范大学) ; University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究旨在弥合专有与开源模型分布差距,提出多智能体协议蒸馏(MAPD)框架,利用结构化协议作中间表示,结合蒸馏与强化学习,在问答基准测试中表现出色,有效减轻学生策略问题,优于其他竞争方法。
MemChain:为内存增强型大语言模型智能体学习可解释的内存痕迹
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉科学学院) ; Memorax AI(Memorax人工智能公司) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究针对内存增强型大语言模型智能体检索内存回答查询存在的问题,提出MemChain可训练检索后内存策略,经两阶段学习框架训练,能生成有效证据上下文,实验证明其在多种模型上性能领先且减少内存上下文。
智能云诱饵:一种用于自主入侵调查的欺骗驱动框架
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究针对云遥测使入侵理解困难的问题,提出云诱饵人工智能代理框架,通过会话聚合运算符、动态提示生成等方法,在十个AWS S3场景测试中效果良好,能压缩调查路径,多数场景可完全重建,且延迟短。
IndicTalk:用于印度语言的大规模基于角色的多语言对话语料库
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 针对印度语言高质量多语言代码混合对话资源稀缺问题,提出通过全自动管道生成IndicTalk语料库,涵盖多种印度语言变体,经多种评估表现良好,将发布该语料库支持相关人工智能开发评估。
MPR-CiteG:通过多组合检索和引用基础生成增强RAG
机构 * Chungnam National University(忠南国立大学) ; Data Intelligence Laboratory(数据智能实验室)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究针对生成式AI检索低效与缺来源验证问题,提出双组件MPR-CiteG框架,用多组合检索器高效检索,引用基础生成模块确保输出事实一致且有源可溯,经实验验证其有效性与可靠性,助力构建更可信准确的大语言模型。
Comments 12 pages, 1 figure, 7 tables. The 1st International Workshop on Retrieval-Driven Generative AI & ScienceON AI Challenge 2025@CIKM
MedLoCoMo:用于大语言模型的长上下文多会话医学对话基准
机构 * Northwestern University(西北大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究针对大语言模型在多入院医学对话临床推理方面的不足,构建MedLoCoMo基准,通过特定方法生成问答项目,含100个患者时间线,发现跨入院推理比局部证据使用难,提供代码和基准供使用与复现。
回归税:剖析技能对大语言模型智能体产生帮助和伤害的原因
机构 * Sentient Labs(森蒂恩实验室)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究剖析大语言模型智能体中技能产生帮助和伤害的原因,通过对比实验区分回归和残余失败两种结果,识别出回归的三个原因,发现现有技能过度强调程序指导,指出应分解技能净效应评估,还识别出应避免的回归模式及可靠性的关键因素。
从静态文献计量学到动态知识图谱:一个由大语言模型驱动的框架,用于实现科学、技术与创新(STI)分析的现代化
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究针对文献计量指标的问题,提出由大语言模型驱动、整合多种传统的混合框架,经五层架构实现,将LLMs作为候选生成器,通过多阶段验证,支持多种分析,贡献了验证中介原则并讨论治理考量。
迈向一个可验证的基础器
机构 * KU Leuven, Leuven, Belgium ARC Training Centre OPTIMA, Melbourne, Australia(比利时列日大学 澳大利亚OPTIMA培训中心)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究为一阶逻辑模型扩展引入可验证基础化框架CertiFOX,含证明格式、基础器GroundFOX和证明检查器CheckFOX,弥合用户规范与求解器输入的信任差距,保证输出与输入等价,实验表明该方法可行。
Comments In Proceedings ICLP 2026, arXiv:2607.17707
Journal ref EPTCS 450, 2026, pp. 309-324
可解释的深度伪造检测挑战
机构 * Monash University(莫纳什大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; The University of Queensland(昆士兰大学) ; American University of Sharjah(沙迦美国大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 ACM多媒体2026年可解释深度伪造检测挑战基于XPlainVerse基准测试,评估图像分类及解释生成方法。参与者为图像提交真假标签与两种解释,评估结合多种指标,其成果将助力下一代可解释深度伪造检测器发展。
Comments 5 pages, 1 figure
重新思考开放世界视频异常检测:诊断定义盲目性
专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV
AI总结 研究开放世界视频异常检测中定义盲目性问题,分解动态定义评估,引入三个定义条件评估指标及DeCoS,指出OWVAD应按定义条件异常评分评估,改进了多个基线模型的定义跟随能力。
Comments Preprint
基于解释的运行时验证用于可信的机器学习驱动的光网络
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 研究将机器学习模型用于光网络自动化时决策可靠性问题,提出基于解释的运行时验证方法,利用模型解释评估决策合理性,在光路径传输质量分类用例中验证该方法有效,能拦截错误决策并保持高自动化率。
Comments 6 Pages, 2 Figures. Accepted and presented at the 30th International Conference on Optical Network Design and Modelling (ONDM 2026), Munich, Germany, 12-15 May 2026
CMI-Mem:通过CMI增强的强化学习实现可泛化的长期内存管理
机构 * Alibaba Group(阿里巴巴集团) ; HKUST(香港科技大学) ; PolyU(香港理工大学) ; HKUST(GZ)(香港科技大学(广州))
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究针对现有内存管理器模型局限,提出基于强化学习的CMI-Mem模型,结合下游问答正确性与内在条件互信息CMI作为混合奖励,可评估新输入信息,补充而非取代问答基础,实现可泛化的长期内存管理。
AISE-Bench:用于学术知识图谱信息检索的全周期精选基准测试
机构 * Renmin University of China(中国人民大学) ; Anhui University(安徽大学) ; Z-Lab Z.ai ; Tsinghua University(清华大学) ; Bosch Center for AI(博世人工智能中心) ; University of Oslo(奥斯陆大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究针对学术知识图谱信息检索基准测试不足的问题,引入AISE-Bench,通过定制工作流程和综合评估协议构建基准测试,为多步API使用的大语言模型智能体提供新测试平台,助力评估与改进。
Comments 9 pages, accepted by KDD 2026
Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '26), August 09-13, 2026, Jeju Island, Republic of Korea
Refnd:防止关系型数据集中的数据泄露
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 研究针对生化数据机器学习模型评估时因未考虑关系结构致数据泄露问题,提出基于关系生成过程的Refnd划分算法,利用HNSW快速计算近邻图,在抗菌肽数据集验证,性能评估更现实且适用多种数据集。
PercepCap:具有结构化时空感知的视频字幕生成器
机构 * Nanjing Univerisity(南京大学) ; Kuaishou Technology(快手科技) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 研究视频字幕生成问题,提出PercepCap框架,遵循感知-描述生成链,设计两阶段训练策略及相关数据构建方法,在评估中优于基线,提升视频字幕生成质量。
尽早检测,极少升级:从压缩比特流中随时检测人工智能生成的视频
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 研究从压缩比特流中随时检测人工智能生成视频的问题,核心方法是将任务重定义为流感知并对运动场评分,贡献是重新构建、两个保证及测量前沿,在GenVidBench等上取得较好效果。