Hypergraph Enterprise Agentic Reasoner over Heterogeneous Business Systems
面向异构业务系统的超图企业代理推理器
机构 * SUPCON
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出HEAR,一种基于分层超图本体的企业代理推理器,通过分层图层和超边层实现结构化多跳分析,无需重新训练LLM,在供应链任务中达到94.7%的准确率,并展示出适应性和效率。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
面向异构业务系统的超图企业代理推理器
机构 * SUPCON
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出HEAR,一种基于分层超图本体的企业代理推理器,通过分层图层和超边层实现结构化多跳分析,无需重新训练LLM,在供应链任务中达到94.7%的准确率,并展示出适应性和效率。
M3: 对话式大语言模型简化安全的临床数据访问、理解与分析
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Technical University of Munich(慕尼黑技术大学) ; Universitat Pompeu Fabra(庞培法华大学) ; St. Jude Children’s Research Hospital(圣犹大儿童研究医院) ; Beth Israel Deaconess Medical Center(贝斯以色列医疗中心) ; Harvard T.H. Chan School of Public Health(哈佛大学T.H. Chan公共卫生学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出M3系统,通过模型上下文协议实现对MIMIC-IV数据库的自然语言查询,降低了临床数据访问和分析的技术门槛,并展示了其在安全性和性能上的优势。
Comments 18 pages, 4 figures, 3 tables
OSCToM: 用于高阶理论之心的强化学习引导对抗生成
机构 * Department of Computer Science(计算机科学系) ; BRAC University(布拉克大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出OSCToM,一种结合强化学习、领域特定语言和组合替代模型的方法,用于建模LLM中的嵌套信念冲突,通过生成观察者-自我冲突来提升复杂社会场景下的理论之心推理能力。
Comments 15 pages, 12 figures containing 15 images, 3 tables. Code available at https://github.com/sharminsrishty/osct
Mix-Quant: 量化预填,精准解码用于代理大语言模型
机构 * National University of Singapore(新加坡国立大学)
专题命中 复杂问题求解 :planning(abstract);分类 cs.CL
AI总结 本文提出Mix-Quant,一种简单有效的阶段感知量化框架,用于加速代理大语言模型的推理。通过在预填阶段应用高吞吐量NVFP4量化,同时保留BF16精度用于解码,从而在保持任务性能的同时显著提高效率,实现预填阶段高达3倍的速度提升。
利用视觉-语言模型检测教育视频中的注意力
机构 * Sorbonne University, CNRS, LIP6 & PHENIX(索邦大学、国家科学研究中心、LIP6与PHENIX)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文研究利用视觉-语言模型直接分析教育视频内容,结合眼动数据以提高注意力检测的准确性,但发现其在实时教育诊断中的局限性。
AuDirector:一种用于沉浸式音频叙事的自反思闭环框架
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学)
专题命中 复杂问题求解 :self-correction(abstract)
AI总结 本文提出AuDirector框架,通过自反思闭环多智能体方法解决长期音频叙事中一致性、情感表达和音频保真度的问题,提升语音生成的质量和用户交互性。
偏见与推理的力学:分析链式推理提示对大语言模型中性别偏见的影响
机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) ; McGill University(麦吉尔大学) ; HEC Montreal(蒙特利尔HEC)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文研究了链式推理提示对大语言模型中性别偏见的影响,结合基准测试评估与机制可解释性技术,发现链式推理并未有效减少偏见,偏见仍存在于隐藏表示中。
Comments 24 pages, 6 figures, including appendix. Accepted at the ICLR 2026 Workshop on Algorithmic Fairness Across Alignment Procedures and Agentic Systems. Submitted to COLM 2026
Affordance-R1: 为多模态大语言模型中的通用化 affordance 推理设计的强化学习
机构 * The Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)) ; National University of Singapore(新加坡国立大学) ; ShanghaiTech University(上海科技大学) ; East China Normal University(华东师范大学) ; Nanjing University of Information Science & Technology(南京信息工程大学) ; Zhejiang University(浙江大学) ; Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract)
AI总结 本文提出 Affordance-R1,一种结合认知 CoT 引导的 Group Relative Policy Optimization (GRPO) 的统一 affordance 地标框架,通过强化学习实现零样本泛化和测试时推理能力。
EvalMORAAL: 可解释的链式推理与大语言模型道德对齐的LLM-as-Judge评估
机构 * Department of Methodology and Statistics, Utrecht University(方法论与统计学系,乌得勒支大学)
专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出EvalMORAAL框架,通过两种评分方法和模型作为裁判的同行评审,评估20个大语言模型的道德对齐情况,发现西方与非西方地区存在显著的道德对齐差距。
Comments Accepted as a poster at *SEM 2026
RoadTones: 从道路事件视频生成可调节语气的文本
机构 * CVIT & iHub-Data, IIIT Hyderabad, India(CVIT与iHub-Data,IIIT海得拉巴,印度)
专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(abstract)
AI总结 本文提出RoadTones-51K数据集和RoadTones-VL-CoT模型,通过生成语气条件的推理草稿提升可解释性,并引入RoadTones-Eval评估体系,共同为上下文敏感的可调节视频描述奠定基础。
Comments Accepted at CVPR Findings 2026. Project page: https://roadtones.github.io/
FruitEnsemble: MLLM-Guided Arbitration for Heterogeneous ensemble in Fine-Grained Fruit Recognition
机构 * University of Science and Technology Liaoning(辽宁科技大学) ; Chuzhou University(楚州大学) ; Yeshiva University(犹他大学)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出FruitEnsemble框架,通过多阶段动态推理解决细粒度水果分类中的泛化限制问题,利用MLLM进行专家仲裁以提升分类准确率,最终达到70.49%的分类精度。
Comments 10 pages,6 figures,submitted to CVPR 2026
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) 2026
推理轨迹坍缩:在微调过程中显式推理能力的丧失评估
机构 * King’s College London(伦敦国王学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG
AI总结 本文研究了在微调过程中显式推理能力的丧失问题,提出了一种结构评估框架来区分答案正确性与推理轨迹的有效性,并发现标准监督微调会迅速抑制有效的推理轨迹,而仅关注答案的指标会掩盖这一问题。
Comments 22 pages, 3 tables, 3 figures
AgentEscapeBench: 评估LLM代理在跨领域工具引导推理中的能力
机构 * Fudan University(复旦大学) ; Meituan Longcat Team(美团Longcat团队)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出AgentEscapeBench基准测试,用于评估LLM代理在非熟悉工作流和短程交互之外维持工具引导推理的能力,通过逃亡室风格的任务测试代理在显式长距离依赖约束下推断、执行和修订新工具使用程序的能力,结果显示代理在依赖深度增加时表现显著下降。
VLMs能否解锁语义异常检测?一个结构化推理的框架
机构 * Professorship of Autonomous Vehicle Systems TUM School of Engineering ; Design, Technical University of Munich Munich, Germany
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出SAVANT框架,通过结构化推理方法提升VLM在语义异常检测中的性能,实现对自动驾驶场景中罕见异常情况的更准确识别。
Comments 8 pages, 5 figures
字典插入提示用于多语言推理在多语言大语言模型上
机构 * The Chinese University of Hong Kong(香港中文大学) ; Southeast University(东南大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出了一种名为字典插入提示(DIP)的新方法,通过在提示中插入词典中的英文对应词来提升多语言推理性能,实验表明在10到200种语言上效果显著。
Comments ACL *SEM 2026
推理监督有害:基于TTCW的长文本文学评论生成
机构 * School of Computer Science, University of Birmingham, United Kingdom(英国伯明翰大学计算机科学学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出了一种基于TTCW的长文本文学评论生成方法,通过构建包含263911个长文本故事的数据集,每个故事都标注了14个TTCW维度的评分和元合成评论。实验发现,非推理微调在性能和稳定性上更优,而推理监督模型更易出现解析失败,导致生成无关或重复的推理文本,表明在固定格式评分标准下,推理监督并不总是有益的。
Comments Submit to EMNLP 2026
ProCrit: 通过批评引导的修订实现自激发多视角推理用于多模态讽刺检测
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Baidu Inc.(百度公司) ; Zhipu AI(智谱AI)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出ProCrit,一种通过批评引导的修订实现自激发多视角推理的框架,用于多模态讽刺检测,解决了现有方法依赖固定视角的问题,通过动态生成多视角分析并进行协同优化。
IndusAgent: 通过智能工具增强开放词汇工业异常检测
机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) ; Santa Clara University(圣克拉拉大学) ; LongCat Team(LongCat团队) ; Independent Researcher(独立研究者) ; New York University(纽约大学) ; Sun Yat-sen University(孙中山大学) ; Nanyang Technological University(南洋理工大学) ; Stanford University(斯坦福大学) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract)
AI总结 本文提出IndusAgent框架,通过整合视觉观测、高分辨率局部片段和专家正常性先验,提升开放词汇工业异常检测的零样本性能,验证了方法的鲁棒性和泛化能力。
如果智能体能够想象?通过生成强化开放词汇人-物交互理解
机构 * Dream-X Team(Dream-X团队) ; Stanford University(斯坦福大学) ; National University of Singapore(新加坡国立大学) ; Independent Researcher(独立研究者) ; Case Western Reserve University(凯斯西储大学) ; UC Santa Cruz(加州大学圣克鲁兹分校)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract)
AI总结 本文提出ImagineAgent框架,通过生成式世界建模和工具增强强化学习,解决开放词汇人-物交互理解中的跨模态幻觉和视角限制问题,实现了高效且鲁棒的推理。
TextReg: 通过正则化的文本空间优化缓解提示分布过拟合
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了提示分布过拟合问题,提出TextReg框架通过正则化的文本梯度实现软惩罚目标,结合双证据梯度净化、语义编辑正则化和正则化引导的提示更新,提升模型在分布外(OOD)任务上的泛化能力。
Comments Code: https://github.com/luchengfu6/TextReg
在消费级硬件上实现GraphRAG:对本地LLMs在医疗EHR模式检索中的基准测试
机构 * Department of Computer Engineering(计算机工程系) ; California Polytechnic State University(加州州立大学波特兰分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了在消费级硬件上使用本地LLMs进行医疗EHR模式检索的GraphRAG方法,评估了四种不同模型在索引效率、知识图构建、查询延迟、回答质量和幻觉方面的表现,发现模型参数大小和检索模式对结果有显著影响。
Comments 9 pages, 1 figure, 5 tables
FT-Dojo: 向自主LLM微调迈进的语言代理
机构 * Peking University(北京大学) ; Nanjing University(南京大学) ; Microsoft Research Asia(微软亚洲研究院) ; The University of Chicago(芝加哥大学)
专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出FT-Dojo交互式基准环境,用于研究自主LLM微调,通过标准化任务接口、共享数据仓库、沙盒执行环境和反馈协议,开发了FT-Agent框架,实现了结构化迭代规划和多级反馈分析,实验显示FT-Agent在13个任务中表现优异,且展示了代理在故障恢复和长期规划中的能力。
Comments 26 pages, 6 figures, 11 tables
代理记忆的解剖结构:评估和系统限制的分类与实证分析
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of California Davis(加州大学戴维斯分校) ; Texas A&M University(德克萨斯农工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文通过分类和实证分析,探讨了代理记忆系统的架构和系统限制,揭示了现有系统在基准饱和效应、指标有效性、模型依赖性和内存维护开销等方面的问题,并提出了更可靠的评估方法和可扩展的系统设计方向。
END:早期噪声丢弃以实现高效有效的上下文去噪
机构 * Amazon(亚马逊)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出END方法,通过在早期层对输入序列进行分割和线性探针,有效识别并丢弃噪声部分,从而提升LLM在不同任务上的性能和效率,同时加深了对LLM内部上下文推理机制的理解。
DeepWeb-Bench: 一个要求大规模跨源证据和长周期推导的深度研究基准
机构 * Peking University(北京大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出DeepWeb-Bench基准,通过要求大规模证据收集、跨源验证和长周期推导,评估前沿语言模型在深度研究任务中的能力,揭示检索并非瓶颈,强弱模型失败方式不同,且模型在不同领域表现出专业性。
Comments Work in Progress. 27 pages, 10 figures, 4 tables. Project page: https://sixiongxie1001-dot.github.io/deep-research-benchmark2.0
WikiVQABench: 一个基于维基百科和维基数据的知识引导视觉问答基准
机构 * IBM Research San Jose(IBM桑 Jose研究实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出WikiVQABench,一个结合维基百科图片、文章描述和维基数据结构化知识的知识引导视觉问答基准,通过大规模语言模型生成候选多选题,并由人工审核确保事实正确性和视觉-文本一致性,评估多种视觉-语言模型在知识密集型推理中的性能。
TempGlitch: 评估视觉-语言模型在游戏视频中检测时间故障的能力
机构 * University of Alberta(阿尔伯塔大学) ; Sony Interactive Entertainment(索尼互动娱乐)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出TempGlitch基准测试,用于评估视觉-语言模型在游戏视频中检测时间故障的能力,发现现有模型在处理时间故障时表现不佳,且更密集的帧采样和更大的模型尺寸并不能有效解决这些问题。
文本分析评估框架:基于LLM和社交媒体的案例研究
机构 * School of Computer Science and Informatics, Cardiff University(计算机科学与信息学学院,卡迪夫大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出了一种基于问题的评估框架,通过470个手工整理的问题来评估LLM在处理聚合文本数据时的语义理解和推理能力,揭示了LLM在处理大规模文本数据时的性能瓶颈。
CTFExplorer: 通过多目标网络CTF基准测试评估LLM进攻性代理
机构 * CISPA - Helmholtz Center for Information Security(CISPA-海德堡信息安全研究中心) ; NYU Tandon School of Engineering(纽约大学坦顿工程学院) ; NYU Abu Dhabi(纽约大学阿布扎克分校) ; IIIT Hyderabad(海得拉巴印度理工学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出CTFExplorer基准测试,通过多目标网络CTF基准测试评估LLM进攻性代理,研究问题是如何在不确定环境下评估代理的战术推理能力,核心方法是引入多目标环境测试代理的探索、优先级和攻击链能力,主要贡献是开发了可评估代理行为的框架。
检索增强的代码生成:聚焦于仓库级方法的综述
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Chinese University of Hong Kong(香港中文大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文综述了检索增强的代码生成方法,重点探讨仓库级方法,分析了其在大规模代码生成中的挑战与解决方案,总结了现有方法的分类框架及关键挑战。