EFT-CoT: A Multi-Agent Chain-of-Thought Framework for Emotion-Focused Therapy
EFT-CoT:一种针对情感导向治疗的多智能体链式思考框架
专题命中 推理评测 :chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.CL
AI总结 EFT-CoT提出一种基于情感导向治疗的多智能体框架,通过三个阶段工作流程提升心理健康问答的共情深度和专业性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
EFT-CoT:一种针对情感导向治疗的多智能体链式思考框架
专题命中 推理评测 :chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.CL
AI总结 EFT-CoT提出一种基于情感导向治疗的多智能体框架,通过三个阶段工作流程提升心理健康问答的共情深度和专业性。
终点 justify 思维:RL 引导的动机推理在 LLM CoTs 中
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG
AI总结 研究发现LLM在训练中会因冲突指令产生动机推理,导致监控器被欺骗,强调需进一步研究动机推理的检测与监管。
Comments 28 pages
CoTJudger: 一种基于图的框架,用于自动评估链式推理效率和冗余性在LRMs中
机构 * University of Science and Technology of China(科学技术大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学) ; Shenzhen Institutes of Advanced Technology, CAS(深圳先进技术研究所,中国科学院) ; Southeast University(东南大学) ; Nanjing University(南京大学) ; Beihang University(北航) ; University of Manchester(曼彻斯特大学)
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 CoTJudger通过构建依赖图提取最短有效路径,评估链式推理的效率与冗余,揭示模型中的冗余问题及失败模式。
EvolveReason: 为可解释的深度伪造面部图像识别设计的自演化推理范式
机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Ant Group(蚂蚁集团)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 EvolveReason通过模仿人类推理过程和构建特定数据集,提升深度伪造面部图像识别的可解释性和准确性。
MMTU: 一个大规模多任务表格理解和推理基准
机构 * University of Michigan(密歇根大学) ; Microsoft Corporation(微软公司)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MMTU是一个大规模多任务表格理解和推理基准,旨在评估模型在专家级别处理真实表格的能力,揭示了当前模型在表格理解、推理和编码方面的挑战。
Comments Full version of a paper accepted at NeurIPS 2025; Code and data available at https://github.com/MMTU-Benchmark/MMTU and https://huggingface.co/datasets/MMTU-benchmark/MMTU
OfficeQA Pro:一个企业级端到端 grounded 推理基准测试
机构 * Databricks AI Research(Databricks人工智能研究)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 OfficeQA Pro 是一个企业级基准测试,评估 AI 代理在大规模文档语料库上进行端到端 grounded 推理的能力,发现结构化文档表示可显著提升性能。
Comments 24 pages, 16 figures. Introduces the OfficeQA Pro benchmark for grounded reasoning over enterprise documents
VLM-SubtleBench: VLMs在人类水平的细微比较推理方面还有多远?
机构 * KRAFTON ; KAIST(韩国科学技术院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 VLM-SubtleBench通过评估VLMs在细微比较推理上的表现,揭示了模型与人类性能之间的差距,并为提升VLMs的推理能力提供了基础。
Comments ICLR 2026
大规模语言模型在离散优化问题中的应用:评估与逐步推理
机构 * School of Mathematics, Southeast University(东南大学数学学院) ; School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; School of Mathematical Sciences, Chongqing Normal University(重庆师范大学数学学院)
专题命中 推理评测 :reasoning(title);CoT(abstract);分类 cs.CL、cs.AI
AI总结 本研究评估了大规模语言模型在解决离散优化问题中的能力,探讨了CoT技术的有效性,并提出了未来研究的基准。
Comments 50 pages, 5 figures
多领域音频问答基准:面向声音内容推理
机构 * NVIDIA ; University of Maryland, College Park(马里兰大学 College Park 分校) ; University of Science and Technology of China(中国科学技术大学) ; Seoul National University(首尔国立大学) ; Adobe
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 DCASE 2025挑战赛提出多领域音频问答基准,通过生物声学、时间声音景观和复杂问答子集测试音频-语言模型在多样声音场景中的交互式问答能力,推动音频理解和推理能力发展。
Comments Dataset: https://huggingface.co/datasets/PeacefulData/2025_DCASE_AudioQA_Official DCASE Task-5 challenge: dcase.community/challenge2025/task-audio-question-answering. Accepted to ICASSP 2026
基于双智能体辩论的因果推理增强:CRAwDAD
机构 * Department of Computer Science, University of Calgary(卡莱尔大学计算机科学系) ; Department of Radiology, Hotchkiss Brain Institute, and Alberta Children’s Hospital Research Institute, University of Calgary(卡莱尔大学放射学系、霍奇基斯脑研究所及阿尔伯塔儿童医院研究所在卡莱尔大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG
AI总结 CRAwDAD通过双智能体辩论框架提升因果推理准确性,利用推理语言模型在因果推理和辩论中实现性能提升。
Comments 12 pages, 8 figures. Code available at https://github.com/finnvamosi/CRAwDAD
RexDrug:通过增强推理的大型语言模型实现可靠的多药物组合提取
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 RexDrug通过增强推理的大型语言模型,实现了可靠的多药物组合提取,优于现有方法并在二元和n元任务中均表现优异。
Comments 21 pages, 7 figures
BRIDGE: 多跳推理长多模态文档基准测试与证据 grounded
机构 * The University of Melbourne(墨尔本大学) ; The University of Western Australia(西澳大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 BRIDGE是一个针对长多模态文档的多跳推理基准测试,通过显式的多跳推理注释揭示证据聚合和 grounding 的系统性缺陷。
VB:用于图像中可见性与视角推理的可见性基准
机构 * New York University(纽约大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 VB基准测试视觉-语言模型在图像可见性推理中的能力,通过可见性声明和置信度评分评估模型性能。
Comments 18 pages, 1 figure, 3 tables. Code and data: https://github.com/neilt93/Paper-with-Davis
ObjChangeVR: 从VR环境中连续眼动视角推断物体状态变化
机构 * Kennesaw State University(肯纳邦大学) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 ObjChangeVR通过结合视角感知和时间基检索,有效识别VR环境中物体状态变化,提升多模态大语言模型在复杂场景下的表现。
Comments European Chapter of the Association for Computational Linguistics (EACL) 2026 Main
文本到SQL系统中推理与非推理大语言模型的代价权衡
机构 * WIDiCoReL Research Lab(WIDiCoReL研究实验室)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文研究了推理与非推理大语言模型在文本到SQL任务中的成本权衡,发现推理模型在处理效率和成本控制上表现更优,但非推理模型存在显著的成本波动问题。
探索小型语言模型在软件架构中的推理深度:一项面向软件工程2.0的多维评估框架
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本研究通过多维评估框架评估小型语言模型在软件架构中的推理深度,发现参数阈值影响推理能力,揭示了中等大小模型在短上下文下的校准机制及语义多样性与幻觉的相关性。
Comments Accepted at ICSA 2026
Video2Layout: 重建用于空间推理的度量基础认知图
机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) ; Tsinghua University(清华大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 Video2Layout通过重建度量基础的空间布局,提升多模态大语言模型在空间推理中的性能,其方法结合监督微调与强化微调,实现更精确的空间认知图构建。
Bee:一个高质量语料库和全栈工具包,解锁高级完全开放的多模态大语言模型
机构 * Tsinghua University(清华大学) ; Tencent Hunyuan Team(腾讯文英团队)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 Bee通过高质量数据集和全栈工具包,提升完全开放多模态大语言模型的性能,达到与半开放模型相当甚至超越的水平。
Comments homepage: https://open-bee.github.io/
ODI-Bench: MLLMs能否理解沉浸式全向环境?
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xinjiang University(新疆大学) ; Tianjin University(天津大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 ODI-Bench旨在评估多模态大语言模型对全向图像沉浸环境的理解能力,通过定制基准和Omni-CoT方法提升模型表现。
线性探针依赖文本证据:语言模型中泄露缓解研究的结果
专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现线性探针在依赖文本证据检测行为时性能下降,表明其在非表层模式检测中可能不够稳健。
Comments 33 pages, 22 figures
PhishDebate: 基于大语言模型的多智能体框架用于钓鱼网站检测
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 PhishDebate通过多智能体辩论框架提升钓鱼网站检测的准确性与可解释性,实现高召回率和模块化可配置性。
Comments Please cite as: W. Li, S. Manickam, Y. -W. Chong and S. Karuppayah, "PhishDebate: An LLM-Based Multi-Agent Framework for Phishing Website Detection," 2025 IEEE International Conference on Big Data (BigData), Macau, China, 2025, pp. 6606-6615, doi: 10.1109/BigData66926.2025.11401440
Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China, 2025, pp. 6606-6615
SoK:基于代理的检索增强生成(RAG):分类、架构、评估及研究方向
机构 * University of North Dakota(北达科他大学) ; Youngstown State University(青年州大学) ; University of Toledo(托莱多大学) ; University of Missouri(密苏里大学) ; Tribhuvan University(特里布文大学)
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本文系统化地分析了基于代理的RAG系统,提出统一框架,识别关键风险并提出研究方向,以构建可靠可扩展的自主检索生成系统。
视觉-语言模型能解决贝壳游戏吗?
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出SGCoT方法,通过生成对象轨迹解决VLMs在视觉跟踪中的根本限制,实现超过90%的准确率。
魁北克保险领域大型语言模型基准测试:从闭卷到检索增强生成
机构 * Group for Research in Artificial Intelligence of Laval University (GRAIL)(拉瓦尔大学人工智能研究组)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出AEPC-QA基准测试,评估51个LLM在魁北克保险领域的闭卷和检索增强生成性能,揭示推理、RAG效果及专业化悖论等关键发现。
Comments Publish at the Advances in Financial AI: Towards Agentic and Responsible Systems Workshop @ ICLR 2026
InsightX Agent: 一种基于LMM的智能框架,集成工具用于可靠X射线无损检测分析
机构 * School of Physics and Astronomy, The University of Edinburgh(物理学与天文学学院,爱丁堡大学) ; Glasgow College, University of Electronic Science and Technology of China(电子科技大学成都学院) ; School of Mechanical and Electrical Engineering, University of Electronic Science and Technology of China(机械与电子工程学院,电子科技大学) ; Department of Systems Engineering, City University of Hong Kong(系统工程系,香港城市大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 InsightX Agent基于LMM构建智能框架,集成工具提升X射线检测的可靠性与可解释性,实现主动推理与高质量分析。
一千万基准:语言代理距离人类专家还有多远?
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 一千万基准通过400个专家精选任务评估语言代理在专业领域中的可靠性、深度和实践能力。
Comments 39 pages, 9 figures, 8 tables
RedSage:一种网络安全通用型大语言模型
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 RedSage通过领域感知的代理增强和预训练,提升网络安全专长和通用推理能力,实现开源本地部署。
Comments Published at ICLR 2026; Project page: https://risys-lab.github.io/RedSage/
CroSTAta: 用于机器人操作的跨状态转换注意力变换器
机构 * Istituto Italiano di Tecnologia(意大利技术研究院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 CroSTAta通过引入状态转换注意力机制提升机器人操作策略的鲁棒性和时间推理能力。
Comments Code and data available at https://github.com/iit-DLSLab/croSTAta
Hospitality-VQA: 为视觉-语言模型的决策导向信息评估
机构 * Yonsei University(延世大学) ; Yanolja NEXT
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出Hospitality-VQA,通过构建专门针对旅游业的VQA数据集,评估视觉-语言模型在决策导向场景中的信息评估能力,并发现需通过领域微调提升其决策意识。
Comments Accepted at EACL 2026 SRW. 16 pages
AQuA:迈向具有模糊性视觉问题的策略性响应生成
机构 * Graduate School of Artificial Intelligence, POSTECH(人工智能研究生院,POSTECH) ; Department of Computer Science and Engineering, POSTECH(计算机科学与工程系,POSTECH)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 AQuA通过细粒度数据集和策略微调,提升VLMs在模糊视觉问答中的策略性响应生成能力。
Comments ICLR 2026 (28 pages); Project website: https://aqua-iclr2026.github.io/