SpecBench: Evaluating Specification-Level Reasoning for Software Engineering LLM Agents
SpecBench: 评估软件工程LLM代理的规约级推理能力
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 提出SpecBench基准,通过从RFC过程中提取任务,评估LLM代理在无执行反馈下识别初始设计提案中遗漏、歧义、不一致或错误假设的规约级推理能力。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
SpecBench: 评估软件工程LLM代理的规约级推理能力
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 提出SpecBench基准,通过从RFC过程中提取任务,评估LLM代理在无执行反馈下识别初始设计提案中遗漏、歧义、不一致或错误假设的规约级推理能力。
AgentCVR:通过脚本模拟强化学习的主动多智能体跨视频推理
机构 * Xiaohongshu Inc.(小红书公司) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 提出AgentCVR多智能体框架,将跨视频推理视为主动证据获取任务,通过主智能体协调视觉和音频智能体进行定向证据提取,并引入脚本模拟强化学习优化策略,在跨视频对齐和定位任务上超越单次基线,达到与闭源系统相当的性能。
CogniVerse: 用认知反思与几何推理革新多模态检索增强生成
机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) ; Nanyang Technological University, Singapore(新加坡南洋理工大学) ; University College London(伦敦大学学院)
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 提出CogniVerse框架,通过认知反思模块、基于黎曼流形对齐的多模态检索模块和最优传输层次生成模块,解决多模态检索增强生成中的噪声检索、跨模态语义错位和生成不连贯问题。
Comments Accepted in CVPR 2026
语言模型是否在状态变化中跟踪实体?
机构 * Department of Computer Science, Boston University, Boston, USA(波士顿大学计算机科学系) ; Department of Data Science, Monash University, Indonesia(墨尔本大学数据科学系) ; Faculty of Computer Science, University of Vienna, Austria(维也纳大学计算机科学系) ; Department of Linguistics, Boston University, Boston, USA(波士顿大学语言学系)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究语言模型在自然语言中处理多步状态变化操作时的实体跟踪机制,发现其采用非增量策略,在最后token并行聚合信息,并揭示了REMOVE操作的全局抑制标签及其导致的失败模式。
Comments ICML main conference 2026, 9 pages
SERC: 受LDPC启发的检索增强生成语义纠错方法
机构 * Department of Information Communications Engineering, Hankuk University of Foreign Studies, Republic of Korea(韩国外国语大学信息通信工程系) ; Division of Computer Engineering, Hankuk University of Foreign Studies, Republic of Korea(韩国外国语大学计算机工程系) ; Department of Statistics, Hankuk University of Foreign Studies, Republic of Korea(韩国外国语大学统计学系)
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型幻觉问题,提出受LDPC码启发的语义纠错框架SERC,通过稀疏验证策略高效检测和纠正生成文本中的错误。
Comments 15 pages, 2 figures, 6 tables. To appear in the Proceedings of the 28th International Conference on Pattern Recognition (ICPR 2026). Code available at https://github.com/labhai/SERC
RoboWits:机器人创造性问题解决中的意外挑战
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) ; Princeton University(普林斯顿大学) ; Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出RoboWits双臂机器人基准,通过多智能体协作的自动化任务生成流水线评估机器人在几何、材料和装配推理中的认知推理、创造性工具使用及鲁棒性,发现预训练VLA在突变任务中表现脆弱。
Comments The first two authors contributed equally
统一基于LLM的多智能体提示优化中的时间与结构信用分配
机构 * Tongji University(同济大学) ; The University of Hong Kong(香港大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出通过时间信用(状态空间瓶颈识别关键轮次)和结构信用(固定角色策略隔离智能体贡献)分解误差信号,并利用离散言语化块坐标下降算法迭代优化角色提示和聚合协议,降低查询复杂度并提升性能。
Comments 15 pages, 4 figures, 6 tables
元认知记忆策略优化用于长视野LLM智能体
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhejiang University(浙江大学) ; Tencent(腾讯)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 针对长视野任务中记忆策略训练缺乏中间监督的问题,提出基于信念熵的元认知记忆策略优化(MMPO),通过自监督代理惩罚高认知不确定性摘要,提升长期推理性能。
通过上下文相关性的注意力引导增强多智能体通信
机构 * Purdue University(普渡大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 针对LLM多智能体系统中长对话历史导致信息稀释的问题,提出无训练的上下文管理方法Agent-Radar,利用时空衰减机制动态引导注意力,在五个基准上取得最高7.64个绝对点的提升。
Compass: 通过专家引导的LLM代理导航全球海洋铅数据整合
机构 * School of Information Science ; Electronic Engineering,\ Jiao Tong University Shanghai China ; School of Artificial Intelligence,\ Jiao Tong University Shanghai China ; State Key Laboratory of Estuarine ; Coastal Research,\ China Normal University Shanghai China ; School of Oceanography,\ Jiao Tong University Shanghai China ; Institute of Geographical Science ; Natural Resources Research,\ Academy of Sciences Beijing China ; Electronic Engineering,\ Jiao Tong University ; School of Artificial Intelligence,\ Jiao Tong University ; Coastal Research,\ China Normal University ; School of Oceanography,\ Jiao Tong University ; Natural Resources Research,\ Academy of Sciences
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 针对海洋铅数据分散于非结构化论文中的问题,提出专家引导的LLM代理框架Compass,结合知识树分解任务,从23万篇论文中提取3751条铅记录,构建最大海洋铅数据库,准确率达92%。
BitTP:面向边缘设备的轻量级轨迹预测模型与BitLLM
机构 * KAIST, Republic of Korea(韩国釜山国立大学) ; DGIST, Republic of Korea(韩国国立庆北科学技术院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出BitTP,通过将LLM轨迹预测器转换为1.58比特轻量架构,在保持或提升预测质量的同时大幅降低内存和计算需求,实现边缘设备部署。
Comments Camera-ready version. Accepted as a findings paper at CVPR 2026. 8 pages, 4 figures
EvA: 一种面向LALM的以证据为先的音频理解范式
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Didi Chuxing(滴滴出行)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出EvA双路径架构,通过分层聚合和非压缩时间对齐融合增强声学证据保留,并在统一零样本协议下在MMAU、MMAR和MMSU上取得最佳开源感知结果,支持以证据为先的假设。
Battery-Sim-Agent: 利用LLM智能体进行电池逆参数估计
机构 * Peking University(北京大学) ; Microsoft Research(微软研究院) ; Zhejiang University(浙江大学) ; Chalmers University of Technology(皇家理工学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出Battery-Sim-Agent框架,将电池逆参数估计重构为推理任务,利用LLM智能体与高保真模拟器闭环交互,通过物理假设和结构化参数更新,显著优于贝叶斯优化等黑箱优化方法。
LiteCoder-Terminal: 扩展用于学习语言代理的长时程终端环境
机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 复杂问题求解 :planning(abstract);分类 cs.CL
AI总结 提出零依赖合成框架LiteCoder-Terminal-Gen,自动生成可执行且可验证的终端训练环境,构建大规模SFT和RL数据集,通过监督微调和直接多轮偏好优化显著提升语言代理在终端任务上的性能。
MechELK:一种用于激发大型语言模型中潜在知识的机制可解释性框架
机构 * Dongguk University(东国大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 提出MechELK框架,通过定位、验证和激发三个阶段,利用稀疏自编码器特征分析和因果探测等方法,从大型语言模型中提取隐藏知识,在TruthfulQA等基准上平均激发准确率达84.7%。
心智景观感知的检索增强生成以改进长上下文理解
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; WeChat AI, Tencent(腾讯微信AI) ; Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 提出MiA-RAG框架,通过层次化摘要构建心智景观并统一检索与生成的条件,实现全局语义表示指导下的长上下文检索与推理。
混合机制:语言模型如何在上下文中检索绑定实体
机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(塔尔瓦大学Blavatnik计算机科学与人工智能学院) ; Pr(Ai) 2 R Group(Pr(Ai) 2 R小组) ; Goodfire
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 本文研究了语言模型在上下文中绑定并检索实体的三种机制(位置机制、词汇机制和反射机制),通过九种模型和十项绑定任务的实验揭示了它们的混合模式,并构建了一个因果模型以95%的一致性估计下一词分布。
Comments Accepted to ICLR 2026 Main Conference
AnomalyAgent: 用于零样本/少样本异常检测的无训练智能体模型
机构 * Singapore Management University(新加坡国立管理学院) ; Sun Yat-sen University(中山大学)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 提出一种基于多模态大语言模型的无训练智能体框架AnomalyAgent,通过定制工具集和记忆模块实现零样本/少样本异常检测,在逻辑/上下文异常等复杂场景中优于现有方法。
朗道能级间配对隧穿使ν=1/3 Laughlin态的长波结构因子刚性化
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 通过微扰和非微扰方法研究ν=1/3 Laughlin态的朗道能级混合效应,发现非微扰结果中长波结构因子S(1)被抑制32%,与微扰预测的增强21%相反,且反转归因于DD↔UU配对隧穿通道。
Comments This paper has been withdrawn by the authors due to the obsolescence of certain datasets and flaws identified in the original claims. We are completely reconstructing the arguments based on new evidence
ElegantVLA:学习何时思考以实现高效的视觉-语言-动作模型
机构 * Tsinghua University(清华大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 提出ElegantVLA,一种即插即用的相位自适应推理框架,通过动态计算调度在视觉编码器、大语言模型和动作头之间分配计算资源,实现VLA模型加速,在GR00T和CogACT上分别获得最高2.55倍和3.77倍加速。
TRACE: 基于图尔敏论证元素的 LLM 思维链推理评估
机构 * Applied Agent Research Center, Korea Institute of Science(应用智能代理研究中心,韩国科学技术信息研究所) ; Department of Computer Science and Engineering, University of Seoul, Republic of Korea(首尔大学计算机科学与工程系,大韩民国)
专题命中 推理评测 :CoT(title,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出 TRACE 指标,结合图尔敏论证理论与弗拉维尔元认知框架分析思维链推理结构,实验表明与基准准确率强相关(r=0.74)并可作为有效强化学习奖励信号。
Comments 23 pages, Accepted at ICML 2026
AV-EMO-Reasoning: 在具有视听线索的全模态大语言模型中基准测试情感推理能力
机构 * UC Berkeley(加州大学伯克利分校) ; South China University of Technology(华南理工大学) ; Zhejiang University(浙江大学) ; National Taiwan University(台湾大学) ; University of Southern California(美国南加州大学)
专题命中 推理评测 :reasoning(title,title_cn)
AI总结 提出AV-EMO-Reasoning基准,通过合成和真实世界的视听对话数据集及情感感知与交互推理指标,系统评估全模态大语言模型的情感推理能力。
快思考,错思考:直觉性调节LLM在政策评估中的反事实推理
机构 * Independent Researcher(独立研究者)
专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本研究构建了一个基于经济学和社会科学实证案例的基准,通过8000次实验评估大型语言模型在政策评估中的反事实推理,发现链式思维提示在反直觉案例中效果显著减弱,且直觉性是主导因素,表明模型存在知识-推理分离。
Comments 10 pages, 6 figures, 6 tables
当模型学会问为什么:面向可信医疗视觉语言模型的自适应因果推理
机构 * The Ohio State University(俄亥俄州立大学) ; Hunan University(湖南大学) ; Amazon(亚马逊)
专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI
AI总结 提出MedCausalX框架,通过因果推理链、自适应反射架构和轨迹级因果校正,解决医疗VLM中的虚假相关和推理不一致问题,显著提升诊断一致性和减少幻觉。
Comments Accepted by CVPR 2026 Findings
ReasonOps: 大语言模型推理轨迹的算子分割
机构 * Stanford University(斯坦福大学)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 提出无监督方法ReasonOps,从思维链轨迹中提取7种通用推理算子,揭示模型推理结构并用于模型识别与正确性预测。
VisualThink-VLA:用于高效低延迟视觉-语言-动作策略的视觉中间推理
机构 * Zhejiang University(浙江大学) ; Cornell University(康奈尔大学) ; National University of Singapore(新加坡国立大学) ; Xi'an University of Electronic Science and Technology(西安电子科技大学)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出VisualThink-VLA框架,通过视觉中间推理和选择性路由机制,在保持高精度的同时将推理延迟从数秒降至亚秒级。
MuPHI: 通过语义基础奖励优化学习隐式多模态有害推理
机构 * Max Planck Institute for Informatics(马克斯·普朗克院信息研究所) ; Saarland Informatics Campus(萨尔兰州信息校园) ; Saarland University(萨尔兰州大学) ; The University of Edinburgh(爱丁堡大学) ; Samsung AI Center, Cambridge(三星AI中心,剑桥)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对视觉语言模型在隐式跨模态有害语义推理上的不足,提出MuPHI数据集和MuPHIRM训练框架,通过多视角奖励优化联合语义学习,提升有害检测与推理质量及分布外鲁棒性。
教师引导的策略优化:大策略差异下的在线推理蒸馏
机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) ; Tsinghua University(清华大学) ; Meituan(美团) ; Meta AI ; NiuTrans Research, Shenyang, China(新译研究院,沈阳,中国)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 针对在线蒸馏中教师与学生策略差异大时反向KL监督失效的问题,提出教师引导策略优化(TGPO),通过教师直接指导学生上下文的token级生成并结合RLVR奖励,在推理基准上优于现有方法。
UA-Legal-Bench:评估大语言模型在乌克兰法律推理上的基准
机构 * SecondLayer
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对法律NLP基准以英语为中心的问题,构建了基于乌克兰法院判决的五个任务基准,评估11个LLM,发现少样本提示效果因任务而异,且在不平衡任务中准确率具有误导性。
Comments 13 pages, 5 figures, 4 tables. Data: https://huggingface.co/datasets/overthelex/ua-legal-bench
GRUFF:德语中LLM的代词忠实度、推理与偏见
机构 * JobMatchMe GmbH(JobMatchMe公司) ; Trustworthy AI Lab(可信人工智能实验室) ; Heidelberg Institute for Theoretical Studies(海德堡理论研究所)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 通过构建大规模德语数据集GRUFF,研究大型语言模型在四种性别一致系统与四组代词上的代词忠实度,发现模型在无显式上下文时对阳性和阴性实体表现出强语法一致,但对新代词xier和en较弱,且职业刻板印象在不同语法格和模型间相关性低。