Active Semantic Perception
主动语义感知
机构 * General Robotics, Automation, Sensing and Perception (GRASP) Laboratory(通用机器人、自动化、传感与感知实验室)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出一种基于紧凑多层场景图和大语言模型的主动语义感知方法,用于高效探索未知环境,在仿真和真实机器人上验证了优于现有方法。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
主动语义感知
机构 * General Robotics, Automation, Sensing and Perception (GRASP) Laboratory(通用机器人、自动化、传感与感知实验室)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出一种基于紧凑多层场景图和大语言模型的主动语义感知方法,用于高效探索未知环境,在仿真和真实机器人上验证了优于现有方法。
超越承诺边界:探究大型推理模型中的附带思维链
机构 * CLCG, University of Groningen(格罗宁根大学CLCG) ; University of Milano-Bicocca(米兰-布雷拉大学) ; University of Trieste(特里耶大学) ; Khoury College of Computer Sciences, Northeastern University(东北大学Khoury计算机科学学院)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过早期退出估计思维链步骤的因果重要性,发现推理中存在从瞬态猜测到稳定答案的“承诺边界”,后续步骤为附带现象,可提前退出以缩短推理长度达55%而不影响性能。
人工智能研究中的主题相变:大规模证据与新兴主题的早期预警信号
机构 * College of Science and Engineering(科学与工程学院) ; Hamad Bin Khalifa University(哈马德·本·哈利法大学) ; Doha, Qatar(卡塔尔多哈)
专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI
AI总结 通过分析2017-2025年五大AI会议论文,发现AI主题通过“相变”方式突然爆发,并基于早期预警信号识别未来需关注的主题。
一个令牌就能欺骗LLM裁判
机构 * Princeton University(普林斯顿大学) ; University of Virginia(弗吉尼亚大学) ; Tencent AI Lab(腾讯人工智能实验室) ; Rutgers University(罗格斯大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 发现基于参考的生成式奖励模型易受奖励黑客攻击,表面输入(如非词符号或通用推理开头)能持续引发假阳性奖励,提出使用截断模型输出作为对抗性负例的数据增强策略,构建鲁棒的Master奖励模型。
基于评分标准的自蒸馏:无需评分标准验证器的后训练
机构 * Scale AI
专题命中 测试时计算 :verifier(abstract);分类 cs.LG
AI总结 提出RGSD方法,通过将评分标准作为条件蒸馏到学生模型,无需验证器即可实现密集逐令牌学习,在医学和科学领域达到与基于评判的GRPO相当的评分标准满足率。
Select to Think: 利用局部充分性解锁小语言模型潜力
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 提出Select to Think (S2T)方法,通过将大语言模型角色从生成转为选择,并蒸馏选择逻辑到小语言模型,使其在推理时无需依赖大模型,显著提升性能。
Comments Accepted to ICML 2026. Code is available at https://github.com/YeRona/Select-to-Think
CQC-RAG: 通过跨查询一致性实现鲁棒的检索增强生成
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出CQC-RAG框架,通过生成语义等价但句法多样的查询,并基于跨查询一致性评估答案置信度稳定性,有效过滤噪声诱导的幻觉,在开放域问答任务上显著提升性能。
自进化视觉语言模型用于图像质量评估:基于投票与排序
机构 * City University of Hong Kong(香港城市大学) ; ByteDance Inc.(字节跳动公司)
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出EvoQuality框架,通过自一致性生成伪标签,利用群体相对策略优化迭代提升VLM的图像质量感知能力,无监督下在多个IQA基准上超越监督方法。
Comments Published as a conference paper at ICLR 2026
通过逐步偏好调优的多模态智能体迭代工具使用探索
机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) ; State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) ; Department of Automation, Tsinghua University(自动化系,清华大学)
专题命中 测试时计算 :verifier(abstract)
AI总结 提出SPORT方法,通过任务合成、步骤采样、步骤验证和偏好调优的迭代循环,使多模态智能体无需预收集数据即可自主探索和优化工具使用策略,在GTA和GAIA基准上分别提升6.41%和3.64%。
Comments 24 pages
LLMs 作为 ASP 程序员:自我纠正实现任务无关的非单调推理
机构 * Arizona State University(亚利桑那州立大学) ; Samsung Research(三星研究院)
专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(title,abstract);分类 cs.AI
AI总结 提出 LLM+ASP 框架,通过自我纠正循环将自然语言转化为回答集程序,实现无需任务特定工程的非单调推理,在多个基准上优于 SMT 方法。
Comments 30 pages
Operadic一致性:LLM中组合推理失败的无标签信号
机构 * Incubilate ; University of Cambridge(剑桥大学) ; Allen Institute for Artificial Intelligence(艾伦人工智能研究所)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 提出Operadic一致性(OC)作为检测大语言模型组合推理失败的无标签信号,在四个多跳QA数据集上与准确率强相关(Pearson r≥0.86),优于自一致性等方法。
ReSET: 通过步骤感知温度缩放实现精确的延迟关键型NVFP4推理
机构 * Hanyang University(汉阳大学) ; Xenoscube Korean Inc.(Xenoscube韩国公司)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 针对大型推理模型在NVFP4低精度推理中精度下降和延迟问题,提出基于推理步骤熵的温度缩放方法ReSET,并设计CUDA小M核,在多个基准上提升精度约2点,解码速度提升2倍。
用于LLM组合推理的Operad框架
机构 * Allen Institute for Artificial Intelligence(人工智能研究所)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 提出operad作为问题分解的数学框架,定义问题operad Q,将QA模型解释为Q上的代数,并引入operadic一致性度量,实验表明该度量与准确性强相关。
推理模型知道什么重要,并在其激活中编码
机构 * Technion(技术离子大学) ; University of Zagreb, FER(扎格雷布大学,FER) ; MIT(麻省理工学院) ; Kempner Institute, Harvard(哈佛大学凯普纳研究所)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 通过分析模型激活而非仅依赖推理链文本,发现激活能更有效识别关键推理步骤,且模型在生成后续步骤前已内部编码步骤重要性。
ReCal: 基于强化学习的LLM路由的奖励校准
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出ReCal框架,通过分层奖励分解和分布感知优化校准奖励信号,解决多目标冲突和异质性任务优化偏差,提升LLM路由性能与稳定性。
HyperTool:超越逐步工具调用的工具增强型智能体
机构 * Shanghai Jiao Tong University(上海交通大学) ; IQuest Research ; Beijing University of Aeronautics and Astronautics(北京航空航天大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 针对工具增强型LLM中逐步调用导致执行粒度不匹配的问题,提出HyperTool统一可执行接口,将确定性工具子流程折叠为单次调用,在多步工具任务上显著提升准确率。
从判决到过程:面向多阶段事实核查的智能体强化学习
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出ProFact框架,通过智能体强化学习端到端优化多阶段事实核查流程,引入过程感知奖励解决稀疏延迟监督问题,提升验证性能和推理效率。
从数字到物理:数字代理作为物理智能的自主教练
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) ; Zhongguancun Academy, Beijing, China(中关村学院) ; School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai, China(上海交通大学集成电路学院) ; School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院多媒体信息处理国家重点实验室)
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI
AI总结 提出EmboCoach-Bench基准,评估LLM代理自主设计具身策略的能力,通过迭代调试和优化,代理在平均成功率上超越人工基线26.5%,并具备自我修正能力。
Comments 53 pages, 12 figures
低延迟口语对话的端点预测
机构 * Brno University of Technology(布拉格技术大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 提出端点预测方法,通过提前预测对话结束信号实现低延迟,在部分上下文中投机执行LLM和TTS流水线,平均延迟降低505毫秒。
Comments Accepted at Interspeech 2026
NTS-CoT: 基于思维链推理减轻大模型新闻时间线摘要中的幻觉
机构 * Central South University(中南大学) ; Tsinghua University(清华大学) ; Nanjing University(南京大学) ; Suzhou Aerospace Information Research Institute(苏州空天信息研究院) ; McGill University(麦吉尔大学)
专题命中 推理评测 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI
AI总结 针对大模型在新闻时间线摘要中产生内容不忠实和信息遗漏两类幻觉,提出NTS-CoT框架,通过元素思维链、日期选择和因果思维链三个模块有效缓解幻觉,在三个基准上超越现有方法。
购物推理基准:面向多轮对话购物助手的专家编写基准
机构 * Amazon(亚马逊)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 提出一个由零售专家编写的525个任务的多轮对话购物推理基准,包含10863个加权评分标准,评估9个模型显示通过率仅57-77%,多轮任务性能下降4-18分。
基于多模态大语言模型的移动用户体验推理:任务、基准与方法
机构 * Ant Group(蚂蚁集团)
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI
AI总结 提出UXBench基准(2000个VQA样本)评估多模态大模型在UI推理上的能力,并设计UI-UX模型,通过奖励路由和不对称过渡奖励机制在UXBench上达到0.7963准确率,超越Claude-4.5-Sonnet。
Comments 10 pages, 6 figures, Accepted at CVPR 2026 Findings
KCSAT-ML: 用全国队列人类难度探测推理模型
机构 * NAVER Cloud AI(NAVER云AI) ; KAIST AI(韩国科学技术院人工智能系)
专题命中 推理评测 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL
AI总结 提出KCSAT-ML基准(含664道韩国高考数学题及339道带官方错误率的核心题)和难度对齐推理增益(DRG)指标,揭示视觉语言模型在人类高错误率题目上准确率崩溃、测试时缩放非单调以及同一模型族内反缩放与过度思考并存的现象。
Comments 18 pages, 14 figures, 8 tables
InnoEval:将研究思路评估视为基于知识的多视角推理问题
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出InnoEval框架,通过异构深度知识检索和多视角评审委员会,实现基于知识的多维度解耦评估,在点对点、成对和分组评估任务中优于基线方法。
Comments ICML 2026
LLM作为调查员:基于证据优先的鲁棒交互式问题诊断
机构 * University of Calabria(卡拉布里亚大学) ; University of Cambridge(剑桥大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出证据优先的AI方法LLM-as-an-Investigator,通过估计问题歧义、生成假设、提问澄清并更新概率,避免过早接受用户假设,提升诊断准确性。
构建程序性推理评估数据集:平衡自然性、基础性和多跳覆盖
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 研究基于任务-方法-知识(TMK)模型的问题生成策略对程序性和多跳推理数据集质量的影响,提出基础性验证框架,发现严格TMK生成策略在基础性和可用性上最优。
Comments 10 pages, 2 numbered figures. Workshop submission to HAIL @ AIED 2026
规范性鲁棒性作为LLM中不可验证推理的前沿
机构 * DeepMind ; Institute of Philosophy, School of Advanced Study, University of London(伦敦大学高等研究院哲学研究所) ; Technische Universität Berlin(柏林工业大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG
AI总结 提出道德推理作为不可验证推理的典型子域,定义道德鲁棒性并引入可扩展的多轮对抗评估框架,发现模型会向用户偏好偏移推理(平均6.5%),且受顺序和轮次影响。
DecompSR:用于组合多跳空间推理分解分析的数据集
机构 * The Alan Turing Institute(艾伦·图灵研究所) ; Imperial College London(帝国理工学院伦敦分校) ; The University of Leeds(利兹大学) ; City St George’s University of London(伦敦城市圣乔治大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 提出DecompSR数据集(超500万数据点),通过程序化生成独立控制组合性的多个方面(如推理深度、语言变异性),用于细粒度评估大语言模型的空间推理能力。
TrajGenAgent: 一种用于人类移动轨迹生成的分层LLM智能体
机构 * Emory University(埃默里大学) ; University of Florida(佛罗里达大学)
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 提出TrajGenAgent,一种无需微调的分层LLM智能体框架,通过编排器-工作者两阶段设计生成真实轨迹,在时空保真度、语义一致性和个体行为真实性上优于现有方法。
Comments 14 pages, 2 figures, 8 tables. Accepted by the 27th IEEE International Conference on Mobile Data Management (MDM 2026)
指令调优大语言模型解码时真实性方法的受控研究
机构 * Independent Researcher(独立研究员)
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 本研究通过分析每层令牌logits特征,提出CHAIR框架检测幻觉,在TruthfulQA和MMLU上显著提升零样本检测准确率。