ALARM: Audio-Language Alignment for Reasoning Models
ALARM:用于推理模型的音频-语言对齐
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 ALARM通过自我改写和多编码器融合,提升推理模型的音频理解能力,实现更高效的音频推理性能。
Comments Submitted to Interspeech2026
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
ALARM:用于推理模型的音频-语言对齐
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 ALARM通过自我改写和多编码器融合,提升推理模型的音频理解能力,实现更高效的音频推理性能。
Comments Submitted to Interspeech2026
探测驾驶视觉语言模型的可靠性:从不一致响应到基于现实的时序推理
机构 * DFKI Augmented Vision(DFKI增强视觉实验室) ; TU Delft(代尔夫特理工大学)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 本文研究了驾驶视觉语言模型的可靠性问题,通过引入FutureVQA数据集和自监督微调方法,提升模型在时序推理和一致性上的表现。
逐步引导策略优化:在GRPO中着色你的错误推理
机构 * Department of Industrial Engineering and Operations Research(工业工程与运营管理系) ; Department of Mathematics(数学系) ; Columbia University(哥伦比亚大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Stern School of Business, New York University(纽约大学斯特恩商学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SGPO通过引入组内响应多样性,解决GRPO在所有负样本组时无法更新策略的问题,提升推理模型性能。
Comments Accepted by TMLR; 47 pages
SATURN: 基于求解的强化学习以释放大语言模型的推理能力
机构 * Peking University(北京大学) ; Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 Saturn通过基于SAT问题的强化学习框架,提升大语言模型的推理能力,实现可扩展的任务构建、规则验证和难度控制,取得显著效果。
Comments Camera-ready version for Neural Information Processing Systems (NeurIPS) 2025, Spotlight Paper
Social-R1: 向大语言模型中引入人类般的社交推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 Social-R1通过多维奖励对齐模型推理与人类认知,利用ToMBench-Hard提供困难训练案例,使大模型在社交推理任务中实现超越和稳健泛化。
Comments 27 pages. Code and dataset will be released upon acceptance
MORE-R1: 通过强化学习引导大视觉-语言模型进行多模态对象-实体关系提取的分步推理
专题命中 推理评测 :reasoning(title,abstract)
AI总结 MORE-R1通过强化学习引导大视觉-语言模型进行多模态对象-实体关系提取,提升推理能力与模型性能。
Comments Accepted by the 31st International Conference on Database Systems for Advanced Applications. This is the Accepted Manuscript (AM) version
常识与道德:LLMs中叙述焦点偏见的奇特案例
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了LLMs在道德困境中优先道德推理而非常识理解的偏见,提出CoMoral数据集并揭示了模型在识别常识矛盾时的叙述焦点偏见问题。
Comments Accepted at LREC 2026
PostTrainBench: 大型语言模型代理能否自动化大型语言模型的后训练?
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 PostTrainBench研究LLM代理在受限制计算条件下自主进行后训练的能力,发现其在某些场景下可超越指令调优模型,但也存在奖励黑客等风险。
OPENXRD:一个全面的基准框架用于LLM/MLLM XRD问答
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 OPENXRD是一个用于评估LLM和MLLM在晶体学问答中性能的综合基准框架,通过专家审核材料验证内容质量对模型性能的关键影响。
Comments Accepted at Digital Discovery (Royal Society of Chemistry)
VoxEmo:基于语音大语言模型的语音情感识别基准测试
机构 * Department of Computer Science, University of Sheffield, United Kingdom(英国谢菲尔德大学计算机科学系) ; Signal Analysis and Interpretation Laboratory (SAIL), Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California, Los Angeles, CA 90089, USA(美国南加州大学电气与计算机工程系信号分析与解释实验室(SAIL))
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 VoxEmo是一个基于语音大语言模型的语音情感识别基准测试,通过提供多样化的提示复杂度和分布感知的软标签协议,评估模型在真实世界中的情感识别能力。
Comments submitted to Interspeech 2026
自主边缘部署AI代理用于电动汽车充电基础设施管理
机构 * Hyperion Consulting(超离子咨询)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Auralink SDC架构,通过边缘部署的专用AI代理实现电动汽车充电基础设施的自主管理,实现高准确率的事故修复与快速响应。
Comments 27 pages, 10 figures (TikZ), 27 tables
One-Eval: 一个用于自动化和可追溯的LLM评估代理系统
机构 * Peking University(北京大学) ; Beijing Institute of Technology(北京理工大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Zhongguancun Academy(中关村学院)
专题命中 推理评测 :planning(abstract);分类 cs.CL
AI总结 One-Eval通过自动化和可追溯的评估流程,提升大语言模型评估的效率和可重复性。
OOD-MMSafe: 推进多模态大语言模型安全性从有害意图到隐藏后果
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 OOD-MMSafe通过CASPO框架提升多模态大语言模型对隐藏后果的识别能力,显著降低风险识别失败率。
Comments 30 pages
AI行为评估基准:为NLP和RAG系统设计的开放、透明且可复现的评估数据集
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出了一种开放透明的数据集,用于评估NLP和RAG系统在欧盟AI法案下的合规性,通过生成风险等级分类等任务提升评估效率。
Comments 10 pages, 1 figure, 4 tables, 2 equations
基于分解世界状态的奖励预测
机构 * East China Normal University(华东师范大学) ; HKUST(香港科技大学)
专题命中 推理评测 :planning(abstract);分类 cs.CL
AI总结 本文提出StateFactory方法,通过分解世界状态实现跨领域的准确奖励预测,提升智能体规划性能。
TA-Mem: 用于LLM长期对话问答的工具增强自主记忆检索
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 TA-Mem通过引入工具增强的自主记忆检索框架,解决了LLM在长距离推理任务中的记忆存储问题,提升了长期对话问答的性能。
利用视觉语言基础模型通过上下文学习生成植物模拟配置
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文利用视觉语言基础模型通过上下文学习生成植物模拟配置,解决高复杂度和低吞吐量的问题,提供可扩展的农业数字孪生框架。
LDP:一种面向多智能体LLM系统的身份感知协议
机构 * Indian School of Business(印度管理学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 LDP是一种面向多智能体LLM系统的身份感知协议,通过五种机制提升委托效率与可控性。
Comments 16 pages, 9 figures, 8 tables, 4 appendices
小型语言模型用于高效的代理工具调用:通过针对性微调超越大模型
专题命中 推理评测 :CoT(abstract);分类 cs.AI
AI总结 本文通过针对性微调小型语言模型,在工具调用任务中超越大模型,展示了SLMs在成本优化和效率提升方面的潜力。
Comments Accepted at AAAI 2026 Workshop on Agentic AI Benchmarks and Applications for Enterprise Tasks
迈向赛场:评估体育中的空间智能
专题命中 推理评测 :reasoning(abstract)
AI总结 CourtSI通过大规模体育场景数据集评估VLMs的空间智能,发现现有基准存在局限,并验证了模型在体育场景中的提升效果。
EmoSURA:迈向精确评估详细且长上下文情感语音字幕
机构 * CHI – Chair of Health Informatics, TUM University Hospital, Munich, Germany(慕尼黑大学医院健康信息学系) ; MCML - Munich Center for Machine Learning, Munich, Germany(慕尼黑机器学习中心) ; Huawei, Netherlands(荷兰华为) ; GLAM, Imperial College London, UK(伦敦帝国理工学院GLAM研究中心)
专题命中 推理评测 :reasoning(abstract)
AI总结 EmoSURA通过原子验证机制和SURABench基准,提供更可靠的长上下文情感语音字幕评估方法
Comments Submitted to Interspeech 2026
OmniEarth:一个评估遥感任务中视觉-语言模型的基准
机构 * Jilin University(吉林大学) ; Chang Guang Satellite Technology(长光卫星技术)
专题命中 推理评测 :reasoning(abstract)
AI总结 OmniEarth是一个评估遥感任务中视觉-语言模型性能的基准,通过多维任务和严格测试协议,揭示现有模型在复杂地理任务中的不足。
以资产为中心的度量-语义地图:室内环境
机构 * Department of Electrical & Systems Engineering and General Robotics, Automation, Sensing and Perception (GRASP) Laboratory at the University of Pennsylvania(宾夕法尼亚大学电气与系统工程系及通用机器人、自动化、传感与感知(GRASP)实验室) ; DEVCOM Army Research Laboratory(陆军研究实验室)
专题命中 推理评测 :planning(abstract)
AI总结 本文提出了一种以资产为中心的度量-语义地图方法,利用四足机器人和RGB-D数据构建室内环境的高精度表示,结合自然语言和网格信息,提升机器人场景理解和导航能力。
Comments 9 pages, 8 figures, 3 tables
FormalRTL: 在大规模上实现验证的RTL综合
专题命中 推理评测 :planning(abstract)
AI总结 FormalRTL通过整合软件参考模型,实现了大规模、验证的RTL综合,解决了工业级硬件设计中的规范模糊和正确性保证问题。