$τ$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains
$τ$-Voice:在真实领域上评估全双工语音代理的基准测试
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出$τ$-voice基准测试,评估语音代理在真实复杂任务中的表现,发现语音代理在清洁条件和嘈杂环境下任务完成率仅为31-51%和26-38%,远低于文本能力,表明代理行为是失败的主要原因。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
$τ$-Voice:在真实领域上评估全双工语音代理的基准测试
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出$τ$-voice基准测试,评估语音代理在真实复杂任务中的表现,发现语音代理在清洁条件和嘈杂环境下任务完成率仅为31-51%和26-38%,远低于文本能力,表明代理行为是失败的主要原因。
GraphVLM:多模态图学习的视觉语言模型基准测试
机构 * NYU Shanghai(纽约大学上海分校) ; New York University(纽约大学) ; Rice University(休斯顿大学) ; East China Normal University(华东师范大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 GraphVLM通过三种范式评估视觉语言模型在多模态图学习中的能力,发现VLM-as-Predictor在性能上表现最佳,展示了其在多模态图学习中的潜力。
Comments CVPR 2026
音频语言模型的公平性、安全性和安全性评估
机构 * Computer Science, Taibah University, Saudi Arabia(塔布大学计算机科学系,沙特阿拉伯) ; La Sapienza, University of Rome, Rome, Italy(罗马大学拉·萨皮恩扎分校,意大利) ; CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(信息安全赫尔姆霍茨研究中心,德国萨尔布吕肯) ; University of Cagliari, Cagliari, Italy(卡利亚里大学,意大利卡利亚里)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种结构化分类方法,评估音频语言模型在公平性、安全性和安全性方面的表现,揭示音频信息整合对语义推理的影响。
AutoControl Arena:为前沿AI风险评估合成可执行测试环境
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出AutoControl Arena框架,通过逻辑-叙述解耦原理,结合可执行代码与LLM生成动态,有效缓解逻辑幻觉并提升灵活性,验证了在压力下AI风险显著增加,揭示了不同模型在安全性和对齐性上的差异。
Comments Project page: https://cosmosyi.github.io/AutoControl-Arena/; Code: https://github.com/CosmosYi/AutoControl-Arena/
Lie的解剖:一种多阶段诊断框架,用于追踪视觉-语言模型中的幻觉
机构 * National University of Singapore(新加坡国立大学) ; Monash University(墨尔本大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出一种多阶段诊断框架,通过动态认知轨迹分析视觉-语言模型中的幻觉问题,结合几何信息双重视角,实现高效且鲁棒的幻觉检测,提升模型透明度和可审计性。
通过4D逃脱房间任务评估大模型的时间意识和跨模态主动感知
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出4D逃脱房间任务,用于评估大模型在时间变化和不可逆条件下跨模态感知和时间意识的能力,发现模型在多模态整合中存在模态偏差和能力差距。
多轮物理引导的视觉-语言模型用于物理基础的异常检测
机构 * Shanghaitech University(上海科技大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出一种多轮物理引导的视觉-语言模型,通过编码物体属性和动态约束提升物理基础异常检测性能,实验显示其在视频级检测中达到96.7%的AUROC,优于现有最佳方法。
Comments Accepted by IEEE ICASSP2026
可扩展的基于文本嵌入的认知诊断用于大语言模型
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出将心理测量学中的认知诊断模型(CDM)适应于大语言模型评估,通过多维离散能力配置文件实现细粒度诊断,并利用文本嵌入信息构建先验,提高高维估计的稳定性。
Comments 34 pages of main text, 12 pages of appendix, 7 figures
GenState-AI:面向AI生成视频的基于状态的文本到视频检索数据集
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出GenState-AI数据集,通过可控状态转换和显式端状态标注,解决文本到视频检索中时间推理和端状态定位不足的问题,评估两种基线模型并分析时间与语义混淆源。
V-CORE:面向视频大语言模型的时序一致视频理解
专题命中 推理评测 :reasoning(abstract)
AI总结 V-CORE通过引入显式时序约束提升视频理解性能,采用可学习空间聚合和因果感知时间投影器,有效解决视频时序一致性问题,在多个基准测试中取得显著成果。
Comments 7 pages, 4 figures
FloodSQL-Bench: 一个用于洪水管理领域的检索增强基准
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出FloodSQL-Bench,一个结合异构数据集的地理空间基准,用于评估大语言模型在多表和地理空间推理中的性能。
面向统一模型的基于推理的视频编辑:带有自我反思学习
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出RVE任务,通过构建RVE-Bench基准,引入自反思学习框架ReViSE,提升视频编辑的准确性和视觉质量。
WAT:在线视频理解需要先观看再思考
机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(国家人类-机器混合增强智能重点实验室,人工智能与机器人研究院,西安交通大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) ; University of Science and Technology Beijing(北京科技大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 WAT提出双阶段框架,通过分阶段处理实现在线视频理解,结合查询与短期记忆进行跨时间推理,实验显示在多个基准上表现优异。
FakeScope:大型多模态专家模型用于透明的AI生成图像取证
机构 * College of Computing, City University of Hong Kong(城市大学 computing 学院) ; School of Data Science and Artificial Intelligence, Chang’an University(长安大学数据科学与人工智能学院) ; School of Computer Science and Engineering, Ministry of Education Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-Sen University(中山大学计算机科学与工程学院) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学 computing 与数据科学学院) ; Artificial Intelligence Lab. (Recod.ai) at the University of Campinas(坎皮纳斯大学人工智能实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 FakeScope通过多模态专家模型提升AI生成图像的检测能力,提供可解释的取证分析,实现高精度识别与深入解释,具备零样本检测和跨生成器泛化能力。
大语言模型能否建模错误学生推理?一种关于干扰项生成的案例研究
机构 * ETH Zürich, Switzerland(苏黎世联邦理工学院,瑞士) ; Bocconi University, Italy(博科尼大学,意大利) ; University of Central Florida, USA(中央佛罗里达大学,美国)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文研究了大语言模型在生成多项选择题干扰项时对错误推理的建模能力,发现模型通常先正确解决问题,再模拟可能的误解,最后选择干扰项,且正确解的提示能提升干扰项质量。
基于推理的自然语言解释方法用于语言模型
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出一种通过推理过程生成可信自然语言解释的方法,通过将推理过程转化为token序列并解码为自然语言,提升解释的准确性与答案质量。
Comments (v2) Added acknowledgements section
Journal ref In: Guidotti, R., Schmid, U., Longo, L. (eds) Explainable Artificial Intelligence. xAI 2025. Communications in Computer and Information Science, vol 2578. Springer, Cham
我们能相信基于忆阻器的LLMs吗?在非理想条件下探究推理能力
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL
AI总结 研究探讨了基于忆阻器的类脑计算架构对LLM推理能力的影响,发现非理想性导致推理能力下降,提出三种无训练策略并总结提升鲁棒性的指导原则。
Comments 7 figures, 3 tables
为大型语言模型进行知识蒸馏
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种高效的压缩框架,结合引导的思维链强化学习,通过知识蒸馏和链式思维提示提升模型效率,实现更小规模的模型部署。
Comments Code and data are available at: https://github.com/AlejandroParedesLT/knowledge_distillLLM
线索至关重要:利用潜在视觉线索增强视频推理
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出ClueNet框架,通过两阶段监督微调方法,解决视频推理中视觉线索提取、过滤与推理对齐问题,提升视频问答的准确性和可解释性。
Comments 18 pages, 7 figures
VideoChat-A1: 通过镜头链推理实现长视频的思考
专题命中 其他推理 :reasoning(title,abstract)
AI总结 VideoChat-A1通过镜头链推理方法,有效解决长视频理解难题,实现优于现有方法的性能,同时在效率上更具优势。
金融交易检索与上下文证据用于知识引导推理
专题命中 其他推理 :reasoning(title)
AI总结 本文提出FinTRACE框架,通过交易检索生成可重用的特征表示,结合规则检测器和行为知识库,提升低监督交易分析性能,并通过指令微调LLM实现交易分析的SOTA结果。
脱离奖励与课程数据调度的过度思考减少
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出DECS框架,通过解耦的token级奖励机制和新的课程批量调度策略,有效减少推理token数量,同时保持或提升性能,解决过度思考问题。
Comments 30 pages; Accepted as an oral presentation at ICLR 2026
监督微调与强化学习:大型语言模型后训练方法的探讨
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了监督微调与强化学习在大型语言模型后训练中的联系与应用,分析了两者的方法、数据需求及整合框架,总结了混合训练趋势及未来研究方向。
Comments 26 pages
Echo-CoPilot:一种多视角代理框架,用于可靠的超声心动图解读
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Echo-CoPilot框架,结合多视角工作流程与知识图谱引导的测量选择,通过三个独立的ReAct式代理处理超声心动图任务,提升解读准确性和可靠性。
无模态图上下文对齐
机构 * Nanyang Technological University(南洋理工大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出MF-GIA框架,通过梯度指纹捕捉领域特征,实现跨异构域的无模态few-shot预测与泛化。
Comments Accepted at ICLR 2026
大型语言模型是否会陷入霍夫斯塔德-莫比乌斯循环?
机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(数学与计算机科学学院,雅盖隆大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨现代RLHF训练语言模型中存在霍夫斯塔德-莫比乌斯循环的矛盾,通过实验发现调整系统提示的框架可显著减少压迫性输出。
Comments 15 pages, 4 figures, 3 tables
Covo-Audio技术报告
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 Covo-Audio是一款7B参数端到端LALM,通过大规模预训练和微调在多种任务中表现优异,包括语音文本建模、对话、语音理解等,并展示了其在实际对话助理中的应用潜力。
Comments Technical Report
LAMB:基于LLM的音频描述通过Cauchy-Schwarz散度弥合模态间隙
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出LAMB框架,通过Cauchy-Schwarz散度弥合音频与文本嵌入空间的模态差距,设计Two-Stream Adapter和Token Guide提升LLM解码器推理能力,在AudioCaps上取得最佳性能。
Comments 5 pages, 2 figures; Accepted to ICASSP 2026
通向对撞机物理与更广泛领域端到端架构的架构
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出首个基于语言的智能体系统,实现端到端对撞机现象学任务,通过解耦、领域无关的架构实现自主高能物理现象学研究,展示了其在粒子物理、宇宙学等领域的应用潜力。
Comments 15 pages, 3 figure, project website: AGI/ColliderAgent" target="_blank" rel="noopener">https://github.com/HET-AGI/ColliderAgent
需求驱动的上下文:通过智能体失败构建企业知识库的方法论
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出需求驱动上下文方法,通过智能体失败信号来获取企业领域知识,解决传统知识工程方法的局限性,展示在零售订单履行中的应用案例。
Comments 18 pages, 5 figures, 1 algorithm. Preprint