arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-24 至 2026-06-24 共收录 297 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 19 篇

2604.17473 2026-06-24 cs.CV cs.AI 版本更新 70%

Dual-Anchoring: Addressing State Drift in Vision-Language Navigation

双锚定:解决视觉语言导航中的状态漂移问题

Kangyi Wu, Pengna Li, Kailin Lyu, Xi Lin, Lin Zhao, Qingrong He, Jinjun Wang, Jianyi Liu

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Johns Hopkins University(约翰霍普金斯大学) Joy Future Academy, JD(京东探索研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出双锚定框架,通过指令进度锚定和记忆地标锚定分别解决进度漂移和记忆漂移,显著提升长场景导航成功率。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20892 2026-06-24 cs.AI 版本更新 70%

Representation Interventions Enable Lifelong Knowledge Memory Control in LLMs

表示干预使大语言模型在终身学习中实现知识记忆控制

Xuyuan Liu, Shengyu Chen, Xinshuai Dong, Yanchi Liu, Xujiang Zhao, Haoyu Wang, Yujun Yan, Haifeng Chen, Zhengzhang Chen

机构 * Dartmouth College(达特茅斯学院) NEC Laboratories America(NEC美国实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出RILKE方法,通过在模型表示空间中进行干预,实现大语言模型的终身知识控制,有效更新知识并保持通用性。

Comments In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics: ACL 2026, Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13645 2026-06-24 cs.LG 版本更新 70%

FuseSampleAgg: One-Pass Neighborhood Estimation for Budgeted Knowledge-Graph Refresh and Validation

FuseSampleAgg: 预算知识图谱刷新与验证的单遍邻域估计

Aleksandar Stanković, Haoran Du, Xinming Wang

机构 * University of Novi Sad(诺维萨德大学) Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Institute of Automation(自动化研究所) Chinese Academy of Sciences(中国科学院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出一种融合的PyTorch CUDA算子,通过单遍采样和聚合实现邻域均值估计,避免显式子图构建,在保持GraphSAGE-mean语义的同时,将端到端步延迟提升2.24-3.48倍,瞬态内存降低至1/160。

Comments 11 pages. Code and reproducibility scripts: https://github.com/SV25-22/FuseSampleAgg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24040 2026-06-24 cs.CL cs.AI cs.SC 新提交 62%

Towards Version-aware Operations and Transaction Memories for Multi-layer MeMo

面向多层MeMo的版本感知操作与事务记忆

Peiran Li

机构 * Freie Universität Berlin(柏林自由大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出版本感知操作层,将替换、回滚等高级操作编译为MeMo原生原语调用,通过版本CMM和事务CMM支持知识更新,减少重训练需求。

Comments Accepted by MeMo Workshop on Mechanistic Interpretability & Neuro-symbolic Approaches by-design, Rome (Italy), 24/6/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21321 2026-06-24 cs.LG cs.AR math.OC 版本更新 57%

Dynamic Symmetric Point Tracking: Tackling Non-ideal Reference in Analog In-memory Training

动态对称点跟踪:解决模拟内存训练中的非理想参考问题

Quan Xiao, Jindan Li, Zhaoxian Wu, Tayfun Gokmen, Tianyi Chen

机构 * Department of Electrical and Computer Engineering, Cornell University, New York, NY(康奈尔大学电气与计算机工程系) IBM T. J. Watson Research Center, Yorktown Heights, NY(IBM 沃森研究中心) Rensselaer Polytechnic Institute, Troy, NY(伦塞拉尔理工学院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 针对模拟内存计算中非理想器件导致的权重更新偏向对称点问题,提出动态对称点估计方法,在训练中跟踪对称点并保证收敛,结合数字信号处理技术增强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04560 2026-06-24 cs.RO 版本更新 50%

From Local Corrections to Generalized Skills: Improving Neuro-Symbolic Policies with MEMO

从局部修正到通用技能:利用MEMO改进神经符号策略

Benjamin A. Christie, Yinlong Dai, Mohammad Bararjanianbahnamiri, Simon Stepputtis, Dylan P. Losey

机构 * Collab Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, USA.(机械工程系,弗吉尼亚理工学院,黑斯堡,美国) TEA Lab(TEA实验室)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 针对机器人神经符号策略中技能不足的问题,提出MEMO框架,通过收集、聚类和改写多用户自然语言修正,构建检索增强的技能手册,动态扩展技能库,实现新任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 49 篇

2606.24391 2026-06-24 cs.AI cs.CL cs.GT cs.MA 新提交 93%

Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War

LLM时代:战争迷雾下大型语言模型的推理、外交与可靠性的战略1v1基准测试

Arnaud Ricci

机构 * Independent researcher, Switzerland(瑞士独立研究员)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 提出Age of LLM基准,在13x7网格上让两个LLM进行1v1对战,包含战争迷雾、完全外交和严格JSON格式可靠性维度,通过54场比赛评估15个推理模型,发现核冲刺主导、外交频繁但极少达成、非法动作反映信念追踪,并初步关联可靠性与获胜。

Comments 25 pages including appendices, 8 figures, 4 tables; appendices include verbatim system prompt and engine resolution pseudocode. All correlations reported with p-values, 95% bootstrap confidence intervals and Spearman's rho; includes a Steiger test and Bradley-Terry fit

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21543 2026-06-24 cs.RO 版本更新 91%

Self-CriTeach: LLM Self-Teaching and Self-Critiquing for Improving Robotic Planning via Automated Domain Generation

Self-CriTeach: LLM 自我教学与自我批评用于通过自动领域生成提升机器人规划

Jinbang Huang, Zhiyuan Li, Yuanzhao Hu, Zhanguang Zhang, Mark Coates, Xingyue Quan, Yingxue Zhang

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Self-CriTeach框架,通过LLM自动生成符号规划领域,用于自我教学生成规划问题-计划对及自我批评生成结构化奖励信号,提升机器人规划性能与泛化能力。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13189 2026-06-24 cs.CL 新提交 91%

SICI: A Semantic-Pragmatic Complexity Index Reveals Regime Shifts in LLM Stance Detection

SICI:一种揭示LLM立场检测中相变的语义-语用复杂度指数

Fuqiang Niu, Bowen Zhang

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院)

专题命中 推理与问题求解 :LLM(title,title_cn);prompting(abstract);分类 cs.CL

AI总结 提出SICI指数,从七维语义-语用复杂度诊断立场检测难度,揭示LLM错误随复杂度增加从过度归因到集中弃权的相变规律,且干预方法仅沿归因-弃权轴移动而非消除瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24510 2026-06-24 cs.AI cs.CL 新提交 90%

A specialized reasoning large language model for accelerating rare disease diagnosis: a randomized AI physician assistance trial

一种用于加速罕见病诊断的专用推理大语言模型:随机AI辅助医生试验

Haichao Chen, Songchi Zhou, Zhengyun Zhao, Shikai Hu, Xianghong Jin, Hongwei Ji, Li He, Shuli Li, Yiming Qin, Xin Tan, Runfeng Shi, Yih Chung Tham, Jiaye Zhu, Ye Li, Ye Jin, Longhao Cao, Dawei Li, Honghan Wu, Hongqiu Gu, Guanqiao Li, Tudor Groza, Chunying Li, Dian Zeng, Weihong Yu, Gareth Baynam, Saumya Shekhar Jamuar, Min Shen, Shuyang Zhang, Bin Sheng, Sheng Yu, Tien Yin Wong

机构 * Tsinghua Medicine, Tsinghua University(清华大学医学部,清华大学) Department of Ophthalmology, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院眼科,中国医学科学院 & 北京大学医学部) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) Department of Rheumatology and Clinical Immunology, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院风湿免疫科,中国医学科学院 & 北京大学医学部) Department of Rare Diseases, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院罕见病科,中国医学科学院 & 北京大学医学部) Department of Dermatology, Xijing Hospital, Air Force Medical University(西安空军军医大学西京医院皮肤科) School of Computer Science and Technology, East China Normal University (ECNU)(东华大学计算机科学与技术学院) Department of Neurosurgery, Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院神经外科) Department of Ophthalmology, National University of Singapore(新加坡国立大学眼科) Singapore Eye Research Institute, Singapore National Eye Centre(新加坡眼科学研究所,新加坡国家眼科中心) Ophthalmology and Visual Science Academic Clinical Program, Duke-NUS Medical School(杜克-国立新加坡大学医学学校眼科与视觉科学学术临床项目) Department of Pediatrics, The First Hospital of Tsinghua University(清华大学第一医院儿科) College of Future Technology, Peking University(北京大学未来技术学院) School of Health and Wellbeing, University of Glasgow(格拉斯哥大学健康与福祉学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 提出开源推理大模型RaDaR(32B参数),通过增强推理训练和合成数据,在罕见病诊断中超越DeepSeek-R1等模型,随机试验显示其辅助使医生诊断准确率提升21.44个百分点。

Comments 36 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11790 2026-06-24 cs.CL cs.AI 版本更新 90%

Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions

使用未见过的随机变量问题对LLM的数学推理进行基准测试

Zijin Hong, Hao Wu, Su Dong, Junnan Dong, Yilin Xiao, Yujing Zhang, Zhu Wang, Feiran Huang, Linyi Li, Hongxia Yang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Tencent Youtu Lab(腾讯优图实验室) Beihang University(北京航空航天大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有数学基准的可靠性问题,提出RV-Bench方法,通过生成随机变量问题评估LLM的真实推理能力,发现模型在已见和未见数据分布上的能力不平衡,且推理泛化有限但可通过测试时扩展提升。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24094 2026-06-24 cs.CV 新提交 89%

Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent

通用指南驱动图像聚类:基于混合LLM代理

Wenliang Zhong, Rob Barton, Lucas Goncalves, Kushal Kumar, Feng Jiang, Hehuan Ma, Yuzhi Guo, Vidit Bansal, Karim Bouyarmane, Junzhou Huang

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校) Amazon(亚马逊)

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出首个通用图像聚类框架,通过文本指南弥合任务差异,利用生成式概念代理建模和基于最小生成树的LLM遍历,在多种聚类场景中超越专用方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22337 2026-06-24 econ.TH cs.GT econ.GN q-fin.EC 新提交 89%

Theorist Toolbox: Tools for Agent Based LLM-assisted economic theory Research

理论家工具箱:基于智能体的LLM辅助经济理论研究工具

Moran Koren

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种验证优先的经济理论LLM辅助协议,通过三种可重用方法(单次检查、对抗性证明-验证对、多智能体项目)在等级膨胀的Gans-Kominers特征模型上设计Groves/Pigouvian激励机制的实例验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23717 2026-06-24 eess.IV 新提交 88%

SpaCE: Rethinking Spatial Capacity and Generalization in Multi-Frame Multimodal Large Language Models

SpaCE: 重新思考多帧多模态大语言模型中的空间容量与泛化能力

Mariana Costa, Camila Ferreira, Alberlucia Rafael Soarez, Alejandro Torres

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 提出SpaCE理论框架,证明多帧空间推理的信息论上界、样本复杂度界、PAC-Bayes泛化界,并刻画显式3D表示与隐式推理的偏差-方差权衡,在多个基准上验证了理论紧致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24420 2026-06-24 cs.CL 新提交 87%

Beyond Logprobs: A Multi-Signal Confidence Engine for LLM-Based Document Field Extraction

超越Logprobs:基于LLM的文档字段提取的多信号置信度引擎

Nitesh Kumar

机构 * Perfios Software Solutions Pvt. Ltd.(Perfios软件解决方案私人有限公司)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出ExtractConf,通过双视角文档解析(字段引导与文档引导)的不一致性,融合多信号实现高可靠置信度估计,在DocILE上AUC达0.928,准确率99.1%。

Comments Extended version of a paper accepted (Oral) at the RobustifAI Workshop, IJCAI-ECAI 2026, Bremen, Germany. 9 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21228 2026-06-24 cs.LG 新提交 86%

Sakana Fugu Technical Report

Sakana Fugu 技术报告

Yujin Tang, Edoardo Cetin, Jinglue Xu, Qi Sun, Stefan Nielsen, Vincent Richard, Haruto Goda, Iaroslav Tymchenko, Nhan Nguyen, Hyunin Lee, Mari Ashiga, Shashank Kotyan, So Kuroki, Tarin Clanuwat

机构 * Sakana AI

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Fugu系列协调模型,通过动态代理框架组合多个LLM专长,在多项基准上达到最优性能,并描述其训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17070 2026-06-24 cs.RO cs.AI 版本更新 86%

MuTRAP: Multi-trigger Trojans Attacking Robot Task Planning Systems

MuTRAP: 攻击机器人任务规划系统的多触发器木马

Mohaiminul Al Nahian, Zainab Altaweel, David Reitano, Sabbir Ahmed, Shiqi Zhang, Adnan Siraj Rakin

机构 * Binghamton University (SUNY)(宾夕法尼亚州立大学布林顿分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出首个针对LLM辅助机器人任务规划器的多触发器木马攻击MuTRAP,通过少量任务特定参数注入后门,并优化触发器词以激活特定恶意行为,揭示当前基于LLM的规划器的安全漏洞。

Comments Accepted for publication at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16845 2026-06-24 cs.CL cs.AI 新提交 85%

Robust Dual-Signal Fusion: Hybrid Neuro-Symbolic Gating with Compressed Chain-of-Thought Refinement for Irony Detection in Social Media Texts

鲁棒双信号融合:混合神经符号门控与压缩链式思维精炼用于社交媒体文本讽刺检测

Ankit Bhattacharjee, Krityapriya Bhaumik

机构 * Indian Institute of Technology Kharagpur(印度理工学院克勒格布尔分校)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出RDS融合框架,结合神经符号架构与压缩链式思维推理,在TweetEval和iSarcasm数据集上达到与微调BERTweet相当的性能,并显著优于监督方法。

Comments 11 pages total, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24414 2026-06-24 cs.AI 新提交 84%

Cycle-Consistent Neural Explanation of Formal Verification Certificates

形式验证证书的循环一致性神经解释

Andoni Rodriguez, Alberto Pozanco, Daniel Borrajo

机构 * J.P. Morgan AI Research(摩根大通人工智能研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 提出循环一致性神经架构,通过前向和逆向网络结合符号验证器,生成忠实于形式验证证书的自然语言解释,在金融合规领域测试中达到90.0%的循环验证正确性,比多LLM基线高13.9个百分点。

Comments 15 pages of main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24124 2026-06-24 cs.AI 新提交 84%

VeryTrace: Verifying Reasoning Traces through Compilable Formalism and Structured Verification

VeryTrace: 通过可编译形式化与结构化验证验证推理轨迹

Ninghan Zhong, Ahmet Ege Tanriverdi, Kaan Kale, Sriram Vishwanath

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology, USA(佐治亚理工学院电子与计算机工程学院) Department of Electrical and Computer Engineering, Bogazici University, Turkey(博亚奇大学电子与计算机工程系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 提出VeryTrace框架,将自然语言推理轨迹形式化为可编译的领域特定语言(DSL),结合确定性检查与LLM审计进行混合验证,实现步骤级错误定位与修复,在数学、机器人规划、亲属推理任务上提升准确率。

Comments Accepted at LM4Plan Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07774 2026-06-24 cs.IR cs.AI 版本更新 84%

GR2: Generative Reasoning Re-ranker

生成式推理重排序器

Mingfu Liang, Yufei Li, Jay Xu, Kavosh Asadi, Xi Liu, Shuo Gu, Kaushik Rangadurai, Frank Shyu, Shuaiwen Wang, Song Yang, Zhijing Li, Jiang Liu, Mengying Sun, Fei Tian, Xiaohan Wei, Chonglin Sun, Jacob Tao, Shike Mei, Wenlin Chen, Santanu Kolay, Sandeep Pandey, Hamed Firooz, Luke Simon

机构 * Meta AI

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出GR2框架,利用大语言模型的推理能力进行推荐重排序,通过语义ID编码、推理轨迹监督微调和强化学习优化,在Recall@5和NDCG@5上超越现有方法。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20510 2026-06-24 cs.AI 版本更新 83%

Grounded Chess Reasoning in Language Models via Master Distillation

通过大师蒸馏实现语言模型中的接地国际象棋推理

Zhenwei Tang, Qianfeng Wen, Seth Grief-Albert, Yahya Elgabra, Blair Yang, Honghua Dong, Ashton Anderson

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Queen’s University(皇后大学) Coolwei AI Lab(Coolwei人工智能实验室)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出大师蒸馏框架,将专家系统推理过程蒸馏为自然语言思维链,使4B参数模型C1在国际象棋中达到48.1%准确率,超越所有开源模型和多数前沿闭源系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23991 2026-06-24 cs.AI cs.LG cs.MA cs.RO 新提交 82%

Critique of Agent Model

智能体模型批判

Eric Xing, Mingkai Deng, Jinyu Hou

机构 * Institute of Foundation Models, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学基础模型研究所) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文区分了自动化与智能体,提出真正智能体需内化目标、身份、决策、自我调节和学习等结构,并设计了GIC通用智能体架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23695 2026-06-24 cs.CL cs.AI 新提交 82%

Quantifying Prior Dominance in RAG Systems

量化RAG系统中的先验主导性

Barak Or

机构 * ArtificialGate Ltd.(ArtificialGate有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);small language model(abstract);SLM(abstract_cn)

AI总结 提出归一化上下文利用(NCU)指标,通过连续token对数概率严格量化RAG系统的上下文信息增益,发现小语言模型在严格事实提取中匹配或超越大模型,且先验主导性与模型规模及专有对齐相关。

Comments 15 pages, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24082 2026-06-24 eess.AS cs.SD 新提交 82%

Comparative Reasoning: Making an Audio Language Model Better at Comparing Emotions

比较推理:让音频语言模型更擅长比较情感

Abinay Reddy Naini, Jaeyeon Kim, Chao-Han Huck Yang, Shinji Watanabe, Carlos Busso

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) The University of Texas at Dallas(德克萨斯大学达拉斯分校) NVIDIA(英伟达)

专题命中 推理与问题求解 :language model(title,abstract);preference optimization(abstract)

AI总结 提出一种推理引导的序数情感识别框架,通过配对语音输入和推理轨迹训练音频语言模型,实现可解释的比较情感判断,仅需传统方法5%的训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18375 2026-06-24 cs.RO 新提交 82%

PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation

PAIWorld: 用于机器人操作的三维一致世界基础模型

Yuhang Huang, Xuan Lv, Junyan Xu, Zhiyuan Yu, Jiazhao Zhang, Ruizhen Hu, Wancheng Feng, Shilong Zou, Hewen Xiao, Ziqiao Zhou, Kaiyun Huang, Zhiyu Peng, Juzhan Xu, Hang Zhao, Chenyang Zhu, Renjiao Yi, Yifei Huang, Douhui Wu, Yan Zhang, Kexu Cheng, Chunhe Song, Yunzhi Xue, Xiuhong Zhang, Leitao Guo, Yunji Chen, Bin Wu, Haibin Yu, Kai Xu

机构 * Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院)

专题命中 推理与问题求解 :foundation model(title,abstract);post-training(abstract)

AI总结 提出PAIWorld框架,通过几何感知交叉注意力、几何旋转位置编码和潜在3D-REPA蒸馏,解决多视图世界模型的3D不一致问题,在机器人操作基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24281 2026-06-24 cs.CL cs.AI 新提交 81%

CALIBER: Calibrating Confidence Before and After Reasoning in Language Models

CALIBER: 在语言模型推理前后校准置信度

Conor Finlay, Joshua Kurien, Saurabh Dash, Marzieh Fadaee, Beyza Ermis

机构 * Cohere Labs(Cohere 实验室)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出CALIBER方法,在推理前和推理后分别估计置信度,并匹配相应的监督目标,显著降低期望校准误差(ECE)并提升校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24694 2026-06-24 cs.HC 新提交 80%

SupplyNet: Supporting Visual Exploratory Learning in Supply Chain via Contextual Multi-Agent Simulation

SupplyNet: 通过上下文多智能体模拟支持供应链中的视觉探索式学习

Yanjia Li, Kelcy Kexin Han, Tianrui Hu, Yi-Fan Cao, Huamin Qu, Sicheng Song

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出SupplyNet,一种基于上下文图的多智能体LLM框架的视觉模拟系统,通过交互式网络视图、分支时间线和任务分析控制台,支持供应链中的反事实探索、因果追踪和比较推理,提升用户参与度和理解。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24443 2026-06-24 cs.LO cs.PL 新提交 80%

Verifiable Auto-Formalization of Mathematics Using a Relaxed Natural Formal Language

使用宽松自然形式语言的可验证数学自动形式化

Zhicheng Hui, Lihan Xie, Xingzhi Qi, Zhehao Li, Yingjun Lan, Qinxiang Cao

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出一种宽松自然形式语言作为中间目标,通过分阶段精化实现可验证的数学自动形式化,结合规则转换与LLM启发式方法,并利用领域特定策略语言生成验证条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23754 2026-06-24 cs.RO cs.LG 新提交 79%

Verifiable Foundation Models for Robot Safety

机器人安全的可验证基础模型

Davide Corsi, Kyungmin Kim, Roy Fox

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.LG

AI总结 提出FEARL框架,将策略分解为大控制器和小安全模块,使形式化验证仅应用于安全模块,从而在保持控制器表达能力的同时实现可验证的机器人安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏