arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-29 至 2026-07-29 共收录 79 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 4 篇

2512.17351 2026-07-29 cs.CL 版本更新 85%

Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers

语言模型的物理:第4.1部分,架构设计与Canon层的魔力

Zeyuan Allen-Zhu

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.CL

AI总结 本研究提出Canon层,通过轻量级架构组件提升语言模型的推理深度和广度,验证了其在不同架构中的有效性,并展示了其在学术预训练中的潜力。

Comments V1.1 appeared in NeurIPS 2025 main conference; V2 adds GDN experiments, tightens others for a stronger, fairer comparison, and reorganizes sections; V3 adds Result 2.1 and Section 5.2 on how Canon layers improve hierarchical feature learning, from our Jan 2026 talk

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03773 2026-07-29 cs.CL 版本更新 83%

KletterMix: Climbing Toward High-Quality German Pretraining Data - The Full Report

KletterMix: 攀登高质量德语预训练数据

Maurice Kraus, Ruben Härle, Sebastian Sztwiertnia, Abbas Goher Khan, Mehdi Ali, Michael Fromm, Nicolas Flores-Herr, Kristian Kersting

机构 * AI & ML Group, TU Darmstadt(人工智能与机器学习小组,德累斯顿技术大学) Lab1141 Lamarr Institute(拉马尔研究所) Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) hessian.AI(海斯坦.AI) German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) Centre for Cognitive Science, TU Darmstadt(认知科学中心,德累斯顿技术大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 通过翻译高质量英语语料库构建德语预训练语料库KletterMix,并验证其在德语下游任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00417 2026-07-29 cs.LG cs.AI cs.CL cs.CV 版本更新 75%

Deep Delta Learning

深度delta学习

Yifan Zhang, Yifeng Liu, Mengdi Wang, Quanquan Gu

机构 * Princeton University(普林斯顿大学) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出深度delta学习,通过选择性重写残差内容提升语言模型性能,改进了Transformer残差流的更新机制。

Comments Project Page: https://github.com/yifanzhang-pro/deep-delta-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14366 2026-07-29 cs.AI cs.RO 版本更新 57%

Towards Embodied Cognition in Robots via Spatially Grounded Synthetic Worlds

通过空间基础合成世界实现机器人的具身认知

Joel Currie, Gioele Migno, Enrico Piacenti, Maria Elena Giannaccini, Patric Bach, Davide De Tommaso, Agnieszka Wykowska

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 提出训练视觉语言模型执行视觉视角采择的概念框架,引入合成数据集用于空间推理任务监督学习,专注推断Z轴距离,数据集公开,为具身人工智能系统空间理解奠基。

Comments Accepted to: Intelligent Autonomous Systems (IAS) 2025 as Late Breaking Report

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 7 篇

2607.21498 2026-07-29 cs.CL cs.AI 版本更新 90%

Artificial Epanorthosis: Why large language models overuse a classical rhetorical figure, and how to mitigate it

人工矫正:为什么大语言模型过度使用一种古典修辞格,以及如何缓解这一问题

Federico Boggia

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型过度使用矫正格修辞格的问题,基于模型与人类修辞风格差异及相关分类,提出用矫正格指数评分,通过测量发现校准错误,给出以LoRA适配器为中心的缓解技术、指令及适配器效果,强调校准到人类比率而非消除的重要性。

Comments 18 pages, 7 tables. v2: corrections to the classical sources (Quintilian, Cicero) and to several cited figures, and Appendix B corpus statistics aligned to the delivered dataset; measurements, results and conclusions unchanged. Data, code, and the trained LoRA adapter: https://federicoboggia.binatomy.com/pubblicazioni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22205 2026-07-29 cs.CV cs.AI 版本更新 89%

Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs

推进前填充:能力差距驱动的场景专用遥感多模态大语言模型的训练后处理

Yuheng Zong, Minghua Wang, Xin Zhao, Zhi-Hui Zhan, Antonio Plaza, Jon Atli Benediktsson

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对地球观测应用中遥感多模态大语言模型因高质量数据稀缺和能力覆盖不完整难以实现细粒度场景专业化的问题,提出能力差距驱动的推进前填充(FBA)方法,经实验验证其效果优于其他方法,提升了模型在相关基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07829 2026-07-29 cs.CL cs.AI cs.LG 版本更新 86%

Building Large-Scale English-Romanian Literary Translation Resources with Open Models

构建大规模英语-罗马尼亚文学翻译资源的开放模型

Mihai Nadas, Laura Diosan, Andreea Tomescu, Andrei Piscoran

机构 * Babeș-Bolyai University(巴克斯-波耶_ai大学) KlusAI Labs(KlusAI实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出TF2框架,通过开放模型和大规模合成语料库构建英语-罗马尼亚文学翻译资源,实现高效、低成本的高质量翻译。

Comments 21 pages. Published version: Front. Artif. Intell. 9:1807431 (2026). Datasets and models released on Hugging Face

Journal ref Front. Artif. Intell. 9:1807431 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18553 2026-07-29 cs.LG cs.AI 版本更新 81%

Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary

循环语言模型中的操作原语内省:过程质量挖掘、可执行分支和读出控制边界

Jan Kirin

专题命中 指令微调 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型能否读取计算质量及外部干预能否改善结果,通过在Ouro-RLTT中实验,利用隐藏状态等预测成功,构建相关机制,虽有可读属性但干预未提升能力,此为操作原语内省。

Comments 73 pages, 13 figures. Version 3 adds a powered and independently replicated Horizon Logic study; within-family and out-of-family recurrent-depth replication; a powered Thinking replication attempt; validated selective-prediction and all-well-formed content-selection conversions; exact-compute loop-allocation and minimal LoRA binding tests; and an expanded evaluation-integrity account

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02271 2026-07-29 cs.AI 版本更新 77%

Real-time Spatial Retrieval Augmented Generation for Urban Environments

城市环境的实时空间检索增强生成

David Nazareno Campo, Javier Conde, Álvaro Alonso, Gabriel Huecas, Joaquín Salvachúa, Pedro Reviriego

机构 * ETSI de Telecomunicación, Universidad Politécnica de Madrid(电信工程学院,马德里理工大学) FIWARE Foundation(FIWARE基金会)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 针对城市环境中基础模型更新难及传统RAG架构不适用问题,提出实时空间RAG架构,利用链接数据的时空过滤能力,借助FIWARE实现,通过马德里旅游助手用例验证了该架构能正确集成基础模型。

Journal ref ACM Transactions on Intelligent Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23541 2026-07-29 cs.CL 版本更新 70%

Med-R$^3$: Enhancing Medical Retrieval-Augmented Reasoning of LLMs via Progressive Reinforcement Learning

Med-R$^3$:通过渐进强化学习增强LLMs的医学检索增强推理

Keer Lu, Zheng Liang, Youquan Li, Jiejun Tan, Da Pan, Shusen Zhang, Guosheng Dong, Bin Cui, Yunhuai Liu, Wentao Zhang

机构 * Peking University(北京大学) Baichuan Inc.(北川科技公司)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 Med-R$^3$ 通过渐进强化学习提升医疗场景下LLMs的检索增强推理能力,实现检索与推理的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15021 2026-07-29 astro-ph.SR astro-ph.GA cs.LG 版本更新 57%

Generalization from Low- to Moderate-Resolution Spectra with Neural Networks for Stellar Parameter Estimation: A Case Study with DESI

利用神经网络从低分辨率到中等分辨率光谱进行泛化:恒星参数估计的案例研究

Xiaosheng Zhao, Yuan-Sen Ting, Rosemary F. G. Wyse, Alexander S. Szalay, Yang Huang, László Dobos, Tamás Budavári, Viska Wei

机构 * Department of Physics \& Astronomy, The Johns Hopkins University, Baltimore, MD 21218, USA Department of Astronomy, The Ohio State University, 140 West 18th Avenue, Columbus, OH 43210, USA Center for Cosmology AstroParticle Physics (CCAPP), The Ohio State University, Columbus, OH 43210, USA Department of Computer Science, The Johns Hopkins University, Baltimore, MD 21218, USA School of Astronomy Space Science, University of Chinese Academy of Sciences, Beijing 100049, People's Republic of China National Astronomical Observatories, Chinese Academy of Sciences, Beijing 100012, People's Republic of China Department of Information Systems, E\"otv\"os Lor\' University, Budapest 1117, Hungary Department of Applied Mathematics \& Statistics, Johns Hopkins University, Baltimore, MD 21218, USA

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 本研究利用神经网络从低分辨率到中等分辨率光谱进行泛化,通过预训练和微调策略提升恒星参数估计的准确性。

Comments 22 pages, 13 figures, 4 tables. Accepted for publication in ApJ. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 5 篇

2510.13434 2026-07-29 cs.CL 版本更新 87%

$M^2PO$: Multi-Perspective Multi-Pair Preference Optimization for Machine Translation

$M^2PO$:用于机器翻译的多视角多对偏好优化

Hao Wang, Linlong Xu, Heng Liu, Yangyang Liu, Xiaohu Zhao, Bo Zeng, Liangying Shao, Yichen Dong, Xinwei Wu, Jiang Zhou, Tianyu Dong, xiangxiang Zeng, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对机器翻译中主流方法受误导性奖励信号影响的问题,提出$M^2PO$框架,通过双视角机制和多对目标优化偏好,实验证明该框架能使模型性能提升,超越开源基线并接近专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03957 2026-07-29 cs.CL cs.AI 版本更新 85%

NormWorlds-CF: Solver-Verified Counterfactual Normative Reasoning with Metamorphic-Relation GRPO

NormWorlds-CF:使用变质关系GRPO进行求解器验证的反事实规范推理

Xinqi Zhang

机构 * Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);language model(abstract);post-training(abstract)

AI总结 介绍NormWorlds-CF用于可执行规则世界的反事实规范推理,其求解器能产生多种结果用于监督评估。通过实验对比不同奖励机制对任务的影响,显示验证的反事实结构可影响训练后表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07884 2026-07-29 cs.CL cs.AI 版本更新 79%

Contrastive Weak-to-strong Generalization

对比性弱到强泛化

Houcheng Jiang, Junfeng Fang, Jiaxin Wu, Tianyu Zhang, Chen Gao, Xiang Wang, Xiangnan He, Yang Deng

机构 * ustc(中国科学技术大学) nus(新加坡国立大学) zgc(中关村学院) smu(新加坡管理学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对弱到强泛化中弱模型输出噪声和偏差问题,利用隐式奖励与对比解码的联系,提出ConG框架,通过对比解码生成高质量样本,实现可靠能力转移等,经实证验证其有效性和通用性,推动了弱到强泛化及通向通用人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09733 2026-07-29 cs.CL cs.CV 版本更新 57%

VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation

VisRAG2.0:通过视觉检索增强生成中的证据引导多图像推理减轻视觉幻觉

Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun

机构 * School of Software and Microelectronics, Peking University, China(北京大学软件与微电子学院) School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

AI总结 研究针对视觉检索增强生成中VLM存在的视觉幻觉及证据识别问题,提出证据引导的多图像推理框架EVisRAG,引入RS-GRPO改进训练,实验表明该方法能提升性能、减少幻觉,有效提高视觉基础和推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31226 2026-07-29 cs.CV 版本更新 50%

ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving

ForgeDrive: 自动驾驶中统一视觉-动作生成的双向交叉条件

Xuchang Zhong, He Zheng, Chenxu Zhao, Tianxiong Lv, Hangqi Fan, Bohua Wang, Yushan Liu, Li Gao, Zhihao Liao, Leigang Luo, Congyang Zhao, Yang Cai

机构 * Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出ForgeDrive统一自回归扩散框架,通过“先动作后想象”范式实现视觉与动作的双向交叉条件,解决级联误差问题,在NAVSIM上优于现有规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 4 篇

2605.30880 2026-07-29 cs.CL cs.AI 版本更新 73%

PatchWorld: Gradient-Free Optimization of Executable World Models for Agent Environments

PatchWorld:可执行世界模型的免梯度优化

Jiaxin Bai, Yue Guo, Yifei Dong, Jiaxuan Xiong, Tianshi Zheng, Yixia Li, Tianqing Fang, Yufei Li, Yisen Gao, Haoyu Huang, Zhongwei Xie, Hong Ting Tsang, Zihao Wang, Lihui Liu, Jeff Z. Pan, Yangqiu Song

机构 * Hong Kong Baptist University(香港 Baptist 大学) Independent Researcher(独立研究员) HKUST(香港科技大学) Beijing Institute of Technology(北京理工大学) Southern University of Science and Technology(南方科技大学) Wayne State University(韦恩州立大学) University of Edinburgh(爱丁堡大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出 PatchWorld 框架,通过反例引导的代码修复将离线轨迹转化为可执行的 Python 世界模型,实现无需梯度优化的符号信念状态程序,在 AgentGym 环境中达到 76.4% 的宏观成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23929 2026-07-29 cs.AI 版本更新 57%

MemTX: Transactional Belief Commit for Stateful Agent Memory

MemTX:用于有状态智能体内存的事务性信念提交

Xiaoyang Li, Yiqi Wang, Haohui Lu, Zhi Chen, Mo Li, Pingan Song, Mingkai Zheng, Taotao Cai

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体通过共享内存协调时内存写入问题,提出事务性信念提交协议MemTX,通过携带多种信息、在事务中暂存写入等方式,经机器检查确保不变量,在多主干上领先基线且无下游危害。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22690 2026-07-29 cs.AI 版本更新 57%

LazyMem: Retrieve Broadly, Construct Selectively for Efficient Long-Term Agent Memory

LazyMem:广泛检索,按需构建以实现高效长期智能体记忆

Jing Yu, Yibo Zhao, Jiaming Zhang, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,华东师范大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体长期记忆中原始对话历史的问题,提出LazyMem方法,将记忆构建推迟到查询时,通过轻量级模型处理候选池,经特定训练方式,在基准测试中取得高准确率,减少记忆令牌数和延迟。

Comments 29 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00918 2026-07-29 cs.DC 版本更新 50%

DisDP: Disaggregating Compute, Network, and Storage for Model-Sharded Data-Parallel Training

DisDP:用于模型分片数据并行训练的计算、网络和存储解耦

Mo Sun, Zihan Yang, Changyue Liao, Yingtao Li, Jie Zhang, Kaiqi Chen, Fei Wu, Zeke Wang

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 研究针对模型分片数据并行训练中网络通信开销大问题,提出DisDP架构,通过将计算、网络和存储解耦,把集合操作卸载到智能网卡和交换机,存储卸载到增强型参数服务器,提升了GPU利用率,实验验证了该方法的高效性。

Comments Accepted by ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 16 篇

2602.10282 2026-07-29 cs.LG 版本更新 92%

Linear-LLM-SCM: Benchmarking LLMs for Coefficient Elicitation in Linear-Gaussian Causal Models

线性-LLM-SCM:用于线性高斯因果模型系数提取的LLM基准测试

Kanta Yamaoka, Sumantrak Mukherjee, Thomas Gärtner, David Antony Selby, Stefan Konigorski, Eyke Hüllermeier, Viktor Bengs, Sebastian Josef Vollmer

机构 * Data Science and its Applications, German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心数据科学与应用部门) Dept. of Computer Science, University of Kaiserslautern–Landau (RPTU)(科隆-兰道大学计算机科学系) Digital Health - Machine Learning Research Group, Hasso Plattner Institute for Digital Engineering(哈索·普朗纳研究所数字工程学院数字健康-机器学习研究组) Institute of Informatics, University of Munich (LMU)(慕尼黑大学信息学院) Hasso Plattner Institute for Digital Health at Mount Sinai, Icahn School of Medicine at Mount Sinai(西奈山医学院哈索·普朗纳研究所数字健康中心) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出线性-LLM-SCM框架,用于评估LLM在连续域中对线性高斯因果模型参数化的表现,揭示了LLM在定量因果推理中的局限性。

Comments [v2] Accepted at Workshop on Structured Data for Health@ICML 2026 Seoul,South Korea. 19 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00344 2026-07-29 cs.CL 版本更新 87%

PilotRL: Training Language Model Agents via Global Planning-Guided Progressive Reinforcement Learning

PilotRL: 通过全局规划引导的渐进式强化学习训练语言模型代理

Keer Lu, Chong Chen, Bin Cui, Yunhuai Liu, Wentao Zhang

机构 * Peking University(北京大学) Huawei Cloud BU(华为云业务部)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 PilotRL通过全局规划引导的渐进式强化学习训练语言模型代理,提升长周期决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03881 2026-07-29 cs.CY cs.AI cs.HC 版本更新 83%

LLM-generated personalized nudges for improving pro-environmental behavior: Field evidence from resource conservation

利用大型语言模型的迭代个性化增强行为提示:一项关于电力和热水节约的实地实验

Zonghan Li, Yi Liu, Chunyan Wang, Song Tong, Kaiping Peng, Feng Ji

机构 * School of Environment, Tsinghua University(清华大学环境学院) Department of Applied Psychology and Human Development, University of Toronto(多伦多大学应用心理学与人类发展系) State Key Laboratory of Regional Environment and Sustainability, Tsinghua University(清华大学区域环境与可持续性国家重点实验室) Department of Psychology, Beijing Normal University at Zhuhai(北京师范大学珠海校区心理学系) Department of Psychology and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本研究利用大型语言模型实现迭代个性化,通过实地实验发现其在促进节能方面效果显著,且在前两轮干预中表现更优,但热水节约效果较弱且随时间减弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01862 2026-07-29 cs.MA cs.AI cs.NI 版本更新 77%

RadioMaster: Multi-Agent System for Autonomous Radio Signal Generation

RadioMaster: 自主无线电信号生成的多智能体系统

Jiazhen Lei, Yuxin Sha, Tianze Cao, Sihan Wang, Bingbing Wang, Zeming Yang, Fengyuan Zhu, Xiaohua Tian

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RadioMaster,一个全自主的多智能体框架,通过RadioWiki、RadioAgent和RadioEmulator三大支柱,将用户意图转化为真实无线信号,解决现有模型因领域知识和硬件约束敏感性不足而无法生成无线电信号的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16780 2026-07-29 cs.IR cs.AI cs.HC 版本更新 77%

Comparing RAG and GraphRAG for Page-Level Retrieval Question Answering on a Math Textbook

比较RAG和GraphRAG在数学教科书页面级检索问答中的应用

Eason Chen, Chuangji Li, Eric Li, Zimo Xiao, Jionghao Lin, Kenneth R. Koedinger

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究在本科数学教科书页面级问答中比较RAG和GraphRAG,用477个问答对数据集在检索准确率和答案质量两指标上对比五个RAG模型、BM25基线及GraphRAG,发现基于嵌入的RAG更优,还通过开源模型复制实验,为AI辅导系统设计提供参考。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03595 2026-07-29 cs.AI cs.CL 版本更新 76%

Controllable LLM Reasoning via Sparse Autoencoder-Based Steering

通过稀疏自编码器基于的转向实现可控的大语言模型推理

Yi Fang, Wenjie Wang, Mingfeng Xue, Boyi Deng, Fengli Xu, Dayiheng Liu, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.CL、cs.AI

AI总结 本文提出SAE-Steering方法,通过稀疏自编码器分解隐藏状态,实现对大语言模型推理策略的高效控制,提升推理准确率和灵活性。

Comments Accepted to the ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07395 2026-07-29 cs.CV cs.AI cs.LG 版本更新 73%

When Prompts Ignore Structure: Graph-Based Attribute Reasoning for Calibrated VLMs

当提示忽略结构时:基于图的属性推理用于校准视觉语言模型

Tanay Sodha, Aditya Sharma, Ramya Hebbalaguppe, Vinti Agarwal, Pranav Murthy Yeluripaty

机构 * Birla Institute of Technology and Science, Pilani(贝拉科技与科学学院皮拉尼分校) TCS Research(塔塔咨询服务公司研究院)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型测试时自适应中可靠置信度估计问题,提出ARGTCA方法,将(类,属性)对表示为符号属性图节点,用对比目标训练图注意力网络,引入两种属性选择策略,实验证明该方法能有效降低校准误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13454 2026-07-29 cs.CV cs.AI 版本更新 70%

GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding

GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解

Hao Li, Han Fang, Zixin Pan, Xin Wei, Hongbo Sun, Jinglin Xu, Zhiyu Lin, Ye Yuan, Zhongjiang He, Yu Yu, Hao Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对从2D图像理解3D空间关系的挑战,提出GeoAnchor框架,通过分解3D空间信息为互补组件并结合协作训练策略,实现动态可解释推理,在复杂3D推理任务中优于现有技术。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15753 2026-07-29 cs.AI 版本更新 70%

RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought

RoboPIN: 基于锚定思维链的具身推理

Yaoting Huang, Yifu Yuan, Linqi Han, Chengwen Li, Shuoheng Zhang, Xianze Yao, Hongyao Tang, Yan Zheng, Jianye Hao

机构 * Tianjin University(天津大学)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出Pinned Chain-of-Thought (PinCoT)推理范式,通过结构化视觉锚点绑定实体,解决多步推理中实体引用漂移和视觉解耦问题;训练4B参数模型在14个基准上平均超越最强7B基线12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15050 2026-07-29 cs.CL 版本更新 70%

Beyond Factual Accuracy: Evaluating Global Reasoning Integrity in RAG Systems with LogicScore

超越事实准确性:使用逻辑得分评估RAG系统中的全球推理完整性

Zhichao Yan, Yunxiao Zhao, Jiapu Wang, Jiaoyan Chen, Xiaoli Li, Ru Li, Jeff Z. Pan

机构 * Shanxi University(山西大学) Nanjing University of Science and Technology(南京理工大学) University of Manchester(曼彻斯特大学) Singapore University of Technology and Design(新加坡科技设计大学) University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出LogicScore,通过全局推理审查弥补RAG系统在长文本生成中逻辑完整性不足的问题,揭示模型在事实准确性高但全局推理质量差的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏