arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-16 至 2026-06-16 共收录 644 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 27 篇

2606.14805 2026-06-16 cs.SE cs.AI 新提交 90%

Knowledge-Based Zero-Replay Debugging of Multi-Agent LLM Traces

基于知识的无重放多智能体LLM轨迹调试

Dong Ho Kang, Hyeonjeong Cha, Daein Weon

机构 * ustechlab.com(ustechlab)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种知识图谱驱动的无重放预测方法,通过结构化事件知识图谱和轻量级预测器,在不执行重放的情况下定位高影响事件,将轨迹定位召回率从0.73提升至0.93。

Comments 21 pages, 1 figure, 6 tables. Submitted to Knowledge-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15229 2026-06-16 cs.CR 新提交 89%

LLM: LSTM Look-Ahead Moving Target Defense Based on Historical Malicious Scan

LLM:基于历史恶意扫描的LSTM前瞻移动目标防御

Yu Li

专题命中 长上下文与记忆 :LLM(title,title_cn)

AI总结 提出LLM方法,利用LSTM网络预测攻击者可能扫描的目标地址,结合集成学习和动态变异机制,提升IP shuffling的安全性和降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14779 2026-06-16 cs.AR 新提交 89%

Unified KV Pooling to Accelerate Long-Context LLM Serving

统一KV池化以加速长上下文LLM服务

Minchul Kang, Changyong Shin, Jinwoo Jeong, Jaerim Park, Woohyun Kim, Bonyul Gu, Dongwoo Kang, Gyeongsik Yang, Chuck Yoo

专题命中 长上下文与记忆 :LLM(title,title_cn)

AI总结 针对长上下文LLM服务中KV缓存卸载到主机内存和SSD时的高延迟问题,提出统一KV池化方法,聚合多设备并绕过内核文件系统,实现TTFT降低约4.1倍。

Comments 7 pages, 12 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12313 2026-06-16 cs.CR 版本更新 89%

Taint-Based Code Slicing for LLMs-based Malicious NPM Package Detection

基于污点的代码切片用于基于LLM的恶意NPM包检测

Dang-Khoa Nguyen, Gia-Thang Ho, Quang-Minh Pham, Tuyet A. Dang-Thi, Minh-Khanh Vu, Thanh-Cong Nguyen, Phat T. Tran-Truong, Duc-Ly Vu

专题命中 长上下文与记忆 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 提出基于污点代码切片的LLM框架,通过隔离安全相关数据流,将输入token数平均减少99.75%,在2537个包上达到87.04%的检测准确率,优于基线方法。

Comments 18 pages, 1 figure, 5 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21862 2026-06-16 cs.AI cs.MA cs.SI econ.GN q-fin.EC 版本更新 87%

Shachi: A Modular, Controllable Framework for LLM-Based Agent-Based Modeling of Emergent Collective Behavior

Shachi: 一种用于基于LLM的涌现集体行为建模的模块化、可控框架

So Kuroki, Yingtao Tian, Kou Misaki, Takashi Ikegami, Takuya Akiba, Yujin Tang

机构 * Sakana AI, Japan(日本Sakana AI) The University of Tokyo, Japan(日本东京大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 提出Shachi框架,将智能体认知分解为配置、记忆和工具等独立可控组件,通过扰动实验研究微观认知特征如何影响宏观群体动态,并在10任务基准和关税冲击案例中验证其有效性。

Comments Accepted to ALIFE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15427 2026-06-16 cs.LG cs.AI cs.CV 新提交 87%

Post-Launch Capability Expansion of Vision-Language Models via Prompting for On-Orbit Spacecraft Inspection

通过提示实现视觉语言模型发射后能力扩展用于在轨航天器检测

Nicholas A. Welsh, Lennon J. Shikhman, Monty Nehru Attazs, Seemanthini K. Putane, Van Minh Nguyen, Ryan T. White

机构 * Florida Institute of Technology(佛罗里达理工学院) University of Florida(佛罗里达大学)

专题命中 长上下文与记忆 :language model(title,abstract);prompting(title);分类 cs.AI、cs.LG

AI总结 研究利用提示驱动的视觉语言模型在轨扩展语义能力,无需修改权重即可通过自然语言提示检测新航天器部件,在129张图像上零样本实例分割达到0.385 mAP@0.5。

Comments 5 pages, 1 figure, 2 tables. Equal contribution by Nicholas A. Welsh and Lennon Shikhman. Published in the CVPR2026 Workshop on AI4Space

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18421 2026-06-16 cs.CL cs.AI cs.LG 版本更新 83%

EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective

EvoMemBench: 从自演化视角评估智能体记忆

Yuyao Wang, Zhongjian Zhang, Mo Chi, Kaichi Yu, Yuhan Li, Miao Peng, Bing Tong, Chen Zhang, Yan Zhou, Jia Li

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Createlink Technology(创-link科技) Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Institute of Technology(北京理工大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EvoMemBench,从自演化视角评估智能体记忆,通过内存范围和内容两个维度构建统一基准,比较15种内存方法并发现当前内存系统尚未达到通用解决方案,长上下文基线仍具竞争力,内存在上下文不足或任务困难时效果显著,检索方法在知识密集型任务中表现优异,而程序和长期记忆方法在任务结构匹配时更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16569 2026-06-16 cs.CV cs.RO 新提交 82%

PROSE: Training-Free Egocentric Scene Registration with Vision-Language Models

PROSE: 基于视觉语言模型的无训练自我中心场景配准

Zhiang Chen, Nahyuk Lee, Boyang Sun, Taein Kwon, Marc Pollefeys, Zuria Bauer, Sunghwan Hong

机构 * ETH Zurich(苏黎世联邦理工学院) VGG, University of Oxford(牛津大学VGG实验室) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 长上下文与记忆 :language model(title,abstract);foundation model(abstract)

AI总结 提出PROSE方法,利用预训练视觉语言模型将RGB序列提升为对象级3D场景图,通过对象高度先验和相同/不同查询匹配实例,无需训练或深度传感器即可实现自我中心场景配准,在Aria基准上超越几何和场景图基线。

Comments Project page: https://rckola.github.io/prose/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11550 2026-06-16 cs.LG cs.AI 版本更新 81%

TS-Memory: Plug-and-Play Memory for Time Series Foundation Models

TS-Memory: 时间序列基础模型的即插即用记忆模块

Sisuo Lyu, Siru Zhong, Tiegang Chen, Weilin Ruan, Qingxiang Liu, Taiqiang Lv, Qingsong Wen, Raymond Chi-Wing Wong, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tencent(腾讯) Squirrel Ai Learning The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出参数化记忆蒸馏方法TS-Memory,通过轻量级记忆适配器增强冻结的时间序列基础模型,在分布偏移下实现无检索的高效零样本预测,显著提升点预测和概率预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15656 2026-06-16 cs.AI 新提交 80%

Overcoming the Impedance Mismatch: A Theoretical Roadmap for Fusing Foundation Models and Knowledge Graphs

克服阻抗不匹配:融合基础模型与知识图谱的理论路线图

Sahil Rajesh Dhayalkar

机构 * Arizona State University(亚利桑那州立大学)

专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出“阻抗不匹配”概念,形式化分析基础模型与知识图谱的结构与几何摩擦,通过三级层次分类揭示现有方法的局限,并给出理论路线图实现真正的语义融合。

Comments 12 pages. Accepted at the ACL 2026 4th Workshop on Towards Knowledgeable Foundation Models (https://openreview.net/forum?id=hXDYsNAq8m)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07013 2026-06-16 cs.CL 版本更新 79%

CoBit: Language Modeling with Bitstream Diffusion

CoBit: 基于比特流扩散的语言建模

Georgios Batzolis, Mark Girolami, Luca Ambrogioni

机构 * University of Cambridge(剑桥大学)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL

AI总结 提出CoBit模型,将文本建模为固定宽度二进制比特流上的连续扩散过程,采用匹配滤波残差参数化和基于熵率门控的朗之万校正采样器,在LM1B和OpenWebText上达到接近自回归模型的生成困惑度,并消除词汇表缩放瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14881 2026-06-16 cs.DC 新提交 75%

Evaluating Gemma4 Models as AI Teaching Assistants for Introductory Parallel Programming: A DataRaceBench Study

评估 Gemma4 模型作为并行编程入门课程的 AI 助教:基于 DataRaceBench 的研究

Sabbir Hussain Meraj, Riham Chowdhury, Shimul Debnath, Wei Wang

专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究评估了 Gemma4 开源模型在识别、解释和修复 OpenMP 数据竞争方面的能力,发现较大模型能覆盖大部分基准测试,但上下文提示并未一致提升修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15405 2026-06-16 cs.CL cs.AI 新提交 73%

T-Mem: Memory That Anticipates, Not Archives

T-Mem:预测而非归档的记忆

Weidong Guo, Dakai Wang, Zixuan Wang, Hui Liu, Yu Xu

机构 * Tencent(腾讯)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出T-Mem架构,通过写时触发机制覆盖描述性和关联性回忆,解决长对话中语义关联检索问题,在LoCoMo和LoCoMo-Plus上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15157 2026-06-16 cs.LG cs.AI 新提交 73%

PolyKV: Heterogeneous Retention and Allocation for KV Cache Compression

PolyKV: 异构保留与分配用于KV缓存压缩

Chao Fei, Panos Kalnis

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对长上下文大模型推理中KV缓存压缩问题,提出PolyKV框架,通过层级别信号为每层选择合适压缩策略并分配非均匀缓存预算,实验表明在固定预算下显著恢复性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16898 2026-06-16 cs.CV cs.AI 新提交 70%

Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial Localization

Semantic Flip: 用于具身问答和空间定位中鲁棒拒绝的合成OOD生成

Dongbin Na, Chanwoo Kim, Giyun Choi, Dooyoung Hong

机构 * RGA Inc.(RGA公司)

专题命中 长上下文与记忆 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出Semantic Flip框架,通过合成辅助OOD样本训练轻量拒绝模块,使冻结的视觉语言模型在无外部OOD标注下实现鲁棒拒绝,在具身问答和空间定位基准上优于强提示基线。

Comments 18 pages, 3 figures. Code and data: https://github.com/ndb796/SemanticFlip ; project page: https://ndb796.github.io/SemanticFlip

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14790 2026-06-16 cs.PL cs.AI 新提交 70%

XFlow: An Executable Protocol Programming System for Reliable Multi-Agent Workflows

XFlow: 一个用于可靠多智能体工作流的可执行协议编程系统

Hanqi Li, Jing Peng, Zijian Wang, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室,计算机科学学院,上海交通大学,上海,中国) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室,苏州,中国) Suzhou Laboratory, Suzhou, China(苏州实验室,苏州,中国)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出XFlow可执行协议编程系统及其领域特定语言XPF,通过将工作流承诺从提示移至可检查、可执行的协议结构,并利用生命周期管理的符号中介智能体输出,提升多智能体工作流的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19595 2026-06-16 cs.IR cs.CL 版本更新 70%

All-Mem: Agentic Lifelong Memory via Dynamic Topology Evolution

All-Mem: 通过动态拓扑演化实现智能体终身记忆

Can Lv, Heng Chang, Shengyu Tao, Mingju Chen, Zhaoxin Fan, Ziwei Zhang, Yuchen Guo, Shiji Zhou

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) Beihang University(北航) Tsinghua University(清华大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出All-Mem框架,通过在线/离线结合的非破坏性拓扑结构记忆库,解决终身交互代理中历史增长导致的检索冗余和噪声问题,在LoCoMo和LongMemEval-s上提升检索与问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15045 2026-06-16 cs.DC 新提交 67%

NEURON-Fabric: CXL-Side Low-Bit Gradient Aggregation for Distributed Training

NEURON-Fabric: 面向分布式训练的CXL侧低比特梯度聚合

Ziqiang Wang, Changcheng Huang, Chung-Horng Lung

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 提出NEURON-Fabric架构,在CXL内存控制器中实现低比特梯度聚合,通过G-Binary和G-Ternary方法减少通信量,同时保留FP32路径,在CIFAR-10/ResNet-18等任务上接近FP32精度,梯度流量降至3.6-5.4%。

Comments Preprint. 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16093 2026-06-16 cs.CL cs.AI 新提交 62%

Long-Context Modeling via GSS-Transformer Hybrid Architecture with Learnable Mixing

基于可学习混合的GSS-Transformer混合架构的长上下文建模

Kuzey Torlak, Hüseyin Arda Arslan, Anıl Dervişoğlu, Beyza Nur Deniz, Onur Boyar

机构 * Kadıköy Anadolu High School(卡德柯伊安纳多卢高中) Politecnico di Torino(都灵理工大学) Istanbul Technical University(伊斯坦布尔理工大学) Boğaziçi University(博阿齐奇大学) IBM Research - Tokyo(IBM 东京研究院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出并行混合架构PHA,通过可学习混合机制融合GSS、GQA和FFN,在长上下文建模中实现Transformer级困惑度与更高效率。

Comments 16 pages, 9 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11751 2026-06-16 cs.CV cs.AI 新提交 57%

AnchorEdit: Maintaining Temporal Consistency in Multi-turn Image Editing via Causal Memory

AnchorEdit: 通过因果记忆在多轮图像编辑中保持时间一致性

Hang Xu, Xiaoxiao Ma, Guohui Zhang, Yu Hu, Siming Fu, Jie Huang, Lin Song, Haoyang Huang, Nan Duan, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) JD Explore Academy(京东探索研究院)

专题命中 长上下文与记忆 :pretraining(abstract);分类 cs.AI

AI总结 提出首个自回归扩散框架AnchorEdit,通过因果记忆机制和自展开策略解决多轮编辑中的身份漂移和误差累积问题,在10轮以上交互中保持高保真度。

Comments Code: https://github.com/xuhang07/AnchorEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16178 2026-06-16 cs.RO 新提交 50%

Scaling Short-Term Memory of Visuomotor Policies for Long-Horizon Tasks

面向长时任务的视觉运动策略短期记忆扩展

Rutav Shah, Rajat Kumar Jenamani, Xiaohan Zhang, Lingfeng Sun, Roberto Martín-Martín, Yuke Zhu, Deva Ramanan, Karl Schmeckpeper

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Toyota Research Institute(丰田研究院)

专题命中 长上下文与记忆 :pretraining(abstract)

AI总结 提出PRISM架构,通过门控注意力与层次化压缩扩展视觉运动策略的短期记忆至两分钟,在ReMemBench基准上超越现有方法5%-12%。

Comments 14 pages, 9 Figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 102 篇

2606.15943 2026-06-16 cs.SE cs.AI 新提交 92%

Graphical-Probabilistic Modeling of Generative Flows in LLM-Native Software Systems

LLM原生软件系统中生成流的图形概率建模

Víctor A. Braberman, Flavia Bonomo-Braberman

机构 * Departamento de Computación, FCEN, Universidad de Buenos Aires / ICC, UBA-CONICET(布宜诺斯艾利斯大学计算机系 / UBA-CONICET)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对LLM原生软件开发缺乏设计级推理的问题,提出基于图形概率模型的生成网络框架,用于文档化生成流并描述系统属性。

Comments Published at 2026 IEEE/ACM 5th International Conference on AI Engineering - Software Engineering for AI (CAIN '26), April 12-13, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05568 2026-06-16 cs.AI cs.CL cs.CY stat.AP 版本更新 92%

Metacognitive Myopia in Large Language Models

大型语言模型中的元认知近视

Florian Scholten, Tobias R. Rebholz, Mandy Hütter

机构 * Psychology Department, University of Tübingen(图宾根大学心理学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出元认知近视框架解释LLM偏见,认为信息环境中的有偏样本导致五种症状,并通过监控与控制机制近似技术缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15288 2026-06-16 cs.LG cs.AI physics.ao-ph 新提交 92%

Hybrid NARX-LLM for Greenland Iceberg Discharge: Prompt-Driven Residual Correction

混合NARX-LLM用于格陵兰冰山排放:提示驱动的残差校正

Yiquan Gao, Duohui Xu

机构 * Heriot-Watt University(赫瑞瓦特大学) StudioYG

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出混合NARX-LLM框架,结合非线性自回归模型与大型语言模型进行残差校正,并引入物理信息提示方法,用于建模格陵兰冰山排放的复杂非线性动态,提升预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21027 2026-06-16 cs.CL cs.AI 版本更新 92%

Beyond Text-to-SQL: An Agentic LLM System for Governed Enterprise Analytics APIs

超越文本到SQL:一个面向受控企业分析API的代理LLM系统

Gundeep Singh, Parsa Kavehzadeh, Jing Xia, Xue-Yong Fu, Julien Bouvier Tremblay, Md Tahmid Rahman Laskar, Vincent Lum, Shashi Bhushan TN

机构 * Dialpad Inc.(Dialpad公司)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Analytic Agent,一个基于LLM的代理系统,能够将自然语言意图安全地转换为与企业分析API的交互,解决传统文本到SQL系统在企业环境中面临的可靠性与合规性问题。

Comments Accepted to the Enterprise AI Agents Workshop @ KDD 2026. The first four authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16545 2026-06-16 cs.CL 新提交 92%

Can LLM Coding Agents Reason About Time Series?

LLM 编码智能体能否推理时间序列?

Filip Rechtorík, Ondřej Dušek, Zdeněk Kasner

机构 * Institute of Formal and Applied Linguistics, Faculty of Mathematics and Physics, Charles University(查尔斯大学数学与物理学院形式与应用语言学研究所)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究 LLM 编码智能体在时间序列分析中的能力,发现代码访问可提升性能达 10%,但仍有 22-34% 错误,并分析了推理差距。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15258 2026-06-16 cs.AI 新提交 92%

Mask-Proof: An LLM-based Automated Data Curation Pipeline on Mathematical Proofs

Mask-Proof: 一种基于LLM的数学证明自动数据整理流水线

Jierui Zhang, Siyuan Tan, Xinhang Li, Longzhuangzhi Lin, Dailin Li, Chengfeng Gu, Xinping Li, Yaxian Hao, Shengjia Liang, Yuxiang Ren, Wenhao Liu

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) Graduate College for Engineers, Beijing University of Posts and Telecommunications(北京邮电大学研究生院工程师学院) School of Mathematical Sciences, Fudan University(复旦大学数学科学学院) School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络空间安全学院) School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) Chu Kochen Honors College, Zhejiang University(浙江大学竺可桢学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Mask-Proof流水线,将真实证明转化为可自动检查的掩码步骤任务,通过LLM等价性判断器评估模型推理,构建包含292个问题的基准,推理增强模型性能提升12%-27%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13607 2026-06-16 cs.AI 新提交 92%

Reasoning as Pattern Matching: Shared Mechanisms in Human and LLM Everyday Reasoning

推理即模式匹配:人类与LLM日常推理中的共享机制

Zach Studdiford, Gary Lupyan

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过比较人类和25个LLM在日常因果推理中的错误模式,发现两者均表现出模式匹配而非抽象世界模型驱动的推理,并识别出LLM中驱动响应的注意力头可预测人类推理错误。

Comments 13 pages main text, 51 pages supplementary text

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16995 2026-06-16 cs.AI cs.LG 新提交 91%

When in Doubt, Plan It Out: Committed Small Language Model Deliberation for Reactive Reinforcement Learning

存疑则计划:用于反应式强化学习的小型语言模型承诺式推理

Nathan Gavenski, Juarez Monteiro, Francisco Galuppo, Adriano Veloso, Odinaldo Rodrigues

机构 * University of São Paulo(圣保罗大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出PACT混合架构,结合快速反应式强化学习策略与慢速小型语言模型规划器,通过异步生成和验证候选动作计划来提升策略在陌生环境中的表现。

Comments LM4Plan Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16774 2026-06-16 cs.AI cs.CL 新提交 91%

OpenClaw-Skill: Collective Skill Tree Search for Agentic Large Language Models

OpenClaw-Skill:面向智能体大语言模型的集体技能树搜索

Tianyi Lin, Chuanyu Sun, Jingyi Zhang, Changxu Wei, Huanjin Yao, Shunyu Liu, Xikun Zhang, Liu Liu, Jiaxing Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Royal Melbourne Institute of Technology(皇家墨尔本理工大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出集体技能树搜索(CSTS)框架,通过集体智能生成和评估技能节点,构建结构化、多样且可泛化的技能树,并引入集体技能强化学习,提升大语言模型在工具使用、多步推理和动态环境交互中的智能体能力。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏