arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-15 至 2026-05-15 共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 15 篇

2605.14558 2026-05-15 cs.LG cs.AI cs.CL 75%

Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy

消除行动瓶颈:由令牌级能量指导的代理强化学习

Langzhou He, Junyou Zhu, Yue Zhou, Zhengyao Gu, Junhua Liu, Wei-Chieh Huang, Henry Peng Zou, David Wipf, Philip S. Yu, Qitian Wu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所) Technical University of Berlin(柏林技术大学) University of Southern California(南加州大学) University of Hong Kong(香港大学) Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ActFocus方法,通过令牌级能量建模解决强化学习中令牌级训练信号分配不均的问题,显著提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12554 2026-05-15 cs.LG cs.AI cs.CL 75%

Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages

基于熵引导的步骤选择和分步优势的扩散语言模型强化学习

Vishnu Teja Kunde, Fatemeh Doudi, Mahdi Farahbakhsh, Dileep Kalathil, Krishna Narayanan, Jean-Francois Chamberland

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种针对扩散语言模型的强化学习方法,通过熵引导选择步骤和分步优势估计,实现无偏策略梯度,提升生成效果和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14912 2026-05-15 cs.AI cs.CY cs.HC cs.LG 73%

From Sycophantic Consensus to Pluralistic Repair: Why AI Alignment Must Surface Disagreement

从阿谀共识到多元修复:为何AI对齐必须显现分歧

Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Institute for Ethics in AI, University of Oxford(牛津大学人工智能伦理研究所) Responsible Technology Institute, University of Oxford(牛津大学负责任技术研究所)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出多元对齐需通过对话机制表面价值冲突,提出多元修复评分指标,探讨部署阶段的治理层对多元主义的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00977 2026-05-15 cs.LG cs.CL 73%

It Takes Two: Your GRPO Is Secretly DPO

两人即可:你的GRPO其实暗含DPO

Yihong Wu, Liheng Ma, Lei Ding, Muzhi Li, Xinyu Wang, Kejia Chen, Zhan Su, Zhanguang Zhang, Chenyang Huang, Yingxue Zhang, Mark Coates, Jian-Yun Nie

机构 * UdeM(蒙特利尔大学) McGill(麦吉尔大学) Mila(Mila人工智能研究院) UManitoba(曼尼托巴大学) CUHK(香港中文大学) ZJU(浙江大学) UAlberta(阿尔伯塔大学) Amii(阿米人工智能研究院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 后训练与偏好优化 :LLM(abstract_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文提出2-GRPO,通过仅两个rollouts构建对比信号,理论分析显示其性能接近16-GRPO,训练效率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14269 2026-05-15 cs.CV cs.AI 57%

PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation

PhyMotion: 结构化3D运动奖励用于物理基础的人体视频生成

Yidong Huang, Zun Wang, Han Lin, Dong-Ki Kim, Shayegan Omidshafiei, Jaehong Yoon, Jaemin Cho, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(UNC夏洛特希尔大学) FieldAI NTU Singapore(新加坡国立大学) AI2 Johns Hopkins University(约翰霍普金斯大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出PhyMotion,一种结构化的3D运动奖励机制,通过物理模拟器评估人体运动的物理可行性,提升视频生成中人体动作的真实感。

Comments First two authors contributed equally, website: https://phy-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25240 2026-05-15 stat.ML cs.LG 57%

Generative Bayesian Optimization: Generative Models as Acquisition Functions

生成贝叶斯优化:生成模型作为获取函数

Rafael Oliveira, Daniel M. Steinberg, Edwin V. Bonilla

机构 * CSIRO’s Data61(CSIRO的数据61)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.LG

AI总结 本文提出利用生成模型作为批量贝叶斯优化的候选解采样器,通过直接优化偏好信号生成高效的获取函数,适用于高维和组合优化问题。

Comments Published at ICLR 2026. Compared with the proceedings version on OpenReview, this version includes a minor revision to Section 3

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14891 2026-05-15 cs.CV 50%

Hierarchical Image Tokenization for Multi-Scale Image Super Resolution

多尺度图像超分辨率的分层图像标记

Isma Hadji, Enrique Sanchez, Adrian Bulat, Brais Martinez, Georgios Tzimiropoulos

机构 * Samsung AI Center Cambridge, UK(三星AI研究中心(剑桥,英国)) Technical University of Iasi, Romania(亚西技术大学(罗马尼亚)) Queen Mary University of London, UK(伦敦女王玛丽大学(英国))

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出基于视觉自回归模型的多尺度图像超分辨率方法,通过引入分层图像标记和直接偏好优化正则化项,提升模型灵活性与效率,实现无需外部数据的高精度多尺度输出。

Comments Accepted for publication at ICML 2026. *Joint first authorship (alphabetical order). arXiv admin note: substantial text overlap with arXiv:2506.04990

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14274 2026-05-15 cs.CV 50%

CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL

CreFlow:稀疏奖励具身视频扩散强化学习的纠正回流

Zhenyang Ni, Yijiang Li, Ruochen Jiao, Simon Sinong Zhan, Sipeng Chen, Zhenfei Yin, Minshuo Chen, Philip Torr, Zhaoran Wang, Qi Zhu

机构 * Northwestern University(西北大学) University of California, San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出CreFlow框架,通过信用感知NFT损失和纠正回流损失提升高维视频生成性能,有效解决稀疏奖励下的具身任务执行问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14068 2026-05-15 cs.CV 50%

CoCoEdit: Content-Consistent Image Editing via Region Regularized Reinforcement Learning

CoCoEdit:通过区域正则化的强化学习实现内容一致的图像编辑

Yuhui Wu, Chenxi Xie, Ruibin Li, Liyi Chen, Qiaosi Yi, Lei Zhang

机构 * The Hong Kong Polytechnic University, Hong Kong(香港理工大学) OPPO Research Institute, ShenZhen, China(OPPO研究院,深圳,中国)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出CoCoEdit框架,通过区域正则化强化学习提升图像编辑内容一致性,利用改进的指令和掩码生成高质量训练集,并引入像素相似度奖励和区域正则化器,提升编辑质量和一致性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 13 篇

2605.13941 2026-05-15 cs.LG cs.AI 90%

EvolveMem:Self-Evolving Memory Architecture via AutoResearch for LLM Agents

EvolveMem:通过AutoResearch实现LLM代理的自进化内存架构

Jiaqi Liu, Xinyu Ye, Peng Xia, Zeyu Zheng, Cihang Xie, Mingyu Ding, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) UC Berkeley(加州大学伯克利分校) UCSC(加州大学圣克鲁兹分校)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出EvolveMem,一种通过AutoResearch实现自进化内存架构的LLM代理系统,通过闭环自进化过程自动优化检索配置,实现存储知识与检索机制的协同进化,实验表明其在多个基准测试中均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14421 2026-05-15 cs.CR cs.AI 90%

MemLineage: Lineage-Guided Enforcement for LLM Agent Memory

MemLineage: 为LLM代理内存提供指导性强制措施

Ciyan Ouyang, Rui Hou

机构 * State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) Institute of Information Engineering, CAS(信息工程研究所,中国科学院) Beijing, China(北京,中国)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 MemLineage通过结合加密溯源和LLM中介推导链,解决LLM代理内存中不可信内容的持久化问题,通过链式 custody 机制防止敏感操作,实验显示其能有效降低攻击成功率。

Comments 24 pages, 8 figures. Rui Hou is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14802 2026-05-15 cs.AI 87%

A Heterogeneous Temporal Memory Governance Framework for Long-Term LLM Persona Consistency

一种异构时间记忆治理框架用于长期LLM身份一致性

Zhao Yang, Wang Huan, Li Yingshuo, Tu Haomiao, Lin Hujite

机构 * Changchun Kelaile Technology Co., Ltd(长春凯莱尔科技有限公司)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ARPM框架,通过分离静态知识与动态对话记忆,结合多种检索与排序技术,提升长期对话中身份一致性。实验显示自动规则在证据进入提示后可能低估召回率,且对话历史检索对近期连续性至关重要。

Comments 23 pages, 5 figures, 2 tables. Preprint version. Code for ARPM v4.0 is available at: https://github.com/Spirtxiaoqi7/ARPM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14053 2026-05-15 cs.CL cs.AI 86%

Derivation Prompting: A Logic-Based Method for Improving Retrieval-Augmented Generation

推导提示:一种基于逻辑的方法,用于提高检索增强生成

Ignacio Sastre, Guillermo Moncecchi, Aiala Rosá

机构 * Instituto de Computación, Facultad de Ingeniería, Universidad de la República(计算研究所,工程学院,乌拉圭共和国大学)

专题命中 长上下文与记忆 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出推导提示方法,通过系统应用预定义规则从初始假设推导结论,以提高检索增强生成中生成过程的可控性和准确性。

Journal ref Advances in Artificial Intelligence IBERAMIA 2024, LNCS 15277, pp. 412 423, Springer (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14177 2026-05-15 cs.IR cs.AI cs.CL 84%

Thinking Ahead: Prospection-Guided Retrieval of Memory with Language Models

前瞻性引导的记忆检索:语言模型中的记忆检索

Harshita Chopra, Krishna Kant Chintalapudi, Suman Nath, Ryen W. White, Chirag Shah

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 长上下文与记忆 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 前瞻性引导的记忆检索通过模拟未来步骤来增强长周期检索,提升用户个性化需求的响应质量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14362 2026-05-15 cs.SE cs.AI 81%

Correctness-Aware Repository Filtering Under Maximum Effective Context Window Constraints

在最大有效上下文窗口约束下的正确性感知仓库过滤

Shweta Mishra

机构 * Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种正确性感知的上下文卫生框架,通过预执行的大小基 heuristic 过滤器在 tokenization 前拦截仓库扫描,实现低开销的上下文优化,提升代码分析准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06132 2026-05-15 cs.CL 81%

MemReranker: Reasoning-Aware Reranking for Agent Memory Retrieval

MemReranker:面向智能体记忆检索的推理增强重排序

Chunyu Li, Mengyuan Zhang, Jingyi Kang, Ding Chen, Jiajun Shen, Bo Tang, Xuanhe Zhou, Feiyu Xiong, Zhiyu Li

机构 * China Telecom Research Institute(中国电信研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 MemReranker通过多阶段LLM知识蒸馏构建,解决记忆检索中语义相关但缺乏关键信息的问题,提升重排序模型的推理能力与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14906 2026-05-15 cs.CV 78%

MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models

MemLens:大型视觉-语言模型多模态长期记忆的基准测试

Xiyu Ren, Zhaowei Wang, Yiming Du, Zhongwei Xie, Chi Liu, Xinlin Yang, Haoyue Feng, Wenjun Pan, Tianshi Zheng, Baixuan Xu, Zhengnan Li, Yangqiu Song, Ginny Wong, Simon See

机构 * CSE Deparment, HKUST(香港科技大学计算机科学与工程系) CUHK(香港大学) OmniMemory (Shenzhen) Intelligent Technology Co., Ltd.(深圳奥米克记忆科技有限公司) NVIDIA AI Technology Center (NVAITC), NVIDIA, Santa Clara, USA(英伟达AI技术中心(NVAITC),英伟达,美国圣克拉拉)

专题命中 长上下文与记忆 :language model(title,abstract)

AI总结 MemLens基准测试评估大型视觉-语言模型在多模态多会话对话中的长期记忆能力,通过789个问题测试五种记忆能力,揭示长上下文模型和记忆增强代理的优缺点,推动混合架构发展。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08374 2026-05-15 cs.AI 70%

MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs

MemQ:将Q学习整合到基于溯源DAG的自进化记忆代理中

Junwei Liao, Haoting Shi, Ruiwen Zhou, Jiaqian Wang, Shengtao Zhang, Wei Zhang, Ying Wen, Zhiyu Li, Feiyu Xiong, Bo Tang, Weinan Zhang, Muning Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学) Xidian University(西安电子科技大学) University of Science and Technology of China(中国科学技术大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 MemQ通过在溯源DAG中传播信用权重,改进记忆Q值的评估,提升多步任务的泛化能力,尤其在产生深层相关溯源链的任务中表现突出。

Comments 22 pages, 11 figures (containing 43 individual image panels total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14823 2026-05-15 cs.LG cs.CV 70%

Dynamic Nested Hierarchies: Pioneering Self-Evolution in Machine Learning Architectures for Lifelong Intelligence

动态嵌套层级:在机器学习架构中开创自我进化以实现终身智能

Akbar Anbar Jafari, Cagri Ozcinar, Gholamreza Anbarjafari

机构 * Institute of Technology University of Tartu(塔尔图技术大学) S Holding OÜ(3S控股公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出动态嵌套层级,通过自适应调整优化层级、嵌套结构和更新频率,解决现有模型在非平稳环境中的适应性问题,推动终身学习的发展。

Comments 12 pages, 1 figure

Journal ref Frontiers in Artificial Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14833 2026-05-15 cs.AI cs.HC 57%

Emotion-Attended Stateful Memory (EASM):The Architecture for Hyper-Personalization at Scale

情感关注状态记忆(EASM):大规模超个性化的人机交互架构

Vineet Kotecha, Vansh Gupta

机构 * divAIne Research(divAIne研究)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文提出EASM架构,通过长期历史、情绪信号和推断意图动态构建用户特定对话上下文,实验表明其在记忆基础、计划清晰度和情感验证方面显著优于无状态基线。

Comments 18 pages, 3 figures, 3 tables. Industry research whitepaper. Includes controlled A/B evaluation across 30 scenarios and 6 emotional categories

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13941 2026-05-15 q-bio.NC cs.AI cs.CV eess.IV 57%

Shared representations in brains and models reveal a two-route cortical organization during scene perception

大脑与模型中的共享表征揭示了场景感知期间的双路由皮层组织

Pablo Marcos-Manchón, Lluís Fuentemilla

机构 * Department of Cognition, Development and Education Psychology, Faculty of Psychology, University of Barcelona(认知、发展与教育心理学系,心理学学院,巴塞罗那大学) Institute of Neurosciences, University of Barcelona(神经科学研究所,巴塞罗那大学) Bellvitge Institute for Biomedical Research(Bellvitge生物医学研究 institute)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 研究通过7T fMRI数据揭示了场景感知中双路由皮层组织,发现视觉和语言模型在表征结构上的差异。

Comments for associate code, see https://github.com/memory-formation/convergent-transformations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15054 2026-05-15 cs.CV 50%

LATERN: Test-Time Context-Aware Explainable Video Anomaly Detection

LATERN:测试时上下文感知的可解释视频异常检测

Mitchell Piehl, Muchao Ye

机构 * The University of Iowa(爱荷华大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出LATERN框架,通过上下文感知模块和递归证据聚合模块提升视频异常检测的准确性和解释一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 61 篇

2604.23477 2026-05-15 cs.DB 92%

SEMA-SQL: Beyond Traditional Relational Querying with Large Language Models

SEMA-SQL:超越传统关系查询的大型语言模型

Yin Lin, Tianjing Zeng, Zhongjun Ding, Rong Zhu, Bolin Ding, H. V. Jagadish, Jingren Zhou

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 SEMA-SQL通过结合关系操作与LLM语义推理,自动回答自然语言问题,提升查询能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14561 2026-05-15 cs.AI 90%

Prompt Segmentation and Annotation Optimisation: Controlling LLM Behaviour via Optimised Segment-Level Annotations

提示分割与标注优化:通过优化段级标注控制大语言模型行为

Devika Prasad, Luke Gerschwitz, Tong Li, Henry Xiao, Anjin Liu, Coco Wu, Anna Leontjeva, Luiz Pizzato

机构 * Commonwealth Bank of Australia(澳大利亚全国银行)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PSAO框架,通过段级标注提升提示优化的可控性和效率,实验证明标注能提高LLM推理准确性和自一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04236 2026-05-15 cs.LG 90%

Adaptive Consensus in LLM Ensembles via Sequential Evidence Accumulation: Automatic Budget Identification and Calibrated Commit Signals

通过顺序证据累积实现LLM集成的自适应共识:自动预算识别和校准的承诺信号

Roberto E. Medina

机构 * Independent Researcher(独立研究员)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出DASE方法,通过顺序证据累积实现LLM集成的自适应共识,通过自动预算识别和校准承诺信号提升推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20984 2026-05-15 cs.CR cs.LG 90%

ACE: A Security Architecture for LLM-Integrated App Systems

ACE:用于集成大语言模型的应用系统的安全架构

Evan Li, Tushin Mallick, Evan Rose, William Robertson, Alina Oprea, Cristina Nita-Rotaru

机构 * Northeastern University(东北大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ACE架构,通过分离规划阶段提升LLM集成应用系统的安全性和可用性,验证其在对抗性攻击中的有效性。

Comments 25 pages, 13 figures, 8 tables; accepted by Network and Distributed System Security Symposium (NDSS) 2026

Journal ref Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12484 2026-05-15 cs.LG cs.AI 90%

Learning, Fast and Slow: Towards LLMs That Adapt Continually

学习,快速与缓慢:迈向能够持续适应的LLM

Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri

机构 * UC Berkeley(加州大学伯克利分校) Mila(蒙特利尔大学人工智能研究所) UT Austin(得克萨斯大学奥斯汀分校) Eragon Periodic Labs Mirendil Video

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种快速-缓慢学习框架,通过将模型参数作为缓慢权重和优化上下文作为快速权重,提升LLM在连续学习中的样本效率和性能,减少灾难性遗忘。

Comments 29 pages, 14 figures, including appendix; Blog post: https://gepa-ai.github.io/gepa/blog/2026/05/11/learning-fast-and-slow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14801 2026-05-15 cs.RO 89%

Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN

探索VLM-LLM导航中的瓶颈:3D场景理解能力如何影响零样本VLN

Ziyi Xia, Chaoran Xiong, Litao Wei, Xinhao Hu, Ling Pei

机构 * Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(上海导航与基于位置的服务关键实验室,上海交通大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了零样本视觉-语言导航中3D场景理解能力对性能的影响,提出了统计成功率上限,揭示了感知饱和现象,建议转向导航相关的核心词汇和准确的边界框比例。

Comments Accepted by ICRA Workshop MM-Spatial AI, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04265 2026-05-15 cs.LG cs.AI 89%

Boosting LLM Reasoning via Human-Inspired Reward Shaping

通过人类启发的奖励塑造提升大语言模型推理能力

Wenze Lin, Zhen Yang, Xitai Jiang, Xiaoteng Ma, Gao Huang

机构 * Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Mind Lab

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出T2T动态奖励框架,通过区分掌握与未掌握问题的不同学习策略,提升LLM推理性能,实验显示其在数学基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14604 2026-05-15 cs.AI cs.HC 89%

Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks

谄媚是一种教育安全风险:为什么LLM导师需要谄媚基准

Enkelejda Kasneci, Gjergji Kasneci

机构 * Technical University of Munich, Munich, Germany(慕尼黑技术大学,慕尼黑,德国) Munich Center for Machine Learning, Munich, Germany(慕尼黑机器学习中心,慕尼黑,德国)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文探讨LLM导师需通过谄媚基准测试来评估其在教育中的安全风险,指出模型在面对社会-知识压力时的脆弱性及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏