arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-30 至 2026-06-30 共收录 603 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 34 篇

2606.29914 2026-06-30 cs.CL cs.LG 62%

MemDelta: Controlled Baselines and Hidden Confounds in Agent Memory Evaluation

MemDelta:智能体记忆评估中的受控基线和隐藏混杂因素

Kuan Wang

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出MemDelta控制评估协议,通过逐一改变组件发现RAG与全上下文基线排名因模型而异,嵌入模型切换可翻转结论,智能体自记忆不如基本检索,建议固定嵌入模型并分层报告。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00400 2026-06-30 cs.CL cs.AI 62%

Scaling Textual Gradients via Sampling-Based Momentum

通过采样基于动量的方法扩展文本梯度

Zixin Ding, Junyuan Hong, Zhan Shi, Jiachen T. Wang, Zinan Lin, Li Yin, Meng Liu, Zhangyang Wang, Yuxin Chen

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TSGD-M方法,通过动量采样重新加权更新,解决文本梯度下降扩展训练数据时的稳定性问题,并在六个基准测试中取得一致提升。

Journal ref CAIS '26: Proceedings of the ACM Conference on AI and Agentic Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29904 2026-06-30 cs.CL 57%

Timesteps of Mamba Align with Human Reading Times

Mamba的时间步长与人类阅读时间对齐

Yuji Yamamoto, Shinnosuke Isono, Yoshinobu Kawahara, Sho Yokoi

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 研究发现状态空间语言模型Mamba的每词时间步长能显著预测人类阅读时间,即使控制GPT-2惊讶度等已知预测因子后仍显著,表明Mamba可作为研究人类实时语言处理的新工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01569 2026-06-30 cs.AI cs.SE 57%

CaveAgent: Transforming LLMs into Stateful Runtime Operators

CaveAgent:将LLM转变为具有状态的运行时操作符

Maohao Ran, Zhenglin Wan, Cooper Lin, Yanting Zhang, Hongyu Xin, Hongwei Fan, Yibo Xu, Beier Luo, Yaxin Zhou, Wangbo Zhao, Lijie Yang, Lang Feng, Fuchao Yang, Jingxuan Wu, Yiqiao Huang, Chendong Ma, Yusen Huang, Dailing Jiang, Jianbo Deng, Sirui Han, Yang You, Bo An, Yike Guo, Jun Song

机构 * Hong Kong Generative AI Research and Development Center (HKGAI)(香港生成式AI研究与开发中心(HKGAI))

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 CaveAgent通过引入双流架构,将LLM从文本生成器转变为运行时操作符,解决了长周期任务中上下文漂移问题,提升了多轮交互的稳定性和数据处理能力。

Comments ver.2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30288 2026-06-30 cs.CV 50%

VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context

VisReflect: 用于长视觉上下文中细粒度感知的潜在视觉反射

Xiaoqian Shen, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布斯大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 针对长视觉上下文中细粒度感知的挑战,提出VisReflect框架,通过潜在空间中的连续视觉反射选择性强调相关区域,无需显式定位或额外前向传播,在图像和视频基准上分别提升4.1%和1.8%,并减少约44%推理时间。

Comments Accepted to ECCV 2026; Project page: https://xiaoqian-shen.github.io/VisReflect

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30108 2026-06-30 cs.CV 50%

LETT-NeXt: A Lightweight RECIST-Guided Model for 3D CT Lesion Segmentation

LETT-NeXt: 一种轻量级RECIST引导的3D CT病灶分割模型

Sebastian Aas, Elias Stenhede, Arian Ranjbar

机构 * Medical Technology & E-health, Akershus University Hospital, Lørenskog, Norway(医疗技术与e健康,阿克赫斯大学医院,洛伦斯克罗格,挪威) Faculty of Medicine, University of Oslo, Oslo, Norway(医学学院,奥斯陆大学,奥斯陆,挪威)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 提出轻量级RECIST引导模型LETT-NeXt,通过编码RECIST标记为提示通道,结合MedNeXt-v2编码器-解码器和自适应AutoZoom推理,实现3D CT病灶分割,在公开验证集上DSC达79.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10438 2026-06-30 cs.RO cs.CV 50%

AsyncMDE: Real-Time Monocular Depth Estimation via Asynchronous Spatial Memory

AsyncMDE:通过异步空间记忆实现实时单目深度估计

Lianjie Ma, Yuquan Li, Bingzheng Jiang, Ziming Zhong, Han Ding, Lijun Zhu

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 AsyncMDE通过异步空间记忆系统,结合冻结的基础模型和轻量级快速路径,在边缘设备上实现高效的实时单目深度估计,兼顾精度与速度。

Comments 8 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04860 2026-06-30 cs.CV 50%

DivAS: Interactive 3D Segmentation by Depth-Weighted Voxel Aggregation

DivAS:通过深度加权体素聚合实现交互式3D分割

Ayush Pande, Mayank Vatsa

机构 * Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校)

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 DivAS通过深度加权体素聚合实现交互式3D分割,无需优化循环,基于GAussian Splatting和NeRF框架,实现高效且高质量的3D分割。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 88 篇

2605.08330 2026-06-30 cs.RO 93%

Hierarchical Prompting with Dual LLM Modules for Robotic Task and Motion Planning

具有双LLM模块的分层提示用于机器人任务和运动规划

Karolina Źróbek, Tessa Pulli, Paweł Gajewski, Antonio Galiza Cerdeira Gonzalez, Bipin Indurkhya

机构 * IBM, Krakow, Poland(IBM公司,波兰克拉科夫) Jagiellonian University, Krakow, Poland(雅盖隆大学,波兰克拉科夫) AGH University, Krakow, Poland(AGH大学,波兰克拉科夫)

专题命中 推理与问题求解 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一个分层语言驱动框架,通过双LLM模块提升服务和协助场景中人机交互的自然性和直观性,结合目标检测与运动执行实现高成功率的任务规划。

Journal ref Proc. IEEE International Conference on Advanced Robotics and its Social Impacts (ARSO), 2026, pp. 245-250

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02176 2026-06-30 cs.CL 92%

Adam's Law: Textual Frequency Law on Large Language Models

Adam的定律:大型语言模型中的文本频率定律

Hongyuan Adam Lu, Z. L., Victor Wei, Zefan Zhang, Zhao Hong, Qiqi Xiang, Bowen Cao, Wai Lam

机构 * FaceMind Corporation(FaceMind公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)

AI总结 本文提出文本频率定律,通过优化文本频率提升LLM的提示和微调效果,并通过文本频率蒸馏和课程训练方法验证了其有效性。

Comments ACL 2026 Main Conference; The latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02734 2026-06-30 cs.AI cs.CL 92%

CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents

CostBench:评估LLM工具使用代理在动态环境中的多轮成本最优规划与适应

Jiayu Liu, Cheng Qian, Zhaochen Su, Qing Zong, Shijue Huang, Bingxiang He, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CostBench,一个以成本为中心的可扩展基准,用于评估LLM代理在动态环境中的经济推理和重新规划能力,揭示现有模型在成本感知规划方面的显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30247 2026-06-30 cs.CL 92%

Grounding LLM Reasoning under Incomplete Graph Evidence

在不完全图证据下 grounding LLM 推理

Jiaqi Li, Fanghui Song

机构 * Tianjin Normal University, College of Computer and Information Engineering(天津师范大学计算机与信息工程学院) Harbin Institute of Technology, School of Mathematics(哈尔滨工业大学数学学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出在不完全知识图谱证据下,通过KL正则化变形LLM先验实现软grounding,并给出稳定性界限,适用于GraphRAG、KGQA等场景。

Comments A theoretical perspective about Grounding LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30587 2026-06-30 cs.CR cs.AI 92%

Words Speak Louder Than Code: Investigating Cognitive Heuristics in LLM-Based Code Vulnerability Detection

言语胜于代码:探究基于LLM的代码漏洞检测中的认知启发式

Asif Shahriar, Hongyu Cai, Hadjer Benkraouda, Gang Wang, Z. Berkay Celik

机构 * BRAC University(布拉德大学) Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次系统探究认知启发式对LLM代码漏洞检测的影响,提出控制框架,发现所有评估模型均易受光环、框架和锚定效应影响,且语义推理型漏洞更易受影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28363 2026-06-30 cs.IR cs.AI cs.DL 92%

meta-pipe: An LLM-agent pipeline for end-to-end automated systematic review and meta-analysis

meta-pipe:面向端到端自动化系统评价与元分析的LLM智能体流水线

Hsieh-Ting Lin, Jiunn-Tyng Yeh

机构 * MD, PhD(医学博士,哲学博士)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出meta-pipe,一个集成文献检索、筛选、数据提取、统计分析、手稿生成和质量保证的10阶段模块化LLM智能体流水线,在关键决策点强制人工监督,并具备自动手稿生成、半自动GRADE评估、过度声明检测和双范式网络元分析等独特能力。

Comments 13 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30119 2026-06-30 cs.CR 91%

On the Internet, Nobody Knows You're an LLM Bot: Unmasking Web Agents with Multi-Layer Fingerprinting

在互联网上,没人知道你是一个LLM机器人:使用多层指纹识别揭露网络代理

Iliana Fayolle, Sihem Bouhenniche, Samuel Pélissier, Pierre Laperdrix, Clémentine Maurice, Walter Rudametkin

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文部署蜜罐站点,结合网络、HTTP和浏览器层指纹识别技术,评估六种基于LLM的网络代理绕过反机器人机制的能力,发现多层指纹可区分代理与人类及代理之间,且隐身机制反而增加可检测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28392 2026-06-30 cs.CV cs.AI cs.LG 91%

RADIANT-PET: Reasoning-Augmented PET/CT Lesion Segmentation with Large Language Models and Reinforcement Learning

RADIANT-PET:结合大语言模型和强化学习的推理增强型PET/CT病灶分割

Jiasheng Wang, Tanun Jitwatcharakomol, Piyawadee Jongpradubgiat, Simeng Zhu

机构 * Division of Hematology, The Ohio State University Comprehensive Cancer Center(血液科,俄亥俄州立大学综合癌症中心) Department of Radiology, Mahidol University(医学放射科,玛希多大学) Department of Radiology, Mettapracharak Hospital(医学放射科,Mettapracharak医院) Department of Radiation Oncology, The Ohio State University Comprehensive Cancer Center(放射肿瘤科,俄亥俄州立大学综合癌症中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出RADIANT-PET框架,通过大语言模型和强化学习对候选摄取区域进行推理分类,抑制生理性假阳性,提升PET/CT病灶分割准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29399 2026-06-30 cs.AI 90%

LLM-Guided Planning for Multi-hop Reasoning over Multimodal Nuclear Regulatory Documents

LLM引导的规划:多模态核监管文档的多跳推理

Mingyu Jeon, Bokyeong Kim, Suwan Cho, Jae Young Suh, Yonggyun Yu

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出LLM引导的规划方法,通过动态知识图谱状态和文档树工具,在多跳推理任务中实现81.5%准确率,显著优于无状态规划方法。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond @ ICML 2026. 8 pages (main), 3 figures, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29067 2026-06-30 cs.CL 90%

ThinkProbe: Beyond Accuracy -- Structural Profiling of Open-Ended LLM Reasoning Traces via Non-Generative Thought Graphs

ThinkProbe:超越准确性——通过非生成式思维图对开放式LLM推理轨迹进行结构分析

Mohamed Amine Kerkouri, Simon D. Hernandez, Marouane Tliba, Yann Dauxais, Maha Ben-Fares, Pierre Holat

机构 * F-Initiatives Université sorbonne Paris Nord(巴黎-索邦大学 Nord)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出ThinkProbe框架,将LLM推理轨迹转化为思维图,通过非生成式管道提取五维认知特征,发现推理结构是模型级稳定属性,且结构维度对问题领域敏感。

Comments Under Review for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28409 2026-06-30 cs.AR cs.AI 90%

Evidence-Driven LLM Agent for C-to-Synthesizable-C Conversion and Verification

证据驱动的LLM智能体用于C到可综合C的转换与验证

Zhe Zhao, Hongbing Lang, Zhihan Xiao, Luke Ztz Hu, John Imoleayo Adebisi, Songping Mai

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种基于大语言模型的闭环生成-验证-诊断-修复框架,通过四阶段验证器、渐进式不匹配定位链和证据检索增强生成,将C代码转换为HLS可综合C,显著优于现有方法。

Comments 14 pages, 8 figures, submitted to IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems (TCAD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29776 2026-06-30 cs.LG cs.AI 90%

Towards Generalizable and Evidential Nuclear Magnetic Resonance-Based Molecular Structure Elucidation via Large Language Model Agent

面向可泛化与可证据的核磁共振分子结构解析:基于大语言模型智能体的方法

Zheng Fang, Chen Yang, Yusen Tan, Yunpeng Zhao, Fanjie Xu, Hongxin Xiang, Hanyu Sun, Hanyu Gao, Xiaojian Wang, Wenjie Du, Yuqiang Li, Jun Xia

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) State Key Laboratory of Precision and Intelligent Chemistry, University of Science and Technology of China(中国科学技术大学精密与智能化学国家重点实验室) State Key Laboratory of Physical Chemistry of Solid Surface, College of Chemistry and Chemical Engineering, Xiamen University(厦门大学化学系固态表面物理化学国家重点实验室) The University of Hong Kong(香港大学) Peking Union Medical College and Chinese Academy of Medical Sciences(北京协和医学院中国医学科学院) The Hong Kong University of Science and Technology(香港科技大学) Hunan University(湖南大学) AI for Science Center, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室人工智能科学中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出NMRAgent智能体,结合大语言模型、光谱分析工具和化学知识图谱,通过证据推理实现高精度、可解释的分子结构解析,在新型骨架测试集上Top-1准确率提升46.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11491 2026-06-30 cs.CL cs.AI 90%

Ontology-Guided Reverse Thinking Makes Large Language Models Stronger on Knowledge Graph Question Answering

本体引导的反向思维使大语言模型在知识图谱问答中更强

Runxuan Liu, Bei Luo, Jiaqi Li, Baoxin Wang, Ming Liu, Dayong Wu, Shijin Wang, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Beijing University of Posts and Telecommunications(北京邮电大学) Joint Laboratory of HIT and iFLYTEK(哈工大与科大讯飞联合实验室) University of Science and Technology of China(中国科学技术大学) Pengcheng Laboratory(鹏城实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Ontology-Guided Reverse Thinking框架,通过反向推理构建路径,提升大语言模型在知识图谱问答中的表现,实验表明其在WebQSP和CWQ数据集上达到最佳性能。

Comments We now public our source codes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29929 2026-06-30 cs.AI 89%

HippoSpark: An On-Demand Experience System for LLM Reasoning

HippoSpark: 一种用于LLM推理的按需经验系统

Jingyao Liu, Danling Meng, Chen Huang, Yukun Yan, Zhenghao Liu, Wenqiang Lei, See-Kiong Ng, Maosong Sun

专题命中 推理与问题求解 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 提出HippoSpark状态级经验系统,在推理过程中按需检索局部瓶颈的精确指导,在数学、科学和编程基准上优于标准提示和任务级经验基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29689 2026-06-30 cs.CL 88%

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30639 2026-06-30 cs.AI cs.CL 88%

Self-Evolving World Models for LLM Agent Planning

面向LLM智能体规划的自我进化世界模型

Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, Yang Deng

机构 * National University of Singapore(国立新加坡大学) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理学院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出WorldEvolver框架,通过情景记忆、语义记忆和选择性预见三个模块在测试时修正世界模型,提升预测准确性和下游规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29225 2026-06-30 cs.AI cs.CL 88%

PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents

PolicyGuard: 一种基于对话的子代理验证器,用于确保LLM代理遵循策略

Seongjae Kang, Taehyung Yu, Sung Ju Hwang

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出PolicyGuard子代理验证器,通过共享对话上下文、策略推理和可操作反馈,在tau²-BENCH航空数据集上使PASS4提升12个百分点,同时误拦率降低约一半。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30168 2026-06-30 cs.CV 88%

Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

潜在噪声掩码:减少多模态大语言模型中的视觉冗余

Kai Jiang, Ruishu Zhu, Siqi Huang, Hongyuan Zhang, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学和电子学(iOPEN)、西北工业大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院、中国电信(TeleAI)) Fudan University(复旦大学) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 提出Lens框架,通过轻量级LET令牌为视觉令牌评分,并注入自适应噪声抑制低相关令牌,在不改变模型结构的情况下提升多模态推理性能。

Comments 21 pages, 7 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28981 2026-06-30 cs.CY 88%

Bad company corrupts good morals: Understanding and Measuring Narrative-Induced Moral Reasoning Degradation in LLMs

坏公司败坏好道德:理解与衡量叙事引发的LLM道德推理退化

Wanying Yu, Boyang Ma, Zhibo Eric Sun, Minghui Xu, Yue Zhang

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出BreakingBad框架,系统衡量负面叙事沉浸对LLM道德推理、行为及部署风险的影响,发现叙事暴露导致道德准确率下降12%-31%,且退化具有结构性,第一人称叙事影响更强,并传播至实际部署场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29985 2026-06-30 cs.CL 87%

Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning

我们是在衡量策略还是措辞?LLM数学推理中表面多样性与方法层面多样性的差距

Sangmook Lee, Minbeom Kim, Jeonghye Kim, Dohyung Kim, Sojeong Rhee, Kyomin Jung

机构 * Seoul National University(首尔国立大学) KAIST(韩国科学技术院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出方法层面多样性概念,发现现有多样性指标无法反映策略差异,且多样性感知强化学习会降低方法多样性,直接优化方法多样性仍具挑战。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15251 2026-06-30 cs.CL 87%

The Effect of Scripts and Formats on LLM Numeracy

脚本和格式对LLM数理能力的影响

Varshini Reddy, Craig W. Schmidt, Seth Ebner, Adam Wiemerslage, Yuval Pinter, Chris Tanner

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究探讨了不同数字脚本和格式对LLM数理能力的影响,发现当输入使用不常见脚本或格式时,LLM准确性显著下降,但通过提示策略可缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30029 2026-06-30 astro-ph.IM 87%

ESOFinder: an LLM-powered tool to help users navigate ESO documentation

ESOFinder:一个基于LLM的工具,帮助用户浏览ESO文档

P. Sánchez-Sáez, C. Reinero, M. Vioque, M. Wittkowski, M. Rejkuba, M. Romaniello, A. Barnes, J. Pritchard, M. Marsset

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对ESO文档量大且多样导致用户查找困难的问题,开发了基于大语言模型和检索增强生成的ESOFinder聊天机器人,集成多类文档提供精准答案,减少幻觉,提升可靠性。

Comments Submitted to SPIE Astronomical Telescopes and Instrumentation 2026, paper number 14155-19

详情

展开后加载摘要…

URL PDF HTML 收藏