arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-27 至 2026-05-27 共收录 437 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 31 篇

2605.27117 2026-05-27 cs.AI 57%

Position: AI Safety Requires Effective Controllability

立场:AI安全需要有效可控性

Yige Li, Yunhao Feng, Jun Sun

机构 * Singapore Management University(新加坡管理大学) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出AI安全应将可控性作为首要目标,通过定义可控性、引入基准测试ControlBench并分析现有对齐机制的不足,提出以控制为中心的架构框架。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27154 2026-05-27 cs.CV 50%

Touch-R1: Reinforcing Touch Reasoning in MLLMs

Touch-R1:在多模态大语言模型中强化触觉推理

Yingxin Lai, Yafei Zhou, Fucai Zhu, Siyu Zhu, Weihao Yuan

机构 * Xiamen University(厦门大学) Great Bay University(大湾大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics(达摩机器人)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 针对触觉推理中物理属性序数性和跨传感器分布偏移的挑战,提出基于触觉接地GRPO目标训练的Touch-R1模型,在TouchReason-Bench上平均性能超过Octopi-13B和GPT-4o。

Comments Our code and data will be made public on the https://laiyingxin2.github.io/Projects

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26451 2026-05-27 cs.HC cs.CV 50%

Design First, Code Later: Aesthetically Pleasing Template-Free Slides Generation

先设计,后编码:无模板的美观幻灯片生成

Zhiyao Cui, Chenxu Wang, Shuyue Hu, Yiqun Zhang, Wenqi Shao, Qiaosheng Zhang, Zhen Wang

机构 * School of Cybersecurity, Northwestern Polytechnical University(西北工业大学网络安全学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institution(上海创新研究院) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn)

AI总结 提出DeepSlides层次化幻灯片生成流程,通过解耦设计与实现、引入SlideDesign数据集和多智能体强化学习训练范式,在无模板条件下生成高质量幻灯片。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05729 2026-05-27 cs.CV 50%

TAGRPO: Boosting GRPO on Image-to-Video Generation with Direct Trajectory Alignment

TAGRPO: 通过直接轨迹对齐提升图像到视频生成中的GRPO

Jin Wang, Jianxiang Lu, Guangzheng Xu, Comi Chen, Haoyu Yang, Linqing Wang, Peng Chen, Mingtao Chen, Zhichao Hu, Longhuang Wu, Shuai Shao, Qinglin Lu, Ping Luo

机构 * The University of Hong Kong(香港大学) Tencent Hunyuan(腾讯文心)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对图像到视频生成中GRPO优化效果不佳的问题,提出基于对比学习的TAGRPO框架,通过中间潜变量对齐高奖励轨迹并远离低奖励轨迹,结合记忆库提升多样性,显著优于DanceGRPO。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 17 篇

2605.26667 2026-05-27 cs.AI cs.LG 92%

MemFail: Stress-Testing Failure Modes of LLM Memory Systems

MemFail: LLM记忆系统的故障模式压力测试

Ishir Garg, Neel Kolhe, Dawn Song, Xuandong Zhao

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MemFail基准测试,通过形式化记忆系统为摘要、存储和检索三个操作并构建对抗性数据集,系统性地评估和诊断LLM记忆系统的故障模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26159 2026-05-27 cs.NI cs.CR cs.LG 92%

Device Context Protocol: A Compact, Safety-First Architecture for LLM-Driven Control of Constrained Devices

设备上下文协议:一种紧凑、安全优先的架构,用于LLM驱动的受限设备控制

Dongxu Yang

机构 * DeepLethe

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM控制受限设备的安全问题,提出设备上下文协议(DCP),通过极小的帧开销、协议层安全原语和主机端桥接,在保持低资源占用的同时有效防御幻觉和提示注入攻击。

Comments 15 pages, 5 figures. Reference implementation, Python package (pip install pydcp), and reproduction scripts at https://github.com/device-context-protocol/dcp

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26851 2026-05-27 cs.SE 91%

LLM-based Mockless Unit Test Generation for Java

基于LLM的Java无模拟单元测试生成

Qinghua Xu, Guancheng Wang, Lionel Briand, Zhaoqiang Guo, Kui Liu

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出MocklessTester方法,通过上下文增强生成和约束强制修复解决LLM生成无模拟单元测试时的幻觉问题,在Defects4J和Deps4J上显著提升覆盖率和变异得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01327 2026-05-27 cs.SE cs.CL cs.LG 90%

SWE-Adept: An LLM-Based Agentic Framework for Deep Codebase Analysis and Structured Issue Resolution

SWE-Adept:基于LLM的深度代码库分析与结构化问题解决代理框架

Kang He, Kaushik Roy

机构 * Electrical and Computer Engineering, Purdue University(电子工程与计算机工程系,普渡大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出SWE-Adept双代理框架,通过代理引导的深度优先搜索进行代码定位,结合自适应规划和结构化问题解决,在SWE-Bench上提升端到端解决率最多4.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26645 2026-05-27 cs.CL 90%

Bounded Path Context: A Controlled Study of Visible Path History in LLM-Based Knowledge Graph Question Answering

有界路径上下文:基于LLM的知识图谱问答中可见路径历史的受控研究

Xihang Shan, Ye Luo

机构 * School of Mathematical Sciences(数学科学学院) Xiamen University(厦门大学) School of Informatics(信息学院)

专题命中 长上下文与记忆 :LLM(title,title_cn);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出有界路径上下文(BPC)方法,通过将完整路径存储在符号记忆中,仅暴露最近K跳路径给关系选择提示,在WebQSP和CWQ数据集上使用Qwen3.5-9B-AWQ模型达到或超过全历史提示的性能,同时减少输入token。

Comments 13 pages, 1 figure, submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26612 2026-05-27 cs.CL 90%

LATTE: Forecasting Peer Anchored Preference Trajectories for Personalized LLM Generation

LATTE: 预测同伴锚定偏好轨迹以实现个性化LLM生成

Jinze Li, Xiaoyan Yang, Shuo Yang, Jinfeng Xu, Yue Shen, Jian Wang, Jinjie Gu, Edith Cheuk-Han Ngai

机构 * The University of Hong Kong(香港大学) Ant Healthcare, Ant Group(蚂蚁集团医疗科技部)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LATTE框架,通过预测同伴锚定的相对偏好状态来个性化冻结的大语言模型,在Amazon Reviews 2023和MemoryCD上优于检索、摘要记忆和静态潜在轮廓等方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26154 2026-05-27 cs.CR cs.AI 90%

MemMorph: Tool Hijacking in LLM Agents via Memory Poisoning

MemMorph:通过记忆投毒实现LLM代理中的工具劫持

Xuanye Zhang, Yongsen Zheng, Zhuqin Xu, Kaiyu Zhou, Bowen Shen, Haoran Ou, Tianwei Zhang, Kwok-Yan Lam

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 提出MemMorph攻击,通过向长期记忆注入少量伪装记录,诱导LLM代理自主选择攻击者偏好的工具,在多个基准测试中实现高达85.9%的攻击成功率。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26256 2026-05-27 cs.AI 88%

Personalizing Embodied Multimodal Large Language Model Agents over Long-term User Interactions

个性化具身多模态大语言模型代理在长期用户交互中的应用

Jeongeun Lee, Chanyoung Park, Dongha Lee

机构 * Yonsei University(延世大学) KAIST(韩国科学技术院)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出POLAR框架,通过多模态知识图谱记忆机制增强具身代理在长期交互中的个性化能力,显著提升多步推理和用户上下文跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26778 2026-05-27 cs.AI 83%

The Attribution Blind Spot: Detecting When Language Models Rely on Memory Rather Than Retrieved Context

归因盲点:检测语言模型何时依赖记忆而非检索到的上下文

Zhe Yu, Wenpeng Xing, Yunzhao Wei, Bo Yang, Chen Ye, Gaolei Li, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) National Fintech Evaluation Center(国家金融科技评估中心) Hangzhou Dianzi University(杭州电子科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出计算现实监控(CRM)方法,通过比较有无上下文时的内部表征差异,检测语言模型是否依赖预训练记忆而非检索到的上下文进行生成,解决了输出级监控无法识别的归因盲点问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04868 2026-05-27 cs.CL cs.AI 82%

SEAL: Self-Evolving Agentic Learning for Conversational Question Answering over Knowledge Graphs

SEAL: 面向知识图谱对话问答的自我演进智能体学习

Hao Wang, Jialun Zhong, Changcheng Wang, Zhujun Nie, Zheng Li, Shunyu Yao, Yanzeng Li, Xinchi Li

机构 * Institute of Big Data and Artificial Intelligence, China Telecom Research Institute(大数据与人工智能研究院,中国电信研究院) Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学) School of Artificial Intelligence, China University of Geosciences (Beijing)(人工智能学院,中国地质大学(北京)) Center for Cognition and Neuroergonomics, State Key Laboratory of Cognitive Neuroscience and Learning, Beijing Normal University(认知与神经工效学中心,认知神经科学与学习国家重点实验室,北京师范大学) Institute of Artificial Intelligence and Future Networks, Beijing Normal University(人工智能与未来网络研究院,北京师范大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SEAL两阶段语义解析框架,通过自我演进智能体学习解决知识图谱对话问答中的指代消解、上下文依赖和复杂逻辑推理问题,在SPICE基准上达到最先进性能。

Comments Accept by NeuroComputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27240 2026-05-27 cs.CL 81%

ENPMR-Bench: Benchmarking Proactive Memory Retrieval for Emotional Support Agents

ENPMR-Bench: 情感支持代理的主动记忆检索基准

Xing Fu, Yulin Hu, Mengtong Ji, Haozhen Li, Yixin Sun, Weixiang Zhao, Yanyan Zhao, Bing Qin

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);prompting(abstract);language agent(abstract);分类 cs.CL

AI总结 提出ENPMR-Bench基准,基于马斯洛需求层次评估情感支持代理主动推断用户潜在情感需求并检索适当记忆的能力,实验表明当前检索范式存在显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27141 2026-05-27 cs.AI 77%

VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions

VitaBench 2.0:评估长期用户交互中的个性化与主动型代理

Yuxin Chen, Yi Zhang, Zhengzhou Cai, Yaorui Shi, Zhiyuan Yao, Chenhang Cui, Jingnan Zheng, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Meituan(美团) University of Science and Technology of China(中国科学技术大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有代理基准忽视用户偏好推断与利用的问题,提出VitaBench 2.0基准,通过时间序列任务和可扩展记忆接口评估代理在长期交互中的个性化与主动性,实验表明最先进模型仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26678 2026-05-27 cs.CL 77%

NestedKV: Nested Memory Routing for Long-Context KV Cache Compression

NestedKV: 用于长上下文KV缓存压缩的嵌套内存路由

Hong Chen, Xiang Liu, Yubo Gao, Yuxuan Fan, Bo Wang, Yuanlin Chu, Yuanguo Lin, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Jimei University(集美大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出NestedKV方法,通过多时间尺度余弦异常评分和头自适应混合的免训练键缓存压缩,在长上下文任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26870 2026-05-27 cs.MA cs.AI cs.HC 70%

Persistent AI Agents in Academic Research: A Single-Investigator Implementation Case Study

学术研究中的持久性AI智能体:单研究者实施案例研究

Anas H. Alzahrani

机构 * Department of Preventive Medicine and Public Health, Faculty of Medicine, King Abdulaziz University(预防医学与公共卫生系,医学院,国王阿卜杜勒阿齐兹大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过单研究者案例研究,分析了持久性AI智能体在真实学术环境中的架构、使用、产出和治理,发现缓存主导的工作流可能将经济单位从每token成本转向每完成工件成本。

Comments 19 pages, 2 figures, 3 main tables; supplementary appendix with 6 tables, 2 figures, and a reproducibility methods section. Describes 17 configured agents in a persistent research environment and introduces the PARE-M (Persistent Agentic Research Environment Measurement) framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01030 2026-05-27 cs.AI cs.LO cs.PL 70%

Effect-Transparent Governance for AI Workflow Architectures: Semantic Preservation, Expressive Minimality, and Decidability Boundaries

AI工作流架构的效果透明治理:语义保持、表达最小性与可判定性边界

Alan L. McCann

机构 * Mashin, Inc.(Mashin公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过机器验证的形式化方法,证明在AI工作流架构中,效果级治理可以在不降低内部计算表达性的前提下实施,并建立了治理与计算表达性正交的理论基础。

Comments 15 pages. Companion proofs: https://github.com/mashin-live/governance-proofs. Project: https://mashin.live. v2: corrected cross-reference identifiers for companion papers. License updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25002 2026-05-27 cs.CR 67%

MemMark: State-Evolution Attribution Watermarking for Agent Long-Term Memory Systems

MemMark: 面向智能体长期记忆系统的状态演化归属水印

Haobo Zhang, Xutao Mao, Guangyuan Dong, Ziwei Li, Xuanbo Su, Kaijie Chen, Jing Yang, Zheng Lin

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)

AI总结 提出MemMark水印方法,通过嵌入所有者控制的信号到潜在记忆写入决策中,实现无需日志、可见输出或可信元数据的快照归属,并在多个基准上保持记忆效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27039 2026-05-27 eess.AS cs.SD 50%

Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory

为什么它们记不住?揭示多轮声学记忆中的表征和检索瓶颈

Yang Xiao, Siyi Wang, Han Yin, Hong Jia, Vidhyasaharan Sethu, Eun-Jung Holden, Ting Dang

机构 * The University of Melbourne(墨尔本大学) KAIST(韩国科学技术院) The University of Auckland(奥克兰大学) UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文通过引入EnvMem基准,发现大型音频语言模型在多轮交互中非语音信息记忆失败的主要原因是表征轨迹漂移,而非注意力分配不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 75 篇

2506.03627 2026-05-27 cs.CL cs.AI 94%

Robustness of Prompting: Enhancing Robustness of Large Language Models Against Prompting Attacks

提示的鲁棒性:增强大型语言模型对抗提示攻击的鲁棒性

Lin Mu, Guowei Chu, Li Ni, Lei Sang, Yiwen Zhang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

AI总结 提出RoP(提示鲁棒性)策略,通过错误校正和引导两个阶段,增强LLM对输入扰动的鲁棒性,在算术、常识和逻辑推理任务上显著提升性能。

Comments Accepted by IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27013 2026-05-27 cs.AI 92%

Generating Robust Portfolios of Optimization Models using Large Language Models

使用大型语言模型生成鲁棒的优化模型组合

Eleni Straitouri, Cheol Woo Kim, Milind Tambe

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Harvard University(哈佛大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出一种利用LLM作为随机生成器和推理评估器的统一框架,生成鲁棒的优化模型组合,并保证在生成器或评估器之一与人类偏好对齐时组合中包含高质量候选模型。

Comments Accepted at the ICML 2026 LM4Plan Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01833 2026-05-27 cs.AI cs.CL 92%

Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning

先规划后行动:面向LLM推理的高层规划引导强化学习

Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Dinggen Zhang, Weida Wang, Towsif Raiyan, Benteng Chen, Qingtao Pan, Yang Ouyang, Chaoda Song, Zhiqiang Gao, Shufei Zhang, Sumon Biswas

机构 * Case Western Reserve University, Cleveland, OH, USA(凯斯西储大学) Kean University, Union, NJ, USA(凯恩大学) The Ohio State University, Columbus, OH, USA(俄亥俄州立大学) Fudan University, Shanghai, China(复旦大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The University of Hong Kong, Hong Kong, China(香港大学) North Carolina State University, Raleigh, NC, USA(北卡罗来纳州立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PTA-GRPO两阶段框架,通过高层规划引导与强化学习联合优化,提升LLM在数学和自然科学推理任务中的准确性和泛化能力。

Comments 19 pages and 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04310 2026-05-27 cs.AI 92%

EvoEmo: Towards Evolved Emotional Policies for Adversarial LLM Agents in Multi-Turn Price Negotiation

EvoEmo:面向多轮价格谈判中对抗性LLM智能体的进化情感策略

Yunbo Long, Liming Xu, Lukas Beckenbauer, Yuhan Liu, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院) TUM School of Management, Technical University of Munich(慕尼黑技术大学管理学院) The Alan Turing Institute, London, UK(伦敦阿尔安·图灵研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出EvoEmo进化强化学习框架,通过将情感状态转移建模为马尔可夫决策过程并采用种群遗传优化,动态优化多轮谈判中的情感表达,显著提升LLM智能体的谈判成功率、效率和买家节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27014 2026-05-27 cs.LO cs.AI 91%

ReasonOps: A Unified Operational Paradigm for Trustworthy Verified LLM Reasoning

ReasonOps: 可信验证的LLM推理的统一操作范式

Adnan Rashid

机构 * School of Electrical Engineering(电子工程学院) Computer Science (SEECS) National University of Sciences(计算机科学(SEECS)国家 Sciences and Technology)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ReasonOps,一种将推理视为持续监控、可验证、可靠性感知的操作过程的统一范式,整合语义解释、自动形式化、符号推理、定理证明、运行时保证、概率可靠性估计和自适应修正,以解决当前LLM推理中的逻辑不一致、幻觉符号转换等问题。

Comments 5 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03471 2026-05-27 cs.CL cs.AI 91%

EpiQAL: Benchmarking Large Language Models in Epidemiological Question Answering and Reasoning

EpiQAL:大型语言模型在流行病学问答与推理中的基准测试

Mingyang Wei, Dehai Min, Zewen Liu, Yuzhang Xie, Guanchen Wu, Ziyang Zhang, Carl Yang, Max S. Y. Lau, Qi He, Lu Cheng, Wei Jin

机构 * Emory University(埃默里大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Microsoft(微软公司)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(title);language model(title);prompting(abstract)

AI总结 提出EpiQAL基准,通过三个子集(事实回忆、多步推理、不完整信息下结论重建)评估LLM在流行病学推理中的表现,发现当前模型在多步推理上表现有限。

Comments 31 pages, 7 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26414 2026-05-27 cs.AI cs.CL cs.LG 90%

Reasoning, Code, or Both? How Large Language Models Handle Variations in Math Questions

推理、代码,还是两者兼有?大型语言模型如何处理数学问题的变化

Matthew Kutakh

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过对比链式思维推理、单次代码执行和迭代代码执行三种方法在GSM-Symbolic数据集上的表现,发现代码执行并未提升大型语言模型在数学问题变体上的推理鲁棒性。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26823 2026-05-27 cs.CL 90%

Generating Logically Consistent Synthetic Supply Chain Data with LLM-Driven Knowledge Graph Reasoning

基于LLM驱动知识图谱推理生成逻辑一致的合成供应链数据

Yunbo Long, Ge Zheng, Liming Xu, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 针对合成供应链数据需保持操作逻辑一致性的问题,提出TabKG框架,通过构建列关系知识图谱并利用多LLM集成验证关系,结合潜在扩散模型生成逻辑一致的表格数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25981 2026-05-27 cs.CL 90%

When Do LLM Agents Treat Surface Noise Differently from Semantic Noise? A 68-Cell Measurement Study with a Held-Out Trace-Level Validation

LLM 代理何时对表面噪声与语义噪声做出不同处理?一项基于 68 个单元格的测量研究及留出轨迹级验证

Liyun Zhang, Jiayi Guo

机构 * School of Information and Software Engineering, UESTC(信息与软件工程学院,电子科技大学) Jacobs School of Engineering, UC San Diego(工程学院,加州大学圣地亚哥分校)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过 68 个单元格的测量实验,发现大语言模型驱动的思维链和 ReAct 代理对语义扰动(如释义、同义词)比表现扰动(如格式、重排序)更敏感,并基于留出模型和轨迹级机制分析提出了“隐蔽发散”解释。

详情

展开后加载摘要…

URL PDF HTML 收藏