arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-06 至 2026-08-06 共收录 353 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 15 篇

2608.04788 2026-08-06 cs.LG cs.AI cs.CL 新提交 75%

Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation

带有观测校准自蒸馏的智能体强化学习

Yi Yang, Cong Qin, Xiaodan Liu, Chishui Chen, Qing Dong, Yan Zhang, Cao Liu, Zhao Yang, Lu Pan, Jiaye Lin, Yi Feng

机构 * Meituan(美团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对智能体强化学习的混淆问题,提出OCSD方法,通过对比两类回放视图推导观测残差,在高不确定步骤调制GRPO更新,在三类任务和多模型规模上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04436 2026-08-06 cs.CV 新提交 75%

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

ToolArtist:用于智能体图像生成的工具使用统一多模态模型

Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin Hu, Jun Xu, Shuicheng Yan

机构 * RUC(中国人民大学) HKUST(GZ)(香港科技大学(广州)) NUS(新加坡国立大学) UCD(加州大学戴维斯分校)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出ToolArtist,一种全智能体图像生成模型,通过后训练UMM实现,采用RAD-GRPO方法优化,将完整开放世界图像生成过程置于智能体控制下,性能优于部分控制方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19058 2026-08-06 cs.CL 版本更新 70%

MathDebugger: Detecting and Diagnosing Errors in Synthetic Mathematical Data

MathDebugger:检测与诊断合成数学数据中的错误

Hao Liang, Meiyi Qiang, Yuying Li, Zefeng He, Xiaochen Ma, Ruichuan An, Yongzhen Guo, Zhengzhou Zhu, Bin Cui, Wentao Zhang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MathDebugger是用于评估模型检测诊断合成数学数据错误的基准,含6000个标注实例,评估发现模型在该任务上表现不足,错误类型信息可提升修正效果,为数学数据质量控制提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04196 2026-08-06 cs.RO cs.CV cs.LG 新提交 57%

SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation

SiMDex:挖掘相似的自我中心视频以实现跨 embodiment 的灵巧操作

Nie Lin, Takehiko Ohkawa, Sijin Chen, Ruoshi Wen, Zhuohang Li, Liqun Huang, Zhengming Zhu, Yiming Bao, Yunfei Li, Minjie Cai, Xiao Ma, Wei Xu, Yoichi Sato

机构 * The University of Tokyo(东京大学) ByteDance Seed(字节跳动 Seed) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 该研究提出SiMDex框架,通过三层流程从海量自我中心人类视频中挖掘与任务相关的子集,用于VLA后训练,仅用少量样本便显著提升了机器人灵巧操作的成功率,证明选择性数据整理更有效。

Comments 12 pages, 4 figures. Project page: https://lin-nie.github.io/SiMDex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05087 2026-08-06 cs.CL cs.IR 版本更新 57%

Document Optimization for Black-Box Retrieval via Reinforcement Learning

基于强化学习的黑盒检索文档优化

Omri Uzan, Ron Polonsky, Douwe Kiela, Christopher Potts

机构 * Stanford University(斯坦福大学) ContextualAI

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

AI总结 提出通过强化学习(GRPO)优化文档表示,使其与目标检索器的查询分布对齐,仅需黑盒访问检索排名,在代码和视觉文档检索任务中提升性能,使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04809 2026-08-06 cs.IR 新提交 50%

DEGR: Dual Exploration-Driven Generative Re-Ranking for Adaptive Cross-Request Context Bridging

DEGR:双探索驱动的生成重排序方法,用于自适应跨请求上下文桥接

Binglei Zhao, Xuanhua Yang, Xiwei Zhao, Sulong Xu

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 针对工业推荐系统重排序受上游供给限制的问题,提出DEGR方法,通过双探索驱动的混合优化范式实现自适应跨请求上下文桥接,在京东电商推荐系统中较SOTA方法取得UCTR最高1.22%、PV0.20%的提升。

Comments Accepted by KDD2026 ADS Track, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 21 篇

2608.04095 2026-08-06 cs.AI cs.CL 新提交 92%

FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents

FinPerMA:一种基于理论、事件驱动的LLM智能体个性化记忆基准

Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对LLM智能体个性化记忆的现有基准不足,提出FinPerMA基准,在276个角色的2994个问题上测试7种LLM,发现其记忆配置远未饱和,简单检索优于专用记忆系统且冲击后差距扩大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04020 2026-08-06 cs.CY cs.GT 新提交 91%

Artificial Institutions: How Institutional Design Shapes LLM Simulations

人工制度:制度设计如何塑造大语言模型(LLM)模拟

Maxim Chupilkin

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究LLM智能体构建的人工社会,通过控制变量实验发现,五种市场制度的规则差异会显著改变市场结果,证明制度架构对人工社会模拟的重要影响。

Comments 19 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27773 2026-08-06 cs.CL 版本更新 90%

ChronoMem: Version Control and Semantic Rollback for Large Language Model Agent Memory

ChronoMem:大语言模型智能体记忆的版本控制与语义回滚

Yongye Su, Wujiang Xu, Chaoji Zuo, Elisa Bertino

机构 * Purdue University(普渡大学) Rutgers University(罗格斯大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL

AI总结 ChronoMem是集成于Google开源智能体开发套件的语义版本控制层,首次实现LLM智能体记忆的语义全局回滚,在长周期对话基准中显著提升回滚一致的问答与历史总结性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04132 2026-08-06 cs.CV 新提交 86%

RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

RUTA:基于率-效用优化的原则性视觉令牌分配方法

Jian Zou, Xiaoyu Xu, Zhihua Wang, Yilin Wang, Balu Adsumilli, Kede Ma

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对视觉语言模型因长视觉令牌序列导致的LLM侧计算和内存成本过高问题,提出RUTA方法,仅用2.0%、4.2%的视觉令牌,分别在LLaVA-NeXT-7B、Qwen3-VL-8B上保留88.2%、94.4%的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01742 2026-08-06 cs.AI cs.CL 版本更新 84%

MemSIF: From Structured Interactions to Dual-Track Fact Memory for LLM Agents

MemSIF:从结构化交互到面向大语言模型智能体的双轨事实记忆

YuFei Luo, Xiucheng Xu, Zhen Yang

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大语言模型智能体的长期记忆问题,提出MemSIF框架,通过结构化交互记忆与双轨事实记忆缓解两种错位模式,在两个数据集上的五种主干模型中均取得最高总准确率。

Comments Submitted to AAAI 2027. 19 pages, 10 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07885 2026-08-06 cs.AI cs.LG 版本更新 82%

MemFly: On-the-Fly Memory Optimization via Information Bottleneck

MemFly: 通过信息瓶颈实现飞地内存优化

Zhenyuan Zhang, Xianzhang Jia, Zhiqin Yang, Zhenbo Song, Wei Xue, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science(香港科学与技术大学) Nanjing University of Science(南京理工大学)

专题命中 长上下文与记忆 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MemFly通过信息瓶颈原理实现LLM的飞地内存优化,采用梯度自由优化器和混合检索机制提升内存效率和多跳查询能力。

Comments Accepted by ICLR 2026 MemAgents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28750 2026-08-06 cs.SE cs.AI 版本更新 81%

DragonCrawl: A Generative, Intent-Based Framework for Scalable Mobile End-to-End Testing

DragonCrawl:一种用于可扩展移动端到端测试的生成式意图框架

Sowjanya Puligadda, Mengdie Zhang, Ali Zamani, Dhruva Dixith Kurra, Eric Chen, Juan Marcano

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DragonCrawl是基于GPT-4o多模态的移动端到端测试框架,通过验证用户流程阻止问题提交,缩短测试入门时间,节省大量维护工作量,实现规模化持续质量保证。

Comments 12 pages, 6 figures, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04893 2026-08-06 cs.CR cs.AI cs.LG 新提交 79%

When Does Latent Communication Pay? A Causal Audit of Relayed KV Caches in Multi-Agent LLMs

何时潜在通信能发挥作用?多智能体大语言模型中中继键值缓存的因果审计

Jiaming Cheng, Subhransu Das, Rajiv Ramnath

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究通过因果审计多智能体LLM的中继KV缓存,发现仅当接收方需要发送方私有信息时,潜在通信才会发挥作用,且不匹配缓存审计是验证潜在想法传输的必要手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05013 2026-08-06 cs.CL cs.AI cs.HC cs.LG cs.MA 新提交 75%

OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents

OneDayAgent:面向自主智能体的长程管控框架

Jingsheng Zheng, Xinyuan Fang, Jintian Zhang, Zhengke Gui, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 OneDayAgent是一种长程管控框架,可将开放式请求分解为子任务,在不同后端LLMs上实现最优性能,解决智能体的多类失效模式。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05095 2026-08-06 cs.AI 新提交 74%

Hierarchical Graph Memory for LLM Agents with Path-level Localization and Rewrite

面向具备路径级定位与重写能力的大语言模型智能体的分层图记忆框架HiGram

Xiawei Yue, Boran Wang, Xiaoqing Zhang, Shuxin Zheng, Ziwei Zhang

专题命中 长上下文与记忆 :LLM(title);分类 cs.AI

AI总结 本文提出具备路径级定位与重写能力的分层图记忆框架HiGram,解决扁平图记忆的无关信息多、重写效率低问题,在相关基准上提升了答案质量、令牌效率及冲突场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18199 2026-08-06 cs.CL 74%

Linear-Time and Constant-Memory Text Embeddings Based on Recurrent Language Models

基于循环语言模型的线性时间与常数内存文本嵌入

Tobias Grantner, Emanuel Sallinger, Martin Flechl

机构 * Dynatrace Research(DynaTrace研究)

专题命中 长上下文与记忆 :language model(title);分类 cs.CL

AI总结 本文提出基于循环架构的高效文本嵌入方法,通过垂直分块推理策略实现线性时间复杂度和常数内存使用,验证了Mamba2等模型在文本嵌入任务中的有效性。

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2026, pages 41459-41481

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04421 2026-08-06 cs.AI cs.LG 版本更新 73%

Trivium: Temporal Regret as a First-Class Objective for Causal-Memory Controllers

Trivium: 时间遗憾作为因果记忆控制器的一等目标

Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出将长期时间遗憾作为一等目标,与结果遗憾和认知遗憾共同构成因果记忆控制器的可证伪失败分析框架,证明时间校准偏差在对结果遗憾为零时仍线性增长,而基于持久因果日志的探测复杂度为对数级。

Comments Note on version 2 (closure). This version corrects errors in v1. The use of the term "regret'' also caused confusion because the quantities defined here are not standard comparator-based online-learning regret. Subsequent work will use "liability'' or "debt'' to be clear

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04753 2026-08-06 cs.LG 新提交 70%

Attention, Anomalies! Handling Attention Layers in Unsupervised Federated Outlier Detection

注意力,异常点!处理无监督联邦离群点检测中的注意力层

Mihailo Ilić, Miloš Savić, Vladimir Kurbalija, Mirjana Ivanović, Giancarlo Fortino, Dušan Jakovetić

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究针对联邦学习中记忆增强自编码器缺乏专用聚合技术的问题,提出新颖的引导式聚合方案,在非IID数据集上验证其对无监督异常检测的鲁棒性,可提升浅层自编码器性能并适配资源受限环境。

Comments Submitted to the 4th IEEE International Conference on Federated Learning Technologies and Applications (FLTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04746 2026-08-06 cs.CL cs.IR 新提交 70%

Caching for the Future: Scrub Jay Episodic Memory Principles for Agent Memory Systems

面向未来的缓存:用于智能体记忆系统的灌丛鸦情景记忆原理

Kartikey Singh Bhandari, Aarya Wadhwani, Dhruv Kumar, Pratik Narang

机构 * Birla Institute of Technology and Science, Pilani(比拉理工学院皮拉尼分校)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究借鉴灌丛鸦情景记忆原理,提出ScrubJay-MEM智能体记忆系统,通过类型条件时间衰减优化记忆管理,在TGT和MemoryAgentBench任务上取得优于现有方法的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04574 2026-08-06 cs.CL 新提交 70%

When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents

当记忆“说谎”:VLM智能体中空间记忆过时的实证研究

Yushi Sun, Yanjie Zhang

机构 * Tencent LIGHTSPEED(腾讯光速工作室)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究通过动态FrozenLake测试平台,探究了VLM智能体的空间记忆过时问题,发现文本可解性不代表视觉接地、信任过时记忆存在安全隐患、审核无法完全消除差距,明确了相关核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04505 2026-08-06 cs.CL 新提交 70%

K-EXAONE 2.0 Technical Report

K-EXAONE 2.0 技术报告

Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Minhyeok Jung, Doyoung Kim, Heegyu Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Byungoh Ko, Changhun Lee, Dohaeng Lee, Haeju Lee, Jinsik Lee, Kyungmin Lee, Minwoo Lee, Wonkee Lee, Sangha Park, Sungjune Park, Kwangrok Ryoo, Kijung Seo, Minju Seo, Yongwoo Song, Sejong Yang, Heuiyeen Yeen, Stanley Jungkyu Choi, Yemuk Choi, Yongchan Chun, Jiwon Ham, Dasol Hong, Sujeong Im, Kijeong Jeon, Gerrard Jeongwon Jo, Hyeongjun Jo, Yujin Jo, Jiyeon Jung, Naeun Kang, Daeseong Kim, Euisoon Kim, Hayeon Kim, Hyosang Kim, Myoungshin Kim, Unsol Kim, Youchul Kim, Chaeeun Lee, ChaeYoon Lee, Edward Hwayoung Lee, Honglak Lee, Hwansoo Lee, Minkyung Lee, Sangeun Lee, Solji Lim, Woohyung Lim, Chanwoo Moon, Jueun Mun, Jimin Park, Seojeong Park, Yongmin Park, Hyerin Seo, Donghyeon Shin, Donghyun Son, Eunyong Son, Kaehyun Um, Sihoon Yang, Chang En Yea, Sihyuk Yi, Kyungjae Yoo, Chansik Yoon

机构 * LG AI Research(LG AI研究院)

专题命中 长上下文与记忆 :foundation model(abstract);post-training(abstract);分类 cs.CL

AI总结 该报告介绍LG AI Research开发的K-EXAONE 2.0,这是一款7500亿参数的MoE多语言基础模型,经升级前代模型而来,支持25.6万token上下文,在多类评估中表现优异,以Apache 2.0许可发布,助力AI生态发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04843 2026-08-06 cs.IR 新提交 67%

MemoryCPT: An End-to-End Agent Memory Framework for Cost-Performance Trade-off

MemoryCPT:用于成本-性能权衡的端到端智能体记忆框架

Songxin Lei, Kun Ouyang, Weilin Ruan, Yuqian Wu, Zhijiang Guo, Yushi Sun, Fugee Tsung

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)

AI总结 MemoryCPT是一种端到端可训练的智能体记忆框架,通过QAD和QAR阶段优化记忆处理,在LoCoMo和LongMemEval数据集上实现了更优的成本-性能权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04407 2026-08-06 cs.LG cs.AI cs.CL 新提交 67%

MESH: Memory-Efficient Sinkhorn Optimization for Mixture-of-Experts Training

MESH:面向混合专家模型训练的内存高效Sinkhorn优化算法

Masato Fujitake

专题命中 长上下文与记忆 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对MoE训练中直接应用内存高效Sinkhorn优化不可靠的问题,提出MESH算法,在降低优化器内存占用的同时保留接近AdamW的性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02870 2026-08-06 cs.LG 版本更新 57%

Maglev: Sliding Recurrent Memory

Maglev:滑动循环记忆

Bo Liu, Qiang Liu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 长上下文与记忆 :pretraining(abstract);分类 cs.LG

AI总结 本文提出Maglev,一种带固定记忆的循环Transformer架构,通过耦合模型与记忆一致性损失实现训练可并行性,在验证损失及下游预训练基准上优于基线,参数共享可减少内存。

Comments Neural Architecture Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20661 2026-08-06 cs.AI 版本更新 57%

Calibrating Transformer Attention via Task-Space Sensitivity Feedback

从虚假焦点到真实精确:基于混淆的对抗性注意力学习在Transformer中

Yawei Liu

机构 * Chinese Academy of Sciences, Computer Network Information Center(中国科学院计算机网络信息中心)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文提出AFA机制,通过对抗性训练优化Transformer模型的注意力分布,提升情感分析任务的准确性。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04685 2026-08-06 quant-ph 新提交 50%

Quantum SWITCH-induced non-Markovianity is not entirely quantum

量子SWITCH诱导的非马尔可夫性并非完全量子

Rajeev Gangwar, Ananda G. Maity

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 本研究通过分析离散时间演化和开放量子系统动力学映射两个场景,证明量子SWITCH产生的记忆效应并非真正量子非马尔可夫性,需重新审视不定因果序框架的量子优势来源。

Comments 9 pages, 7 figures, Comments are welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 56 篇

2509.26368 2026-08-06 cs.NI 版本更新 92%

Introducing Large Language Models into the Design Flow of Time-Sensitive Networking

将大语言模型引入时间敏感网络的设计流程

Rubi Debnath, Luxi Zhao, Mohammadreza Barzegaran, Paul Pop, Sebastian Steinhorst

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 针对配置优化TSN网络的挑战,通过跨模型案例研究评估现有大语言模型能力,提出LLM辅助编排框架,介绍构建模块与管道,分析实际部署机会与局限,为评估LLM辅助TSN编排可行性提供路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12503 2026-08-06 cs.CL cs.AI 版本更新 91%

Topology-Aware Reasoning over Incomplete Knowledge Graph with Graph-Based Soft Prompting

基于拓扑的不完整知识图谱推理与图基软提示

Shuai Wang, Xixi Wang, Yinan Yu

机构 * Chalmers University of Technology and University of Gothenburg, Sweden(楚姆勒大学技术学院和哥德堡大学,瑞典) Technical University of Denmark, Kgs. Lyngby, Denmark(丹麦技术大学,基斯勒吕辛,丹麦)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于图的软提示框架,通过图神经网络编码子图生成软提示,使LLM在更丰富的结构上下文中推理,减少缺失边的影响,提升多跳KBQA性能。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04591 2026-08-06 cs.CL cs.AI 新提交 91%

When Absence Is Evidence: Evaluating Completeness-Sensitive Negative Reasoning in Large Language Models

当缺失即证据:评估大语言模型中对完整性敏感的负向推理能力

Byoungjae Min, Kennedy Edemacu, Sae-Hong Cho, Yoonhyuk Choi, Beakcheol Jang, Jong Wook Kim

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 该研究针对大语言模型的完整性敏感负向推理能力,构建CROWN-QA评估基准,发现模型存在过度闭合等问题,提示无法持续解决错误,且部分覆盖不对称性在真实文档中依然存在。

Comments 19 pages, 2 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏