arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-27 至 2026-05-27 共收录 437 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 75 篇

2605.25480 2026-05-27 cs.CL 90%

Retrieval as Reasoning: Self-Evolving Agent-Native Retrieval via LLM-Wiki

检索即推理:通过LLM-Wiki实现自我进化的智能体原生检索

Haoliang Ming, Feifei Li, Xiaoqing Wu, Wenhui Que

机构 * Tencent Inc.(腾讯公司)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出LLM-Wiki系统,将外部知识组织为可编译、可组合、自进化的Wiki页面,通过工具调用接口实现搜索、阅读和链接跟踪操作,并引入错误簿进行持续自纠正,在多项多跳问答基准上取得最优结果。

Comments 15 pages, 3 figures, 10 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26333 2026-05-27 cs.AI 90%

Managing Uncertainty in LLM-Generated Procedural Knowledge for Virtual Laboratory Planning

管理虚拟实验室规划中LLM生成程序性知识的不确定性

Polychronis Karpodinis, Dimitris Kalles

机构 * School of Science and Technology, Hellenic Open University(希腊开放大学科学与技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM生成实验程序存在的不确定性,提出一个原型框架,通过结构化领域表示和不确定的状态转移样本提取候选程序规则,转化为显式约束并修复不确定步骤,以提升虚拟实验室规划的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13217 2026-05-27 cs.IR cs.LG 90%

LLM-guided Hierarchical Search for End-to-end Reasoning Intensive Retrieval

LLM引导的层次化搜索用于端到端推理密集型检索

Nilesh Gupta, Wei-Cheng Chang, Ngot Bui, Cho-Jui Hsieh, Inderjit S. Dhillon

机构 * UT Austin(得克萨斯大学) UCLA(加州大学洛杉矶分校) Google(谷歌)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出LATTICE,一种无需嵌入模型的LLM引导层次化搜索方法,通过LLM构建搜索索引并校准路径聚合遍历,在推理密集型基准上达到与最优微调集成基线相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21305 2026-05-27 cs.SI 89%

LLM-Supported Content Analysis of Motivated Reasoning on Climate Change

LLM支持的气候变化动机推理内容分析

Yuheun Kim, Qiaoyi Liu, Jeff Hemsley

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究利用大语言模型对YouTube评论进行定性标注,结合社会网络分析和线性混合效应模型,发现气候变化讨论中不同话题的互动模式差异反映了动机推理。

Comments 11 pages, 3 figures. Accepted for ASIS&T 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27293 2026-05-27 cs.LG stat.ML 89%

BASIS: Batchwise Advantage Estimation from Single-Rollout Information Sharing for LLM Reasoning

BASIS: 基于单次采样信息共享的批量优势估计用于LLM推理

Shijin Gong, Erhan Xu, Kai Ye, Francesco Quinzan, Giulia Livieri, Chengchun Shi

机构 * University of Science and Technology of China(中国科学技术大学) London School of Economics and Political Science(伦敦政治经济学院) University of Oxford(牛津大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出BASIS算法,通过单次采样和批次内信息共享改进价值函数估计,在减少计算开销的同时提升策略优化性能。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27146 2026-05-27 cs.CL 89%

Learning to Predict Future-Aligned Research Proposals with Language Models

学习用语言模型预测未来对齐的研究提案

Heng Wang, Pengcheng Jiang, Jiashuo Sun, Zhiyi Shi, Haofei Yu, Jiawei Han, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);prompting(abstract)

AI总结 本文提出将研究提案生成重构为时间切片科学预测问题,通过未来对齐分数(FAS)评估模型能否预测截止时间后发表的论文方向,并构建时间一致数据集和推理轨迹进行训练,实验表明未来对齐微调显著提升提案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19450 2026-05-27 cs.CR cs.AI 88%

Red-Teaming Claude Opus and ChatGPT-based Security Advisors for Trusted Execution Environments

对基于Claude Opus和ChatGPT的TEE安全顾问进行红队测试

Kunal Mukherjee, Spandan Mukherjee

机构 * Virginia Tech(弗吉尼亚理工大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对TEE安全顾问角色下的LLM助手(ChatGPT-5.2和Claude Opus-4.6),提出TEE-RedBench评估方法,发现提示诱导的失败可跨模型迁移(最高12.02%),并通过LLM-in-the-loop流水线减少80.62%的失败。

Comments Accepted for publication in ACM CAIS '26 Workshop on AI Discovery in the Wild (AID-Wild)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26174 2026-05-27 cs.SE cs.AI cs.CL cs.MA 88%

A Universal Cliff and a Design Fingerprint: Cross-Section Defect Detection Under LLM Orchestration

一个通用悬崖与一个设计指纹:LLM编排下的跨段缺陷检测

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry(刑事精神病研究机构) Sex Offender Medical Center(性犯罪医疗中心) Department of Neuropsychiatry, Graduate School of Medicine, Kyoto University(京都大学医学研究生院神经精神病学部门)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究揭示在LLM编排下,所有模型检测跨段矛盾缺陷的能力大幅下降(检测率降低三分之二以上),并发现不同对齐范式下的模型行为差异,其中一家开发商的模型随对齐增强呈现报告标准偏移。

Comments 24 pages, 2 figures. Data and code: doi:10.5281/zenodo.20372696

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26720 2026-05-27 cs.AI 87%

Towards Feedback-to-Plan Decisions for Self-Evolving LLM Agents in CUDA Kernel Generation

面向CUDA内核生成中自进化LLM代理的反馈到计划决策

Yee Hin Chong, Jiaming Wu, Youhui Zhang, Peng Qu

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology, Beijing, China(北京信息科学国家研究中心)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过轨迹冻结和选择性反馈注入,提出CUDAnalyst框架以归因规划决策对反馈组件的贡献,揭示显式规划仅在反馈对齐时有效,且有效规划源于结构化多反馈交互。

Comments ICML 2026 accpeted, camera-ready in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26405 2026-05-27 cs.CL 87%

Towards Just-in-Time Adaptive Feedback: Enhancing Student Learning via Knowledge-Grounded LLM

面向即时自适应反馈:通过知识增强的大语言模型提升学生学习

Younghun Lee, Amir Bralin, Nobel Sanjay Rebello, Dan Goldwasser

机构 * Department of Computer Science(计算机科学系) Department of Physics and Astronomy(物理与天文学系) College of Education(教育学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一个框架,利用领域专家知识增强大语言模型,在真实教学场景中提供即时自适应反馈,并在大规模大学课程中提升学生成绩超过80%。

Comments 8 pages, Accepted to 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13770 2026-05-27 eess.IV cs.LG 87%

NeuroMambaLLM: Dynamic Graph Learning of fMRI Functional Connectivity in Autistic Brains Using Mamba and Language Model Reasoning

NeuroMambaLLM:使用Mamba和语言模型推理的自闭症大脑fMRI功能连接的动态图学习

Yasaman Torabi, Parsa Razmara, Hamed Ajorlou, Bardia Baraeinejad

机构 * Department of Electrical and Computer Engineering, McMaster University(麦基尔大学电气与计算机工程系) Department of Biomedical Engineering, University of Southern California(南加州大学生物医学工程系) Department of Electrical and Computer Engineering, University of Rochester(罗切斯特大学电气与计算机工程系) BIOSEN Group(BIOSEN集团)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.LG

AI总结 提出NeuroMambaLLM框架,结合动态潜在图学习、选择性状态空间时序建模与冻结的大语言模型,通过低秩适应实现fMRI动态功能连接的诊断分类与临床文本报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17443 2026-05-27 cs.CL 87%

AIDG: A Formal Decomposition of Information Extraction and Containment Asymmetries in Multi-Turn LLM Dialogue

AIDG:多轮LLM对话中信息提取与包含不对称性的形式化分解

Adib Sakhawat, Fardeen Sadab, Rakin Shahriar

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出AIDG框架,将多轮对抗对话形式化为部分可观察随机博弈,分解提取与包含角色,揭示防御性能聚类而攻击性能分散等不对称性。

Comments 20 pages, 5 figures, 13 tables. Includes appendix and supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25281 2026-05-27 cs.CL cs.AI 87%

READER: Reasoning-Enhanced AI-Generated Text Detection

READER: 增强推理的AI生成文本检测

Pingfan Su, Kai Ye, Shijin Gong, Erhan Xu, Jin Zhu, Giulia Livieri, Chengchun Shi

机构 * School of Mathematics, University of Birmingham(布里斯托尔大学数学学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出READER方法,通过微调1.5B参数的LLM在结构化推理数据集READ上,结合推理与检测,在分布偏移下优于GPT-5.2等大100-1000倍的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26497 2026-05-27 cs.CR 87%

Aligning Provenance with Authorization: A Dual-Graph Defense for LLM Agents

对齐来源与授权:面向LLM智能体的双图防御

Peiran Wang, Ying Li, Yuan Tian

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出AuthGraph双图对齐防御框架,通过构建注入推理图与授权图的结构化比较,检测工具调用和参数来源级别的偏差,在AgentDojo上将攻击成功率从40%降至1%并保持76%任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00491 2026-05-27 cs.CL 86%

From Knowledge to Inference: Formalizing Specialized Public Health Reasoning on GlobalHealthAtlas

从知识到推理:形式化GlobalHealthAtlas上的专业公共卫生推理

Zhaokun Yan, Shan Xu, Wuzheng Dong, Zhaohan Liu, Lijie Feng, Chengxiao Dai, Chen Tianqi, Binfan Liu, Yunpu Ma, Wenting Wei, Yingting Li, Yi Zhang, Tongning Wu

机构 * China Academy of Information and Communications Technology(中国信息通信技术研究院) CRRC Industrial Academy Co., Ltd.(CRRC工业学院有限公司) The University of Sydney(悉尼大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Institute of Infectious Disease and Biosecurity(上海传染病与生物安全研究院) School of Public Health, Fudan University(复旦大学公共卫生学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 为解决公共卫生推理缺乏结构化监督信号和基准的问题,提出大规模多语言数据集GlobalHealthAtlas(280,210实例,15领域,17语言),并构建LLM辅助的构建与质量控制流水线及领域对齐评估器,支持安全关键型公共卫生推理的LLM训练与评估。

Journal ref ICML 2026 regular

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26827 2026-05-27 cs.CL cs.AI 84%

ContextGuard: Structured Self-Auditing for Context Learning in Language Models

ContextGuard: 语言模型中上下文学习的结构化自我审计

Hongbo Jin, Chi Wang, Haoran Tang, Zhongjing Du, Xu Jiang, Jingqi Tian, Qiaoman Zhang, Jiayu Ding

机构 * Peking University(北京大学) SCUT(上海交通大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ContextGuard框架,通过结构化自我审计机制使大语言模型在复杂上下文任务中忠实遵循所有上下文约束,包括外围、持久和格式敏感要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26655 2026-05-27 cs.CL cs.LG cs.NE 82%

Why Prompt Optimization Works, and Why It Sometimes Doesn't: A Causal-Inspired Edit-Level Analysis

为什么提示优化有效,以及为什么有时无效:一种因果启发的编辑级分析

Shuzhi Gong, Hechuan Wen

机构 * The University of Melbourne(墨尔本大学) The University of Queensland(昆士兰大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过因果推断方法分析自动提示优化在不同任务和模型上的泛化失败原因,发现编辑类型与任务特性之间的系统性交互作用。

Comments 17 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18444 2026-05-27 cs.CL cs.AI 82%

How Reliable are LLMs for Reasoning on the Re-ranking task?

LLMs在重排序任务上的推理有多可靠?

Nafis Tanveer Islam, Zhiming Zhao

机构 * Multiscale Networked Systems (MNS) Group, University of Amsterdam(多尺度网络系统(MNS)组,阿姆斯特丹大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究分析不同训练方法对LLMs在重排序任务中语义理解的影响,并探究模型能否生成更知情的文本推理以克服透明度和数据有限的挑战。

Comments This chapter has been published in Advancements in AI From Foundations to Cross-Disciplinary Applications, Springer, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27051 2026-05-27 cs.SE cs.AI 81%

ConVer: Using Contracts and Loop Invariant Synthesis for Scalable Formal Software Verification

ConVer:使用合约和循环不变式合成实现可扩展的形式化软件验证

Muhammad A. A. Pirzada, Weiqi Wang, Yiannis Charalambous, Konstantin Korovin, Lucas C. Cordeiro

机构 * The University of Manchester(曼彻斯特大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种自上而下的组合验证工具ConVer,利用大语言模型合成函数合约,并通过CEGAR-CEGIS循环迭代精炼合约,以解决大规模C程序形式化验证中的状态空间爆炸问题。

Comments 12 pages; 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16000 2026-05-27 cs.SI cs.AI cs.DL 81%

CitePrism: Human-in-the-Loop AI for Citation Auditing and Editorial Integrity

CitePrism:面向引文审计与编辑完整性的人机协同AI

Gowrika Mahesh, Budanur Madappa Darshan Gowda, Kavana Gopladevarahalli Papegowda, Prajwal Basavaraj, Binh Vu, Swati Chandna, Mehrdad Jalali

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出CitePrism框架,结合LLM推理、嵌入相似度、元数据验证和人工审核,实现稿件级引文审计,初步验证显示可辅助编辑筛选不相关引文。

Comments 30 pages, 5 main figures, 3 tables, appendices with interface screenshots and implementation details; pilot-stage framework and single-manuscript validation study

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20020 2026-05-27 cs.CV cs.AI 81%

Detached Skip-Links and $R$-Probe: Decoupling Feature Aggregation from Gradient Propagation for MLLM OCR

分离跳跃链接与$R$-探针:解耦特征聚合与梯度传播用于MLLM OCR

Ziye Yuan, Ruchang Yao, Chengxin Zheng, Yusheng Zhao, Daxiang Dong, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,PKU-Anker LLM实验室,软件与硬件协同人工智能系统北京重点实验室,北京大学,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) Baidu Inc, Beijing, China(百度公司,北京,中国)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在OCR任务中因梯度干扰导致细粒度视觉信息丢失的问题,提出分离跳跃链接(Detached Skip-Links)以解耦前向特征聚合与反向梯度传播,并引入$R$-探针($R$-Probe)诊断视觉令牌的可重构性,从而提升OCR及通用多模态任务性能。

Comments Accepted by ICML 2026. Ziye Yuan and Ruchang Yao contributed equally to this work (co-first authors, listed in random order)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26733 2026-05-27 cs.LG cs.AI 81%

Stabilizing Recurrent Dynamics for Test-Time Scalable Latent Reasoning in Looped Language Models

循环语言模型中测试时可扩展潜在推理的稳定循环动力学

Xiao-Wen Yang, Ziyu Han, Xi-Hua Zhang, Wen-Da Wei, Jie-Jing Shao, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,南京,中国) School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,南京,中国) School of Intelligence Science and Technology, Nanjing University, Nanjing, China(智能科学与技术学院,南京大学,南京,中国)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出STARS训练框架,通过雅可比谱半径正则化约束潜在状态趋近渐近稳定不动点,解决循环语言模型深度递归时性能崩溃问题,实现可靠的测试时扩展并提升峰值性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26543 2026-05-27 cs.AI cs.LG 81%

PolyFusionAgent: A Multimodal Foundation Model and Autonomous AI Assistant for Polymer Property Prediction and Inverse Design

PolyFusionAgent: 用于聚合物性能预测和逆向设计的多模态基础模型与自主AI助手

Manpreet Kaur, Xingying Zhang, Qian Liu

机构 * Department of Applied Computer Science, The University of Winnipeg(应用计算机科学系,温尼伯大学) Department of Mechanical Engineering, University of Manitoba(机械工程系,曼尼托巴大学)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出PolyFusionAgent框架,结合多模态聚合物基础模型PolyFusion和工具增强的设计代理PolyAgent,通过对齐序列、拓扑、3D几何和指纹等多模态视图学习共享潜在空间,实现热物理性能预测和化学有效、结构新颖的聚合物逆向设计,并利用文献证据检索闭环设计流程。

Comments 23 pages, 5 figures, 2 tables; Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23274 2026-05-27 cs.LG cs.AI 81%

Real-Time Progress Prediction in Reasoning Language Models

推理语言模型中的实时进度预测

Hans Peter Lyngsøe Raaschou-Jensen, Constanza Fierro, Anders Søgaard

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过离散化推理轨迹训练线性探针和微调模型生成0-100%进度估计,实现推理语言模型中的实时进度预测,并在数学推理任务上达到0.161 MAE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27124 2026-05-27 cs.PL cs.SE 80%

ProDebug: An Automated Debugging System for Prolog

ProDebug:Prolog的自动化调试系统

Ricardo Brancas, Vasco Manquinho, Ruben Martins

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出结合大语言模型、频谱和变异技术的Prolog自动调试系统ProDebug,用于识别学生作业中的错误并生成修复方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27311 2026-05-27 cs.CL cs.CV 79%

Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models

Chartographer: 用于评估视觉语言模型的反事实图表生成

Yifan Jiang, Dae Yon Hwang, Jesse C. Cresswell, Freda Shi

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所) Layer 6 AI

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 提出 Chartographer 框架,通过将图表逆向工程为可执行代码并生成反事实变体,揭示视觉语言模型在图表问答中的视觉推理缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27134 2026-05-27 cs.AI 79%

Scaling, Benchmarking, and Reasoning of Vision-Language Agents for Mobile GUI Navigation

面向移动GUI导航的视觉语言模型:缩放、基准测试与推理

Heng Qu, Yike Liu, Renren Jin, Wenzong Zhang, Pengzhi Gao, Wei Liu, Jian Luan

机构 * Wuhan University(武汉大学)

专题命中 推理与问题求解 :language agent(title);language model(abstract);分类 cs.AI

AI总结 本文系统研究了视觉语言模型在移动GUI导航中的数据缩放、基准测试与推理,提出了大规模数据集HyperTrack和开源工具包GUIEvalKit,并发现基于强化学习的微调优于监督微调,尤其在域外场景中表现更佳。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26849 2026-05-27 cs.CL 77%

Uncertainty-Aware Budget Allocation for Adaptive Test-Time Reasoning

不确定性感知的自适应测试时推理预算分配

Manh Nguyen, Sunil Gupta, Hung Le

机构 * Applied Artificial Intelligence Initiative(应用人工智能计划)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出不确定性感知预算分配(UAB)框架,通过基于每问题不确定性的凹整数优化重新分配固定采样预算,无需额外推理成本,在多个推理基准上提升准确率高达3-5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26537 2026-05-27 cs.CL 77%

Conceptual Steganography

概念隐写术

Zhejian Zhou, Jonathan May

机构 * University of Southern California Information Sciences Institute(南加州大学信息科学研究所)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出概念隐写术,通过思维链中的高级推理行为模式而非词汇选择嵌入信息,实验表明其对释义防御比标准关键词方法更鲁棒,且不影响推理效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20690 2026-05-27 cs.AI 77%

Declarative Data Services: Structured Agentic Discovery for Composing Data Systems

声明式数据服务:用于组合数据系统的结构化智能体发现

Shanshan Ye, Duo Lu

机构 * Northeastern University(东北大学) Brown University(布朗大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI

AI总结 提出声明式数据服务(DDS)架构,通过分层类型契约将全局搜索分解为有界子搜索,解决无界智能体发现无法稳定收敛的问题,并在交易后端工作负载上验证其有效性。

Comments Accepted at AI Agents for Discovery in the Wild (AID-Wild), Workshop at ACM CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏