arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11496 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1648 篇

2608.01319 2026-08-04 cs.AI 新提交 88%

Cognitive Demand Steering for Adaptive Meta-Reasoning in Large Language Models

大语言模型自适应元推理的认知需求引导

John Scoville, Shengzhuang Chen, Yejin Bang, Stefan Winzeck, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤森路透基础研究部) Imperial College London(帝国理工学院)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出无需训练的元推理框架CDS,通过认知量表刻画需求,在三类大模型和六个基准上较直接调用、标准CoT分别提升21.9%、9%准确率,难数学编码任务增益显著。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28410 2026-07-31 cs.CE cs.CL q-fin.TR 新提交 88%

Can Large Language Models Execute Parent Orders?

大型语言模型能否执行父订单?

Zane Shen, Xinli Xu, Guangyi Zhang, Jialong Chen, Jinsong Zhou, Cong Chen, Guibao Shen, Dongyu Yan, Luozhou Wang, Zhen Yang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究针对算法交易的父订单执行问题,提出分层框架PACE,基于深交所数据验证其性能优于现有方法,表明LLMs可辅助人类交易者执行决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28077 2026-07-31 cs.CL 新提交 88%

LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models

LEEPS:用于大语言模型中高效RLVR的潜在引导探索-利用提示采样

Shuang Liang, Haoyang Zhou, Yifan Gong, Guowei Wang, Xiting Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 LEEPS是一种潜在引导探索-利用提示采样器,通过自适应分配rollout预算等方式优化提示采样,在6个数学推理基准和3个OOD通用推理基准上均取得最优性能,且训练开销较小。

Comments 15pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23944 2026-07-28 cs.AI 新提交 88%

DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models

DICA:多模态大语言模型中的双指标引导对比对齐

Hao Yang, Jin Wang, Xuejie Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18260 2026-07-22 cs.AI 新提交 88%

FindStatBench: Evaluating Large Language Models on Combinatorial Code Synthesis

FindStatBench:在组合代码合成上评估大语言模型

Soham Dan

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 介绍用于评估大语言模型组合代码合成能力的FindStatBench基准,涵盖多种合成任务,通过特定方式评分并评估11个系统,发现开源闭源系统准确率趋同、示例可能有害、存在输出预算问题等,揭示统计合成与映射合成的差异及相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13881 2026-07-16 cs.CV cs.AI 新提交 88%

Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild

释放多模态大语言模型用于野外无训练的人机交互检测

Ting Lei, Jialin Liu, Zhu Xu, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 推理与问题求解 :large language model(title);language model(title);foundation model(abstract);prompting(abstract)

AI总结 该研究针对传统人机交互检测方法在开放世界和组合场景中泛化能力受限的问题,提出无训练的AgentHOI框架,利用基础模型多模态推理能力,通过上下文感知多轮推理和多方面交互定位机制,在实际场景中取得优于现有监督和弱监督方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10245 2026-07-14 cs.CL cs.IR 新提交 88%

PTEI: Integrating Personality Traits to Enhance Emotional Intelligence in Large Language Models

PTEI:在大语言模型中整合人格特质以提高情商

Amir Reza Jafari, Praboda Rajapaksha, Reza Farahbakhsh, Noel Crespi

机构 * Telecom SudParis, Institut Polytechnique de Paris(巴黎电信学院,巴黎综合理工学院) Aberystwyth University(阿伯里斯特威斯大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究针对大语言模型在复杂情感推理中不如人类的问题,提出PTEI框架,通过提取人格特质并用于人格感知提示引导模型推理,结合对比学习优化检索系统,经实验验证其能增强模型情感理解能力,与CoT推理结合可进一步提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08665 2026-07-13 cs.LG 新提交 88%

Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models

重采样还是重新路由?大语言模型的预算感知测试时模型选择

Teng-Ruei Chen

机构 * Institute of Bioinformatics and Systems Biology, National Yang Ming Chiao Tung University(国立阳明交通大学生物信息与系统生物学研究所) Krixvon(克瑞克斯冯)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 研究大语言模型测试时模型选择问题,提出预算感知测试时模型选择方法,通过在重采样和重新路由间分配预算单位最大化预期正确性,提出RoR分配策略,实验表明该策略在成本-质量方面优于多种基线。

Comments 10 pages, 3 figures. v2: corrected Phi-4 cost (14.7B) and re-ran all replays; conclusions unchanged. Code: github.com/luka-krixvon/resample-or-reroute-experiment

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05174 2026-07-07 cs.AI 新提交 88%

AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments

AgentGym2:在去理想化真实世界环境中评测大语言模型智能体

Zhiheng Xi, Dingwen Yang, Jiaqi Liu, Jixuan Huang, Honglin Guo, Baodai Huang, Tinggang Chen, Qi Zhang, Zhonghang Lu, Chenyu Liu, Jiajun Sun, Jiazheng Zhang, Dingwei Zhu, Xin Guo, Junzhe Wang, Zhihao Zhang, Yuming Yang, Junjie Ye, Minghe Gao, Dongrui Liu, Jiaming Ji, Guohao Li, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghaijiaotong University(上海交通大学) Peking University(北京大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);language agent(abstract)

AI总结 针对现有LLM智能体基准过于理想化的问题,提出去理想化评测框架AgentGym2,可全面测查智能体实操能力,实验显示当前SOTA模型仍存在明显性能缺口。

Comments Accepted as a main conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02983 2026-07-07 cs.AI 新提交 88%

Reinforcement Learning for Evidence-Seeking Diagnostic Reasoning with Large Language Models

基于强化学习的大语言模型证据寻求诊断推理

Shengyi Hua, Kangzhe Hu, Conghui He, Xiaofan Zhang, Shaoting Zhang

机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University(上海交通大学清源研究院) Shanghai Innovation Institute(上海创新院) Shanghai AI Laboratoty(上海人工智能实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 将医学诊断形式化为迭代证据寻求任务,利用带可验证奖励的强化学习,引入基于检索增强生成的检查模拟器,使大语言模型从被动响应转变为自主助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02869 2026-07-07 cs.LG 新提交 88%

Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Models

强化学习中的奖励粒度:比较用于小语言模型数学推理的过程奖励和结果奖励结构

Anagha Radhakrishna Palandye, Rebecca Glick, Osheen Kaul

机构 * New York University(纽约大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);分类 cs.LG

AI总结 研究在小语言模型中通过强化学习提升数学推理能力,系统比较五种奖励条件,发现过程奖励能显著提高准确率和推理痕迹保真度,奖励粒度是重要设计决策。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01247 2026-07-03 cs.CY cs.AI 新提交 88%

LLMs as Teaching Assistants for Mathematics Exam Grading: Reliability, and Practical Usability

LLMs作为数学考试评分的助教:可靠性与实际可用性

Aastha Sapkota, M. G. Sarwar Murshed

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 评估六种LLM配置在离散数学考试评分中的表现,发现宽松评分策略降低错误率,但点校准与排名保持仍是不同目标。

Comments 12 Pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23092 2026-06-23 cs.CL 新提交 88%

PIVOTSBench: Evaluating Fine-Grained Interpersonal Relationship Reasoning in Multimodal Large Language Models

PIVOTSBench:评估多模态大语言模型中的细粒度人际关系推理

Shuxiang Zhang, Yiting Yin, Wenxuan Song, Yuhang Wu, Miao Liu

机构 * Sun Yat-sen University(中山大学) University of Michigan(密歇根大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出PIVOTS基准,基于Social-IQ 2.0和YouTube数据,评估多模态大语言模型在心理学研究基础上预测双向人际关系维度的能力,并包含辅助任务分析关键视觉线索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22909 2026-06-23 cs.DB cs.AI cs.IR 新提交 88%

Graph-Enhanced Large Language Models for Spatial Search

用于空间搜索的图增强大型语言模型

Nicole R. Schneider, Kent O'Sullivan, Hanan Samet

机构 * University of Maryland(马里兰大学) University of Sydney(悉尼大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对大语言模型空间推理能力不足的问题,提出图增强方法,将空间数据以图形式存储并与检索增强生成结合,提升复杂空间问题回答能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21832 2026-06-23 cs.AI 新提交 88%

AgentCAT: Simulating Computerized Adaptive Testing via Multi-Agent Large Language Models

AgentCAT:通过多智能体大语言模型模拟计算机自适应测试

Weiyuan Zhou, Haiping Ma, Xiaoshan Yu, Changqian Wang, Shangshang Yang, Xingyi Zhang

机构 * Institute for Clarity in Documentation(文档清晰度研究所) Inria Paris-Rocquencourt(法国国家信息与自动化研究所巴黎-罗康库尔中心) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕默研究实验室) State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, Institute of Physical Science and Information Technology, Anhui University(光电信息获取与防护技术国家重点实验室,物理科学与信息技术学院,安徽大学) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China, the Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(认知智能国家重点实验室,中国科学技术大学,人工智能研究院,合肥综合性国家科学中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出基于大语言模型的多智能体仿真系统AgentCAT,通过考生、选题和监督三个模块模拟动态测试过程,实现能力估计与选题策略的平衡,在真实数据集上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21378 2026-06-23 cs.LG 新提交 88%

Enhancing Creativity in 3D Generative Design via a TRIZ-Inspired Text-to-CAD Framework

通过TRIZ启发的文本到CAD框架增强3D生成设计的创造力

Dongeon Lee, Leekyo Jeong, Soyoung Yoo, Sunwoong Yang, Namwoo Kang

机构 * Cho Chun Shik Graduate School of Mobility, KAIST, Daejeon, Republic of Korea(韩国科学技术院(KAIST)赵正植移动研究生院,大田,韩国) Samsung Electronics, Suwon, Republic of Korea(三星电子,水原,韩国) Department of Mechanical Engineering, Hanyang University, Ansan, Republic of Korea(汉阳大学机械工程系,安山,韩国) Narnia Labs, Daejeon, Republic of Korea(纳尼亚实验室,大田,韩国)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出TRIZ启发的文本到CAD框架,利用LLM生成可编辑CAD模型并系统探索创新设计方案,通过三阶段流程实现结构多样性与质量优化,案例显示质量减少4.0-14.7%。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20969 2026-06-23 cs.AI cs.SE 新提交 88%

AutoACSL: Synthesizing ACSL Specifications by Integrating LLMs with CPG-Based Static Analysis

AutoACSL: 通过集成LLM与基于CPG的静态分析来综合ACSL规范

Han Zhou, Yu Luo, Dianxiang Xu

机构 * University of Missouri–Kansas City(密苏里大学堪萨斯城分校) University of Central Missouri(中央密苏里大学)

专题命中 推理与问题求解 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出AutoACSL框架,结合大语言模型与代码属性图语义特征,通过反馈驱动循环自动生成可验证的ACSL规范,在604个程序上达到98%生成成功率和96%完全证明率。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18147 2026-06-17 cs.AI 新提交 88%

WEQA: Wearable hEalth Question Answering with Query-Adaptive Agentic Reasoning

WEQA: 可穿戴健康问答中的查询自适应智能推理

Yuwei Zhang, Tong Xia, Bianca Emmerich, Yu Yvonne Wu, Dimitris Spathis, Xin Liu, Daniel McDuff, Cecilia Mascolo

机构 * University of Cambridge(剑桥大学) Tsinghua University(清华大学) University College London(伦敦大学学院) Dartmouth College(达特茅斯学院) Google Research(谷歌研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 提出WEQA框架,通过LLM控制器动态组合传感器分析与预训练模型,实现可穿戴健康数据问答,在基准测试中准确率提升24%,专家评估显示实用性和临床合理性显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15598 2026-06-16 cs.AI 新提交 88%

Integrating Reasoning and Generalization in Text-to-SQL via Self-Enhanced Fine-Tuning

通过自增强微调在Text-to-SQL中整合推理与泛化

Feng Lyu, Jinfeng Cen, Sijing Duan, Hao Wu, Shucheng Li, Weixu Zhang, Haolun Wu

机构 * Central South University(中南大学) Tsinghua University(清华大学) Nanjing University(南京大学) McGill University(麦吉尔大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出CoTE-SQL方法,通过自增强推理轨迹、结构化思维链提示和错误感知修正,在开源LLM上实现Bird和Spider基准的最优性能。

Comments 14 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13197 2026-06-12 cs.AI 新提交 88%

ARMOR-MAD: Adaptive Routing for Heterogeneous Multi-Agent Debate in Large Language Model Reasoning

ARMOR-MAD:大语言模型推理中异构多智能体辩论的自适应路由

Fuqiang Niu, Bowen Zhang

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出ARMOR-MAD框架,通过辩论前协议路由、早期一致停止评估和语义异常检测,自适应控制异构多智能体辩论,提升推理准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11117 2026-06-10 cs.AR cs.AI cs.PF 新提交 88%

Towards Autonomous Accelerator Design: FPGA Accelerator Generation with SECDA

迈向自主加速器设计:基于SECDA的FPGA加速器生成

Vinamra Sharma, Xingjian Fu, Jude Haris, José Cano

机构 * School of Computing Science, University of Glasgow, Scotland, UK(格拉斯哥大学计算机科学学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出SECDA-DSE框架,集成大语言模型引导FPGA加速器设计空间探索,通过结构化探索器和LLM推理生成可综合的加速器设计,减少人工干预。

Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08976 2026-06-09 cs.AI 新提交 88%

RTL-BenchLS: A Large-Scale Benchmark for RTL Reasoning and Generation with Large Language Models

RTL-BenchLS:面向大语言模型的RTL推理与生成的大规模基准

Jing Wang, Shang Liu, Wenji Fang, Yuchao Wu, Yugao Zhu, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出大规模基准RTL-BenchLS,包含超1万个形式验证的Verilog设计,并引入三项自监督推理任务,解决现有基准规模小、任务单一的问题,评估显示当前最佳模型性能较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08501 2026-06-09 cs.CL 新提交 88%

Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models

重回正轨:在扩散大语言模型中对齐奖励与状态以进行推理

Yawen Shao, Jie Xiao, Kai Zhu, Yu Liu, Hongchen Luo, Xueyang Fu, Yang Cao, Wei Zhai, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab(通义实验室) Northeastern University(东北大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对扩散大语言模型强化学习中过程奖励与状态轨迹的双重错位问题,提出PAPO框架,通过步骤感知过程奖励和熵引导历史重演实现对齐,在四个基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08310 2026-06-09 cs.AI cs.MA 新提交 88%

To Nuke or Not to Nuke: LLMs' (Missing) Ethical Reasoning and Actions in a High-Stakes Decision-Making Simulation

核弹还是和平:大语言模型在高风险决策模拟中的(缺失的)伦理推理与行动

John Chen, Sihan Cheng, Can Gurkan, H M Abdul Fattah

机构 * University of Arizona(亚利桑那大学) Northwestern University(西北大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究LLM在复杂游戏《文明V》中自发升级核授权的现象,通过三种提示干预发现伦理推理未能可靠消除升级,识别出三种失败路径,强调需在复杂决策上下文中测试伦理推理的自发性和行为有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13581 2026-08-17 cs.HC cs.AI cs.LG 新提交 88%

From Prediction to Intervention: Personalized Meal-Level Glucose Regulation via an LLM Agent

从预测到干预:基于大语言模型智能体的个性化餐级血糖调节

Mingyu Huang, Weiqing Min, Ying Jin, Yilin Wang, Shuqiang Jiang

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 针对精准营养中个性化血糖调节的挑战,提出融合生理学习与LLM智能体的系统,通过生理感知预测器和预测驱动优化智能体提升血糖预测准确率并降低血糖波动。

Comments Accepted in ACL 2026 Findings, 17 pages, 4 figures

Journal ref Findings of the Association for Computational Linguistics ACL 2026, pages 21629 to 21645

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10441 2026-08-12 cs.LG cs.CL cs.IR 新提交 88%

Detecting an Effect Is Not Learning to Act on It: A Reward-SNR Floor for LLM Acquisition Agents

检测到效应不等同于学习基于该效应行动:LLM获取智能体的奖励信噪比下限

Ying Yuan

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 该研究指出检测信号平均效应与学习基于该效应行动存在差异,提出奖励信噪比下限,引入SHE模型,在三个推荐数据集上发现学习获取策略失效,因数据集SNR低于下限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09867 2026-08-11 cs.CR cs.AI cs.LG 新提交 88%

Stealing Reasoning Traces from Proprietary LLM APIs

从专有大语言模型API窃取推理轨迹

Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现专有LLM API的加密推理轨迹存在跨会话、用户及模型的兼容性漏洞,开发了可扩展解密越狱方法,能提取模型推理、窃取PII等,还提出了对应缓解措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09282 2026-08-11 cs.AI cs.CL 新提交 88%

ComboShoppingBench: Evaluating LLM Agents for Budget-Constrained Basket Shopping with Coupons

ComboShoppingBench:评估大型语言模型智能体在带优惠券的预算约束组合购物篮任务中的表现

Adrian Li, Kelong Mao, Yudong Guo, Heming Xia, Xinwei Yang, Lirui Luo, Jace Wong, Pu Yao, Sulong Xu, Simiu Gu

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本研究推出ComboShoppingBench组合购物基准,通过探索智能体、LLM评判者及确定性验证,发现各类LLM智能体在该基准上表现不佳,凸显其在约束感知组合购物上仍有巨大改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05810 2026-08-07 cs.AI cs.CL 新提交 88%

When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents

当自进化适得其反:针对LLM智能体中技能污染的预提交门控机制

Linfang Shang, Ming Xu, Yiding Sun, Tianle Xia, Lingxiang Hu, Lan Xu, Ning Zheng

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 该研究发现LLM智能体自进化会出现技能污染导致性能下降的不可逆问题,提出VaG预提交门控机制,可提升性能并实现技能池跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05643 2026-08-07 cs.AI cs.CL 新提交 88%

Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning

过重采样优化:大语言模型推理的测试时自校正

Ahsan Bilal, Muhammad Ahmed Mohsin, Muhammad Umer, Lena Trigg, Ali Subhan, Muhammad Ali, Dean F. Hougen

机构 * University of Oklahoma(俄克拉荷马大学) Stanford University(斯坦福大学) Universitat Pompeu Fabra(庞培法布拉大学) Air University(空军大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本文提出无验证器的广度-深度优化框架,通过迭代自我批判与校正优化采样的 LLM 推理轨迹,在多个数学推理数据集及多款开放权重模型上,较基线方法实现了推理准确率的显著提升。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏