arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1658 篇

2608.06922 2026-08-10 cs.AI 新提交 81%

Deal Me Maybe: The Role of Emotions in Multi-Agent Negotiation

或许与我成交:情绪在多智能体谈判中的作用

Massimiliano Luca, Apoorva Singh, Bruno Lepri

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究探讨提示条件下的情绪对LLM多智能体价格谈判的影响,发现愤怒买方成交率极低,快乐买方成交率最高但价格较差,情绪效应具有角色依赖性,引发商业中情绪条件智能体的担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06694 2026-08-10 cs.AI cs.MA 新提交 81%

A Multi-Agent Framework for Automated Coarse-Grained Molecular Dynamics of Polymers

用于聚合物自动化粗粒度分子动力学的多智能体框架

Joohee Choi, Junhyeong Lee, Seunghwa Ryu

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST))

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出CGMas多智能体框架,可自动完成聚合物粗粒度分子动力学的拓扑构建等全流程,完成27项任务,22项密度匹配度在5%内,模拟时间大幅缩短,确立了智能体式LLM用于聚合物粗粒化的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05420 2026-08-07 cs.LO cs.LG 新提交 81%

Can Open-Weight LLMs Produce Kernel-Verified Coq Proofs? A Pilot Study

开源权重大语言模型能否生成内核验证的Coq证明?一项试点研究

Ahmed Ryan, Md Erfan, Akond Ashfaque Ur Rahman, Md Rayhanur Rahman

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究在CoqStoq的100个定理上评估6种开源权重LLMs,发现仅Gemma 4等3个模型能生成Coq内核验证的证明,总体成功率3.5%,未确立模型通用排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04928 2026-08-06 cs.CL 新提交 81%

Does Out-of-Sight Equal Out-of-Mind in CoT Monitorability?

思维链可监控性中“看不见即想不到”吗?

Pedro Ferreira, Wilker Aziz, Ivan Titov

机构 * University of Amsterdam(阿姆斯特丹大学) University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL

AI总结 本研究对比显式与潜在CoT的可监控性,发现其更多取决于任务属性和模型内部访问程度,而非推理模式。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04567 2026-08-06 cs.CL 新提交 81%

STRIVE: Probing Reasoning Limits in Graded Plausibility Generation and Evaluation

STRIVE:探究分级合理性生成与评估中的推理极限

Bhiman Kumar Baghel, Anna Chrabaszcz, Tessa Warren, Michael Walsh Dickey, Haley C. Dresang, Xiang Lorraine Li

机构 * University of Pittsburgh(匹兹堡大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 STRIVE是基于LLM的框架,可联合生成评估跨越合理性类别与难度的受控事件集,实验中其优化后高质量事件集生成率达75.0%,为心理语言学研究减少手动工作量。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04439 2026-08-06 cs.SE cs.AI 新提交 81%

ExeCRE: Execution-Consistency Guided Reliability Estimation for Self-Correcting Code Generation

ExeCRE:基于执行一致性引导的自校正代码生成可靠性估计

Yiru Dong, Richong Zhang, Fanshuang Kong, Si Chen

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ExeCRE是基于执行一致性的代码可靠性估计框架,可减少自校正代码生成中的误导性反馈,提升有效性与稳定性,在GPT-5.2搭配LiveCodeBench及数学推理场景均有显著收益。

Comments 13 pages, 5 figures. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03972 2026-08-05 cs.AI 新提交 81%

ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning

ReflectRL:通过反思到直接推理从优质负轨迹中学习

Jinhe Bi, Chennan Zhou, Zengjie Jin, Aniri, Shuo Lu, Wenke Huang, Hu Cao, Xun Xiao, Zhihong Zhu, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng Chua

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 ReflectRL是一种轻量即插即用框架,将专家失败的优质负轨迹作为反思对象而非丢弃,经反思推理与策略转换,在多基准、多模型及多训练方法上以极小开销提升大语言模型推理性能。

Comments Project page: https://github.com/bibisbar/ReflectRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03468 2026-08-05 cs.AI 新提交 81%

ToolLIFT: Lifting Tool-Specific Trajectories into Function-Level Graphs for Generalizable Tool Planning

ToolLIFT:将工具特定轨迹提升为函数级图以实现可泛化的工具规划

Xiuhui You, Jiayi Luo, Zichao Shen, Qingyun Sun, Ziwei Zhang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ToolLIFT框架,通过将工具特定轨迹提升为函数级工作流图,实现了更具泛化性的工具规划,在多个基准上优于现有方法,对未见过的工具集泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01667 2026-08-04 cs.AI 新提交 81%

TCPO: Turn-Level Credit Policy Optimization

TCPO:回合级信用策略优化

Sicong Liao, Zhi Chen, Yaohua Tang

机构 * Moore Threads AI(摩尔线程人工智能)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究针对验证器引导多回合强化学习的信用分配问题,提出TCPO方法,在多类任务和模型上提升了LLM的多回合推理与智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00542 2026-08-04 cs.LG 新提交 81%

Agentic Graph Token Reasoning

智能体图令牌推理

Zhuoyi Peng, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出智能体图令牌推理,将图令牌化融入推理过程,通过三阶段训练实现,在七个图领域评估中大幅优于基线,可零样本迁移至未见领域,推动图分析向智能体范式发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28629 2026-08-03 cs.AI 新提交 81%

OpenClaw and Ollama in Agentic AI: Toward Fully Autonomous and Scalable AI Agent Systems

智能体AI中的OpenClaw与Ollama:迈向完全自主且可扩展的AI智能体系统

Konstantinos I. Roumeliotis, Ranjan Sapkota

机构 * University of the Peloponnese(伯罗奔尼撒大学) Cornell University(康奈尔大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出智能体AI的分层架构,分析OpenClaw与Ollama组成的全栈系统,验证系统集成可提升智能体能力,指出相关挑战并提供路线图,所有资源公开以支持研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26181 2026-07-30 cs.AI 新提交 81%

GoGoTB: Agentic RTL Verification with Specification-Grounded Coverage Closure

GoGoTB:基于规范驱动覆盖闭合的智能体式RTL验证

Xin Xin, Jincheng Lou, Junhui Li, Jinglin Yan, Panda Xiao, Di Wu, Haixiao Li, Weicong Lu, Weijian Fan, Xinyu Qu, Yuxiang Zhao, Min Yu, Zhixiong Di, Yibo Lin

机构 * Tencent(腾讯) School of Integrated Circuits, Peking University(北京大学集成电路学院) Southwest Jiaotong University(西南交通大学) Institute of Electronic Design Automation, Peking University(北京大学电子设计自动化研究所) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路高精尖创新中心)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GoGoTB是实现端到端验证闭合的智能体式RTL验证框架,在8个RTL设计上无需人工干预,实现100%环境生成成功率及多维度高覆盖率,优于现有方法。

Comments 9 pages, 7 figures, 3 tables. Xin Xin and Jincheng Lou contributed equally to this work and share first authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25145 2026-07-29 quant-ph cs.AI 新提交 81%

Agentic AI for Scientific Reasoning in Autonomous Quantum Sensing Experiments

用于自主量子传感实验中科学推理的智能体人工智能

Takuya Isogawa, Ryotaro Okabe, Nutdech Phadetsuwannukun, Mingda Li, Paola Cappellaro

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究围绕大语言模型智能体实现用于金刚石中NV中心自主实验的智能体人工智能工作流程,主要贡献为展示自主实验流程,引入离线基准评估智能体推理,结果表明自主实验中智能体与代码分工明确,智能体负责假设和数据评估,代码控制硬件与执行安全约束。

Comments 11 pages, 4 figures + Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24601 2026-07-28 cs.SE cs.AI cs.HC 新提交 81%

Evaluating the Impact of Explainable AI on Trust in AI-Assisted Code Review

评估可解释人工智能对人工智能辅助代码审查中信任的影响

Zhenhan Gao, Marvin Muñoz Barón, Umm-e Habiba, Daniel Graziotin, Stefan Wagner

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究可解释人工智能(XAI)对开发人员在人工智能辅助代码审查中信任的影响,通过对34名参与者的受试者内用户研究,比较不同XAI支持水平的系统,发现解释水平显著影响信任和认同,结果为可信代码审查系统设计等研究提供信息。

Comments 23 pages, 4 figures, 5 tables. To appear in Proceedings of the ACM on Software Engineering (PACMSE), Vol. 3, No. ISSTA, Article ISSTA093 (ISSTA 2026). Published under CC BY 4.0. Replication package: https://doi.org/10.5281/zenodo.21457282

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23983 2026-07-28 physics.geo-ph cs.LG 新提交 81%

HydroAgent: Formalizing Forecaster Expertise into Skill-Orchestrated Flood Forecasting Workflows

HydroAgent:将预报员专业知识形式化为技能编排的洪水预报工作流程

Qingyi Yang, Siqian Qiu, Bing Li, Xu Shan, Jia Feng, Shunan Zhou, Xudong Zhou, Tiantian Xing, Jiale Guo, Xiaoyi Dong, Gaoyu Liu, Xiaohuan Liu, Haiqing Pu, Qingwen Deng, Xun Zhang, Zhongrun Xiang, Haiyang Qian, Ying Yan, Yongkang Xu, Nuo Lei, Tianlong Jia, Baoying Shan, Carlo De Michele

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对业务洪水预报中隐性预报员专业知识难形式化等问题,提出HydroAgent框架,将大语言模型嵌入洪水预报工作流程,经实验验证其有效性,能转化隐性知识为可审核流程,辅助决策并展示规则引导语言模型推理补充物理模拟的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19653 2026-07-23 cs.SE cs.AI 新提交 81%

PerfAgent: Profiler-Guided Iterative Refinement for Repository-Level Code Optimization

PerfAgent:用于仓库级代码优化的分析器引导迭代优化

Ryan Deng, Yuanzhe Liu, Bastian Lipka, Yao Ma, Xuhao Chen, Tim Kaler, Jatin Ganhotra

机构 * Massachusetts Institute of Technology(麻省理工学院) Rensselaer Polytechnic Institute(罗切斯特理工学院) IBM(IBM公司) Michigan State University(密歇根州立大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对仓库级代码优化难题,提出PerfAgent分析器引导迭代优化方法,该方法能让编码代理找到热点并改进,在两个优化基准测试中大幅提升专家匹配补丁率,且以低成本超越基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15660 2026-07-20 cs.AI 新提交 81%

ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

ToolVerse:为智能强化学习解锁大规模环境和长时任务

Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu, Yuanzhe Shen, Chenyang Zhang, feng hong, Cao Liu, Ke Zeng

机构 * LongCat Interaction Team, Meituan(美团长猫互动团队) Peking University(北京大学) Fudan University(复旦大学) Wuhan University(武汉大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究针对LLM智能体在复杂环境中工具集成问题,提出ToolVerse框架。通过构建大规模训练环境、设计任务策略及提出新算法,经实验验证该框架能增强LLM长时工具使用能力,提升性能与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15280 2026-07-20 cs.AI 新提交 81%

GraphDx: A Cost-Aware Knowledge-Enhanced Multi-Agent Framework for Sequential Diagnosis

GraphDx:一种用于顺序诊断的成本感知知识增强多智能体框架

Shaoting Tan, Ning Liu, Yuntao Du, Shuyue Wei, Wu Shuai, Qian Li, Yanyu Xu, Wei Zhang, Lizhen Cui, Haitao Yuan

机构 * Shandong University(山东大学) Nankai University(南开大学) East China Normal University(华东师范大学) National Technological University(国立科技大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对顺序诊断中平衡诊断准确性与资源成本的问题,提出GraphDx框架。该框架通过构建特殊知识图谱及引入协作智能体实现创新,实验表明其能显著提高诊断成功率并降低测试成本,为自动临床诊断提供有效方案。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 21721-21736, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14709 2026-07-17 cs.CL 新提交 81%

Gold-Guided Programmatic Distillation for Financial Reasoning over Hybrid Tables and Text

用于混合表格和文本的金融推理的黄金引导式程序蒸馏

Yun Dong, Erica Zhao, Elana Chen

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对混合表格和文本数据的金融推理问题,基于程序蒸馏开发方法,利用黄金推导指导程序合成,经执行验证转移可靠数值推理,引入迭代恢复阶段,实验表明该框架能有效训练小模型进行可靠数值推理。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14095 2026-07-17 cs.AI 新提交 81%

HG-RAG: Hierarchy-Guided Retrieval-Augmented Generation for Structured Knowledge Graphs

HG-RAG:用于结构化知识图谱的层次引导检索增强生成

Pranav Yadav

机构 * University of California, Merced(加州大学默塞德分校)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对RAG系统在处理结构化知识推理时的不足,提出HG-RAG框架,通过在层次知识图谱上遍历为语言模型提供结构化上下文,经多规模多类型查询评估,该框架在相关推理任务中优于基线,减少幻觉并保持一致性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14049 2026-07-16 cs.AI 新提交 81%

Deep Interaction: An Efficient Human-AI Interaction Method for Large Reasoning Models

深度交互:一种用于大型推理模型的高效人机交互方法

Hefeng Zhou, Jinxuan Zhang, Jiong Lou, Yuxin Liu, Chaochao Lu, Jingjing Qu, Jie Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型推理出错时现有交互方法的问题,提出深度交互机制,可直接编辑原始响应并提炼精炼提示引导模型,在STEM任务推理中纠正成功率大幅提升,令牌使用量显著减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11696 2026-07-14 cs.AI 新提交 81%

Think Through a Bottleneck: Hourglass Reasoning for Rigorous Induction

突破瓶颈:用于严格归纳的沙漏推理

Huan Zhu

机构 * Peking University(北京大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型少样本归纳推理能力不足的问题,提出沙漏推理方法,通过在推理阶段强制实现严格上下文隔离,构建符号编码器 - 解码器。实验表明该方法在多基准测试中显著提升准确率,证实收益源于阶段隔离和初始归纳质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08700 2026-07-10 cs.CL 新提交 81%

Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution

深度研究源归因的基准测试:评估用于验证引用的前沿模型

Ethan Leung, Elias Lumer, Corey Feld, Austin Huber, Vamse Kumar Subbiah, Kevin Paul

机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S.(普华永道商业技术与创新办公室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 研究深度研究系统中引用质量校准问题,用现成LLM对1248个评分决策与黄金标准标签对比,发现较便宜模型有竞争力,校准模型是用引用评分作奖励信号的前提,校准不须最昂贵模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14948 2026-07-08 cs.SE cs.AI 新提交 81%

Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment

超越正确性:通过可扩展的智能体判断标注增强代码大模型的架构推理能力

Kirill Vasilevski, Ximing Dong, Benjamin Rombaut, Milad Soltany, Ruochen Deng, Jiahuei Lin, Arthur Leung, Dayi Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

机构 * Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) School of Computing, Queen’s University, Canada(皇后大学计算科学学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对代码大模型缺乏架构理解的问题,提出智能体判断流水线,利用强LLM作为专家架构评估的代理,通过两个判断器(ACJ和AQJ)实现可扩展标注,微调模型在SWE-bench上提升高达540%,并展现跨语言泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01465 2026-07-03 cs.AI 新提交 81%

Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows

超越下一个词预测:Atlassian工作流中工具使用代理的RLVR概念验证

Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji

机构 * Centific

专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对企业SaaS工作流中LLM因目标不匹配导致的静默失败,提出在目标环境中直接应用可验证奖励强化学习(RLVR),在五个合成Jira/Confluence环境中训练Qwen模型,将平均奖励从0.35-0.92提升至0.95-1.00。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31191 2026-07-03 cs.LG 新提交 81%

ISM:Self-Improving Strategy Memory for Continual Mathematical Reasoning

ISM:面向持续数学推理的自我改进策略记忆

Prakhar Dixit, Tim Oates

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出智能模式记忆(ISM),一种自我演进的记忆增强系统,通过从成功和失败案例中学习并维护策略模式库,在不更新模型参数的情况下提升冻结LLM在持续学习中的数学推理能力。

Comments 3rd AI for Math Workshop at ICML 2026 Forty-Third International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30987 2026-07-01 cs.CL econ.GN q-fin.EC 新提交 81%

Measuring Judgment Quality in Natural-Language Explanations: Evidence from Forecasting Tournaments

自然语言解释中的判断质量测量:来自预测锦标赛的证据

Christopher W. Karvetski, Sheldon S. Huang, Simas Kučinskas, Nadja Flechner, Jingyu Hu, Philip Tetlock, Ezra Karger

机构 * Forecasting Research Institute(预测研究所) Good Judgment Inc(Good Judgment公司) University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所) Stanford University(斯坦福大学) School of Arts and Sciences & Wharton, University of Pennsylvania(宾夕法尼亚大学文理学院与沃顿商学院) Federal Reserve Bank of Chicago(芝加哥联邦储备银行) Federal Reserve System(联邦储备系统)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出解释质量标记(EQMs),用大语言模型评分60种理论驱动的推理模式,在超过55,000个预测-理由对中预测准确性,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27397 2026-06-29 cs.MA cs.AI cs.GT 新提交 81%

SidConArena: An Environment Evaluating Agents in Open-Ended,Positive-Sum Bargaining Game

SidConArena:一个在开放、正和博弈中评估智能体的环境

Yeqi Feng, Yuxin Chen, Tianxing He

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出SidConArena基准框架,通过三阶段部分可观测随机博弈评估LLM智能体在开放、正和谈判中的经济决策能力,发现前沿模型虽表现更好但仍存在资源误估、谈判被动和长期规划不足。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27359 2026-06-26 stat.ML cs.LG 新提交 81%

When are likely answers right? On Sequence Probability and Correctness in LLMs

何时可能答案正确?关于LLM中的序列概率与正确性

Johannes Zenn, Jonas Geiping

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) AI Center Tübingen(图宾根人工智能中心) University of Tübingen(图宾根大学) IMPRS-IS(图宾根马克斯·普朗克研究所)

专题命中 推理与问题求解 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大型语言模型中序列概率与正确性的关系,发现序列概率在固定数据集内预测正确性有效,但通过改变解码方法或超参数提高概率并不稳定提升准确率,且对同一提示的多次响应中概率不是正确性的良好指标。

Comments 38 pages, including 10 pages of main text and 28 pages of appendix, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26797 2026-06-26 cs.LG 新提交 81%

Reasoning Quality Emerges Early: Data Curation for Reasoning Models

推理质量早期涌现:推理模型的数据策展

Hongyi Henry Jin, Wenhan Yang, Meysam Ghaffari, Carlos Morato, Baharan Mirzasoleiman

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出仅利用初始推理token即可识别多样且具挑战性的推理样本,通过扰动检查点评估前100个token的损失检测难题,并证明前1k token的损失模式可预测梯度相似性,在Qwen2.5-7B和Llama3.1-8B上验证,性能提升达1.7%,token效率提升91%。

Comments Accepted by ICML 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏