arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 473 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 473 篇

2607.12447 2026-07-27 cs.LG cs.AI 版本更新 62%

The Computational Basis of Confidence in Large Language Models

大语言模型中置信度的计算基础

Dharshan Kumaran, Viorica Patraucean, Maks Ovsjanikov, Petar Veličković, Nathaniel Daw

机构 * Google DeepMind(谷歌DeepMind) École Polytechnique(巴黎综合理工学院) Princeton University(普林斯顿大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型中置信度的计算基础,利用统计决策置信度框架,通过答案 - 对数差异测试其预测特征,结果表明在多种任务中答案对数可作潜在决策变量读出,为多模态语言模型置信度提供解释并统一研究框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24668 2026-07-27 cs.CL cs.AI 版本更新 62%

InteractComp: Evaluating Search Agents With Ambiguous Queries

InteractComp:使用模糊查询评估搜索代理

Mingyi Deng, Lijun Huang, Yani Fan, Fanqi Kong, Jiayi Zhang, Fashen Ren, Jinyi Bai, Fuzhen Yang, Dayi Miao, Zhaoyang Yu, Yifan Wu, Yanfei Zhang, Fengwei Teng, Yingjia Wan, Song Hu, Yude Li, Xin Jin, Conghao Hu, Haoyu Li, Qirui Fu, Tai Zhong, Xinyu Wang, Xiangru Tang, Nan Tang, Chenglin Wu, Yuyu Luo

机构 * DeepWisdom(深智科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学) University of California, Los Angeles(加州大学洛杉矶分校) Agent Universe(智能体宇宙) McGill University(麦吉尔大学) Yale University(耶鲁大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对搜索代理缺乏处理模糊查询及交互能力的问题,引入InteractComp基准,通过目标-干扰物方法构建问题评估17个模型,发现模型存在过度自信问题,强制交互有提升,揭示交互能力停滞,该基准对评估和训练搜索代理交互能力有重要价值。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19212 2026-07-27 cs.CL cs.AI cs.CY 版本更新 62%

When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas

当伦理与收益相悖时:道德两难情境下的大语言模型智能体

Steffen Backmann, David Guzman Piedrahita, Terry Jingchen Zhang, Emanuel Tewolde, Rada Mihalcea, Bernhard Schölkopf, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究道德要求与利润激励冲突时LLMs在道德两难博弈中的行为,引入\msim评估九个模型,通过ATEs估计因果效应、分析推理轨迹,发现模型道德行为有情境脆弱性,揭示了部署风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20083 2026-07-24 cs.LG cs.AI 版本更新 62%

Co-Evolving LLM Evaluators and Policies via DynamicRubric

通过动态评分标准共同进化大语言模型评估器和策略

Beining Wang, Weihang Su, Hongtao Tian, Hao Kong, Tao Yang, Ting Yao, Qingyi Pan, Yueyue Wu, Qingyao Ai, Min Zhang, Yiqun Liu

机构 * Tsinghua University(清华大学) Tencent(腾讯)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究基于评估器反馈优化大语言模型时因策略改进导致的优化瓶颈问题,提出DynamicRubric框架,通过生成加权评分标准项实现评估器与策略共同进化,实验证明该框架提升了评估器性能及策略效果,并已成功应用于微信搜索。

Comments add online model info (approved)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16827 2026-07-23 cs.AI cs.CL 版本更新 62%

Prompt Programming for Cultural Bias and Alignment of Large Language Models

提示编程用于大型语言模型的文化偏差与对齐

Maksim Eren, Eric Michalak, Brian Cook, Johnny Seales

机构 * Information Systems and Modeling, Los Alamos National Laboratory(信息系统与建模,洛斯阿拉莫斯国家实验室) Advanced Research in Cyber Systems, Los Alamos National Laboratory(网络安全系统高级研究,洛斯阿拉莫斯国家实验室) Center for National Security and International Studies(国家安全与国际研究中心) Analytics Division, Los Alamos National Laboratory(分析部门,洛斯阿拉莫斯国家实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过提示编程优化大型语言模型的文化对齐,利用DSPy框架系统调整治文化偏差,实验表明提示优化优于传统手动提示工程,提升模型响应的可转移性与稳定性。

Comments 10 pages, pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06487 2026-07-23 cs.LG cs.AI 版本更新 62%

ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking

ArenaRL: 通过基于比赛的相对排名扩展强化学习以应对开放性智能体

Qiang Zhang, Boli Chen, Fanrui Zhang, Ruixue Ding, Shihang Wang, Qiuchen Wang, Yinfeng Huang, Haonan Zhang, Rongxiang Zhu, Pengyong Wang, Ailin Ren, Xin Li, Pengjun Xie, Jiawei Liu, Ning Guo, Jingren Zhou, Zheng-Jun Zha

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 ArenaRL通过基于比赛的相对排名机制,提升开放性智能体在复杂任务中的表现,实现效率与精度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18930 2026-07-22 cs.LG cs.AI cs.RO 版本更新 62%

Toward Learning POMDPs Beyond Full-Rank Actions and State Observability

迈向超越全秩动作和状态可观测性的POMDP学习

Seiji Shaw, Travis Manderson, Chad Kessens, Nicholas Roy

机构 * MIT Computer Science and Artificial Intelligence Lab(麻省理工学院计算机科学与人工智能实验室) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于PSR方法学习POMDP参数的方法,通过张量分解估计相似变换,实现状态划分下的转移和观察模型学习,并展示了其在不同奖励函数下的应用潜力。

Comments WAFR camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00429 2026-07-22 cs.CL cs.LG cs.MA 版本更新 62%

Node-as-Agent: Graph Agentic Network

节点即智能体:图智能体网络

Minghao Guo, Xi Zhu, Qingyue Jiao, Xiujin Liu, Haochen Xue, Chong Zhang, Shuhang Lin, Jingyuan Huang, Ziyi Ye, Yongfeng Zhang

机构 * Rutgers University(罗格斯大学) University of Liverpool(利物浦大学) Fudan University(复旦大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 研究针对图神经网络不能处理节点信息不平衡及忽略全局语义关系的局限,提出检索增强图智能体网络ReaGAN,赋予节点自主决策能力,通过智能体规划和局部 - 全局检索实现自适应消息传播,在少样本设置下性能优异。

Comments 11 pages, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14169 2026-07-21 cs.AI cs.LG 版本更新 62%

When a Verified World Model Still Loses: Play-Adequacy vs Prediction-Accuracy in LLM-Synthesized Code World Models

当经过验证的世界模型仍然失败时:大语言模型合成代码世界模型中的游戏充分性与预测准确性

Javier Aguilar Martín

机构 * AGILabs(AGILabs实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型合成的代码世界模型,发现其虽预测准确率高,但在游戏中仍失败,存在验证与正确的差距,揭示危害规律,指出更多数据无法修复,相同机制在信念推理函数上重现,表明规划世界模型充分性应基于搜索分布或游戏衡量。

Comments 41 pages, 4 figures. Code and reproduction log: https://github.com/JaviMaligno/code-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10203 2026-07-21 cs.LG cs.AI 版本更新 62%

Adaptive Compute in Latent World Models: When Depth Helps, Hurts, or Doesn't Matter

深度在组合中何时得以保留?潜在世界模型中的计算-质量机制

Achyuthan Sivasankar

机构 * New York University(纽约大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨潜在世界模型中深度在组合时的情况,用浅度惩罚ρ测试九个深度思维控制任务,发现三种机制,揭示反转机制由训练产生,其与观察/动作维度等相关,还指出任务机制受多种因素影响及相关注意事项。

Comments 15 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31693 2026-07-17 cs.IR cs.AI cs.CL 版本更新 62%

ShopX: A Foundation Model for Intent-to-Item Fulfillment in Agentic Shopping

ShopX:面向智能购物中意图到商品实现的基础模型

Jiacheng Chen, Tao Zhang, Manxi Lin, Dunxian Huang, Teng Shi, Honghao Fu, Mengyan Li, Xinming Zhang, Chenchi Zhang, Xuan Lu, Xiaoxiong Du, Haibin Chen, Shaolin Ye, Hao Chang, Xiaoqi Li, Shuwen Xiao, Yujin Yuan, Jingxuan Feng, Shaopan Xiong, Huimin Yi, Ju Huang, Qiu Shen, Ying Chen, Junjun Zheng, Xiangheng Kong, Dan Ou, Haihong Tang, Yuning Jiang, Bo Zheng

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出ShopX基础模型,通过统一意图理解、执行规划和基于语义ID的商品空间操作,解决大语言模型代理在购物中意图到商品实现的瓶颈,在淘宝生产日志任务上优于工具中介系统。

Comments The new version adds additional results and details

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00761 2026-07-17 cs.AI cs.CL 版本更新 62%

L-MARS: Legal Multi-Agent System with Agentic Search and Citation-Faithfulness Audit

L-MARS:具有协调推理和代理搜索的法律多智能体工作流

Boqin Yuan, Ziqi Wang

机构 * University of Southern California(南加州大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 规划推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 L-MARS是一种多代理检索框架,通过分解查询为结构化子问题,利用代理网络搜索获取证据,并通过验证代理过滤结果,从而在法律问答中实现高准确率。

Comments Accepted at the AI4Law Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01531 2026-07-16 cs.AI cs.LG 版本更新 62%

OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration for ARC-AGI-3

OPINE-World:基于本体错误优先的交互式探索的程序化世界建模

David Courtis, Wenhao Li, Scott Sanner

机构 * University of Toronto(多伦多大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出OPINE-World,一种在线交互学习面向对象的程序化世界模型的LLM智能体,通过本体错误度量引导探索,在ARC-AGI-3基准上无需逐游戏训练即解决20/25个游戏,动作效率达78.4。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30111 2026-07-07 cs.RO cs.AI cs.LG 版本更新 62%

Automating the Design of Embodied Agent Architectures

具身智能体架构设计的自动化

Jian Zhou, Sihao Lin, Jin Li, Shuai Fu, Gengze Zhou, Qi Wu

机构 * Australian Institute for Machine Learning, University of Adelaide, SA, Australia(澳大利亚机器学习研究所,阿德莱德大学,南澳大利亚州,澳大利亚)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出AgentCanvas运行时和KDLoop搜索过程,将架构搜索扩展到感知型具身智能体,在视觉-语言导航等任务上取得性能提升,但面临噪声、局部最优和信用分配等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24197 2026-07-07 cs.CL cs.AI 版本更新 62%

Seeing Is No Longer Believing: Frontier Image Generation Models, Synthetic Visual Evidence, and Real-World Risk

看到不再等于相信:前沿图像生成模型、合成视觉证据与现实世界风险

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang

机构 * Lead Researcher(研究员) Research Assistant(研究助理) Academic Advisor(学术顾问) Research Consultant(研究顾问)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨前沿图像生成模型带来的合成视觉证据风险,分析其对社会信任的影响,并提出多层面的控制措施以降低现实世界中的潜在危害。

Comments Technical report. 15 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15267 2026-07-07 cs.GT cs.AI cs.CL cs.CY cs.MA 版本更新 62%

CoopEval: Benchmarking Cooperation-Sustaining Mechanisms and LLM Agents in Social Dilemmas

CoopEval:社会困境中合作维持机制与LLM代理的基准测试

Emanuel Tewolde, Xiao Zhang, David Guzman Piedrahita, Vincent Conitzer, Zhijing Jin

机构 * Carnegie Mellon University Foundations of Cooperative AI Lab (FOCAL) Jinesis Lab, University of Toronto \& Vector Institute ETH Z\" u rich Max Planck Institute for Intelligent Systems, T\" u bingen, Germany

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了社会困境中合作维持机制与LLM代理的交互效果,发现重复游戏和声誉系统最有效,但合作效果随对手变化而下降,且在进化压力下更有效。

Comments Published paper at the International Conference on Machine Learning (ICML) 2026. 65 pages, 38 Figures, 8 Tables, 17 Listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08048 2026-07-07 cs.IR cs.AI cs.CL 版本更新 62%

TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance

TaoSR-AGRL:用于电子商务搜索相关性的自适应引导强化学习框架

Jianhui Yang, Yiming Jin, Pengkun Jiao, Chenhe Dong, Zerui Huang, Shaowei Yao, Xiaojiang Zhou, Dan Ou, Haihong Tang

机构 * Tsinghua University(清华大学) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Fudan University(复旦大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 电商搜索中查询-产品相关性预测很关键,现有方法有局限。提出TaoSR-AGRL框架,通过规则感知奖励塑造和自适应引导重放两大创新,提升模型推理能力,在实验中表现优于基线,已成功部署。

Comments Accepted to The Web Conference (WWW) 2026, Industry Track, Oral

Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), 2026, pp. 7955-7966

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00593 2026-07-03 cs.CL cs.AI 版本更新 62%

SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering

SPADER: 面向多答案问答的逐步同伴优势与多样性感知探索奖励

Qiming Shi, Zhaolu Kang, Yunfan Zhou, Di Weng, Yingcai Wu

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SPADER强化学习框架,通过逐步同伴优势(SPA)机制和多样性感知探索奖励,解决多答案问答中长程工具使用的细粒度信用分配与持续探索问题,实验表明在多个数据集上提升了召回率和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13059 2026-07-02 cs.LG cs.AI 版本更新 62%

Competition-Aware CPC Forecasting with Near-Market Coverage

竞争感知的CPC预测与近市场覆盖

Sebastian Frey, Edoardo Beccari, Maximilian Kranz, Nicolò Alberto Pellizzari, Ali Mete Karaman, Qiwei Han, Maximilian Kaiser

机构 * Nova School of Business and Economics(新里斯本大学商业与经济学院) University of Hamburg(汉堡大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对付费搜索中部分可观测的竞争环境,提出结合语义邻域、行为邻域和地理意向协变量的竞争感知CPC预测方法,在短期(1周)图模型降低sMAPE 15.1%,长期(6-12周)协变量增强基础模型降低sMAPE 22.5%-27.6%。

Comments 17 pages, 2 figures, 6 tables, European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML/PKDD), the code is availale at https://github.com/Sebastian-Frey/Competition-Aware-GNNs-for-TimeSeriesForecasting

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04140 2026-07-02 cs.AI cs.CL 版本更新 62%

Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs

选择性专家引导实现强化学习中有效且多样的探索

Zishang Jiang, Jinyi Han, Tingyun Li, Xinyi Wang, Sihang Jiang, Jiaqing Liang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海智能教育研究院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Ant Group(蚂蚁集团)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出MENTOR框架,仅在关键决策点提供专家引导,平衡探索的有效性与多样性,提升LLM在可验证奖励强化学习中的推理能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30719 2026-06-29 cs.LG cs.AI 版本更新 62%

When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?

何时LLMs足以作为序列RL任务的策略优化器?

Stephane Hatgis-Kessell, Emma Brunskill

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出PromptPO方法,利用LLM通过Python描述状态空间、动作空间和奖励函数,基于rollout反馈迭代生成和优化可执行策略,在多种环境中匹配或超越标准RL基线,但在细粒度连续控制任务中表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17385 2026-06-23 cs.LG cs.AI 版本更新 62%

Strengthening LLMs for Tabular Prediction with Structural Priors

利用结构先验增强LLM在表格预测中的能力

Pengxiang Cai, Zihao Gao, Wanchen Lian, Guocong Li, Jintai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出PRPO方法,通过列排列不变性和两级优势估计将表格结构先验融入LLM后训练,使8B模型在139个OpenML数据集上达到与强监督基线竞争的性能,零样本设置下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12373 2026-06-23 cs.LG cs.AI cs.SI 版本更新 62%

Policy4OOD: A Knowledge-Guided World Model for Policy Intervention Simulation against the Opioid Overdose Crisis

Policy4OOD:一种知识引导的世界模型,用于针对阿片类药物过量危机的政策干预模拟

Yijun Ma, Zehong Wang, Weixiang Sun, Zheyuan Zhang, Kaiwen Shi, Nitesh Chawla, Yanfang Ye

机构 * University of Notre Dame, South Bend, USA(南达科他大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出Policy4OOD,一种知识引导的时空世界模型,通过联合编码政策知识图谱、空间依赖和时间序列,实现政策干预的预测、反事实推理和优化,并在2019-2024年美国州级数据上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20209 2026-06-23 cs.LG cs.CL 版本更新 62%

Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning

Spark: 通过动态分支进行战略性策略感知探索以实现长周期智能体学习

Jinyang Wu, Shuo Yang, Changpeng Yang, Yuhao Shen, Shuai Zhang, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 提出Spark框架,通过关键状态动态分支实现资源高效探索,在长周期任务中以更少样本取得更高成功率和泛化能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15927 2026-06-19 cs.LG cs.AI 版本更新 62%

Enhancing Generative Auto-bidding with Offline Reward Evaluation and Policy Search

增强生成式自动出价:结合离线奖励评估与策略搜索

Zhiyu Mou, Yiqin Lv, Miao Xu, Qi Wang, Yixiu Mao, Jinghao Chen, Qichen Ye, Chao Li, Rongquan Bai, Chuan Yu, Jian Xu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对现有生成式自动出价方法无法超越静态数据集进行探索的性能瓶颈,提出AIGB-Pearl方法,通过轨迹评估器和KL-Lipschitz约束的分数最大化方案实现安全高效探索,在模拟和真实广告系统中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11837 2026-06-17 cs.CL cs.AI 版本更新 62%

EmoFSM: A Finite State Machine for Emotional Support Conversation

EmoFSM:一种用于情感支持对话的有限状态机

Yue Zhao, Qingqing Gu, Xiaoyu Wang, Teng Chen, Zhonglin Jiang, Yong Chen, Hongyan Li, Luo Ji

机构 * Geely AI Lab(吉利人工智能实验室)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 针对情感支持对话中长期满意度不足的问题,提出EmoFSM框架,利用有限状态机引导大语言模型进行规划与自我推理,在多个数据集上优于多种基线方法。

Comments 15 pages, 4 figures. PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11715 2026-06-17 cs.LG cs.CL 版本更新 62%

DICE: Diffusion Large Language Models Excel at Generating CUDA Kernels

DICE:扩散大语言模型在生成CUDA内核方面表现出色

Haolei Bai, Lingcheng Kong, Xueyi Chen, Jianmian Wang, Zhiqiang Tao, Huan Wang

机构 * Westlake University(西湖大学) Hong Kong University of Science and Technology(香港科技大学) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 提出CuKe数据集和BiC-RL训练框架,构建DICE系列扩散大语言模型(1.7B/4B/8B),在KernelBench上显著优于同类自回归和扩散模型,实现CUDA内核生成新SOTA。

Comments v2: Expanded with dLLM vs. autoregressive LLM comparisons, ablation studies, and qualitative case studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21850 2026-06-16 cs.CL cs.AI 版本更新 62%

ACC: Compiling Agent Trajectories for Long-Context Training

ACC:用于长上下文训练的代理轨迹编译

Qisheng Su, Zhen Fang, Shiting Huang, Yu Zeng, Yiming Zhao, Kou Shi, Ziao Zhang, Lin Chen, Zehui Chen, Lijun Wu, Feng Zhao

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(中科院大学科学技术大学MoE关键实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ACC,一种将代理轨迹编译为长上下文问答对的方法,通过整合多轮交互中的工具响应和环境观察,提升大语言模型的长上下文推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21312 2026-06-16 cs.DC cs.AI cs.LG 版本更新 62%

Frontier: Towards Comprehensive and Accurate LLM Inference Simulation

Frontier: 向全面且准确的LLM推理模拟迈进

Yicheng Feng, Xin Tan, Yangtao Deng, Yimin Jiang, Yibo Zhu, Hong Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Anuttacon StepFun

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Frontier,一种用于现代LLM推理服务的离散事件模拟器,通过离散化抽象和对关键运行时优化的建模,实现了对复杂工作负载的准确预测,从而在不同服务场景中提供更精确的计算、通信和内存成本预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05568 2026-06-16 cs.AI cs.CL cs.CY stat.AP 版本更新 62%

Metacognitive Myopia in Large Language Models

大型语言模型中的元认知近视

Florian Scholten, Tobias R. Rebholz, Mandy Hütter

机构 * Psychology Department, University of Tübingen(图宾根大学心理学系)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出元认知近视框架解释LLM偏见,认为信息环境中的有偏样本导致五种症状,并通过监控与控制机制近似技术缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏