arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-30 至 2026-06-30 共收录 47 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 47 篇

2606.29399 2026-06-30 cs.AI 88%

LLM-Guided Planning for Multi-hop Reasoning over Multimodal Nuclear Regulatory Documents

LLM引导的规划:多模态核监管文档的多跳推理

Mingyu Jeon, Bokyeong Kim, Suwan Cho, Jae Young Suh, Yonggyun Yu

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 提出LLM引导的规划方法,通过动态知识图谱状态和文档树工具,在多跳推理任务中实现81.5%准确率,显著优于无状态规划方法。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond @ ICML 2026. 8 pages (main), 3 figures, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28357 2026-06-30 cs.IR cs.AI 87%

ReasonRec: A Reasoning-Augmented Multimodal Agent for Unified Recommendation

ReasonRec: 一种用于统一推荐的推理增强多模态智能体

Yihua Zhang, Mingfu Liang, Jiyan Yang, Rong Jin, Wen-Yen Chen, Yiping Han, Huayu Li, Buyun Zhang, Liang Luo, Frank Shyu, Luke Simon, Sijia Liu, Tianlong Chen, Xi Liu

机构 * Meta AI Michigan State University(密歇根州立大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);planning(abstract);分类 cs.AI

AI总结 提出ReasonRec,一种基于三阶段显式推理管道的多模态推荐智能体,通过推理感知视觉指令调优、证据-视野课程学习和不确定性引导委派机制,在五个数据集上实现排名指标相对提升超30%,推理延迟降低35%。

Comments The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10342 2026-06-30 cs.CV 85%

CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates

CoSPlan: 通过场景图增量更新实现纠正式序列规划

Shresth Grover, Priyank Pathak, Akash Kumar, Yogesh S Rawat

机构 * UCF Institute of Artificial Intelligence, University of Central Florida (UCF)(中佛罗里达大学(UCF)人工智能研究所)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 CoSPlan基准测试要求视觉语言模型在初始场景到目标场景间规划视觉动作序列,通过引入错误动作检测与纠正机制,评估模型在复杂视觉任务中的能力。

Comments The 19th European Conference on Computer Vision (ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30639 2026-06-30 cs.AI cs.CL 84%

Self-Evolving World Models for LLM Agent Planning

面向LLM智能体规划的自我进化世界模型

Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, Yang Deng

机构 * National University of Singapore(国立新加坡大学) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出WorldEvolver框架,通过情景记忆、语义记忆和选择性预见三个模块在测试时修正世界模型,提升预测准确性和下游规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02734 2026-06-30 cs.AI cs.CL 84%

CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents

CostBench:评估LLM工具使用代理在动态环境中的多轮成本最优规划与适应

Jiayu Liu, Cheng Qian, Zhaochen Su, Qing Zong, Shijue Huang, Bingxiang He, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CostBench,一个以成本为中心的可扩展基准,用于评估LLM代理在动态环境中的经济推理和重新规划能力,揭示现有模型在成本感知规划方面的显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29648 2026-06-30 cs.CL cs.AI cs.LG cs.MA 82%

Hybrid Retriever Evolution for Multimodal Document Reasoning Agents

混合检索器演化:面向多模态文档推理代理

Bohan Yao, Shruthan Radhakrishna, Vikas Yadav

机构 * ServiceNow University of Washington(华盛顿大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出失败驱动的演化框架,让元代理自动学习任务代理如何协调多种检索器进行多步文档问答,实现自适应检索路由,在MMLongBench-Doc和DocBench上提升高达19.6分。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28971 2026-06-30 cs.CV 82%

Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution

自进化智能体图像恢复:通过深思熟虑的规划与直觉执行

Shuang Cui, Fan Ji, Guanglong Sun, Yufei Guo, Xiongxin Tang, Jiangmeng Li, Fanjiang Xu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Life Sciences, Tsinghua University(清华大学生命科学学院) Intelligent Science & Technology Academy of CASIC(中国科学院 CASIC 智能科学与技术学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 提出SEAR框架,将图像恢复建模为序列决策问题,采用直觉执行器与深思熟虑规划器,结合剪枝感知蒙特卡洛树搜索和自进化情景记忆,解决贪婪搜索和信息利用不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29639 2026-06-30 cs.CL cs.AI 81%

Two-Stage Prompt Optimization for Few-Shot Relation Extraction: From Reasoning-Guided Search to Gradient-Guided Refinement

两阶段提示优化用于少样本关系抽取:从推理引导搜索到梯度引导精炼

Aunabil Chakma, Mihai Surdeanu, Eduardo Blanco

机构 * University of Arizona(亚利桑那大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出两阶段框架,结合推理和梯度优化自动优化提示,在少样本关系抽取任务中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29150 2026-06-30 cs.AI 79%

Flow Reasoning Models: Scaling Reasoning Through Iterative Self-Refinement

流推理模型:通过迭代自我精炼扩展推理能力

Alec Helbling, Andrey Bryutkin, Mauro Martino, Nima Dehmamy, Hendrik Strobelt

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出流推理模型(FRMs),利用去噪动态的稳定性作为验证器,通过测试时缩放和训练改进,高效解决数独和斑马谜题等结构化推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28751 2026-06-30 cs.LG cond-mat.stat-mech 79%

A Path-Space Formulation of Prediction in World Models: From a Single Action to Prediction, Planning, and Irreversibility

世界模型中预测的路径空间表述:从单一动作到预测、规划和不可逆性

Gunn Kim

机构 * Department of Physics, Sejong University, Seoul 05006, Republic of Korea(首尔大学物理系,首尔05006,韩国)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 提出世界模型中预测的路径空间表述,将预测、规划和不确定性统一为作用泛函上的操作,并发现注意力不对称性编码了数据的不可逆性。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28692 2026-06-30 cs.AI 79%

An AI agent for treatment reasoning over a biomedical tool universe

一个在生物医学工具宇宙中进行治疗推理的AI智能体

Shanghua Gao, Ayush Noori, Richard Zhu, Curtis Ginder, Zhenglun Kong, Xiaorui Su, Justin Kauffman, Benjamin S. Glicksberg, Joshua Lampert, Ankit Sakhuja, Ashwin Sawant, ATHENA-R1 Evaluation Consortium, David A. Clifton, Noa Dagan, Ran Balicer, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) The Ivan and Francesca Berkowitz Family Living Laboratory Collaboration at Harvard Medical School and Clalit Research Institute(哈佛医学院伊万和弗朗西斯卡·伯科维茨家族生活实验室合作与克莱利研究所) Cardiovascular Division, Department of Medicine, Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院心脏病学部,布里格姆和妇女医院) The Windreich Department of Artificial Intelligence and Human Health, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院人工智能与人类健康系) The Hasso Plattner Institute for Digital Health at Mount Sinai, Icahn School of Medicine at Mount Sinai and Mount Sinai Health System(西奈山伊坎医学院和西奈山医疗系统数字健康研究所) Mindich Child Health and Development Institute and the Departments of Pediatrics and Genetics & Genomic Sciences, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院Mindich儿童健康与发展研究所及儿科学和遗传学与基因组科学系) Mount Sinai Fuster Heart Hospital, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院Fuster心脏医院) Mount Sinai AI Assurance Lab, Mount Sinai Health System(西奈山医疗系统AI保证实验室) Institute for Critical Care Medicine, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院重症监护医学研究所) Department of Medicine, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院医学系) ATHENA-R1 Evaluation Group(ATHENA-R1评估组)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ATHENA-R1智能体,通过强化学习在212种生物医学工具上训练,实现迭代证据收集的治疗推理,在多个基准上超越现有模型,准确率达94.7%。

Comments Project page: https://athena.openscientist.ai Code: https://github.com/mims-harvard/ATHENA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30613 2026-06-30 cs.RO 78%

Sequential Planning via Anchored Robotic Keypoints

基于锚定机器人关键点的顺序规划

Bryce Grant, Aryeh Rothenberg, Logan Senning, Zonghe Chua, Zach Patterson, Peng Wang

机构 * Department of Electrical, Computer, and Systems Engineering(电气、计算机与系统工程系) Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)

专题命中 规划推理 :planning(title,abstract)

AI总结 提出SPARK,一种无训练神经符号操作系统,通过单一Gemini调用生成类型化行为树,结合SAM3的替代提示检测和恢复循环,在LIBERO-PRO上达到43.7%,超越CaP-Agent0和VLA基线。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28981 2026-06-30 cs.CY 78%

Bad company corrupts good morals: Understanding and Measuring Narrative-Induced Moral Reasoning Degradation in LLMs

坏公司败坏好道德:理解与衡量叙事引发的LLM道德推理退化

Wanying Yu, Boyang Ma, Zhibo Eric Sun, Minghui Xu, Yue Zhang

专题命中 规划推理 :reasoning(title,abstract)

AI总结 本研究提出BreakingBad框架,系统衡量负面叙事沉浸对LLM道德推理、行为及部署风险的影响,发现叙事暴露导致道德准确率下降12%-31%,且退化具有结构性,第一人称叙事影响更强,并传播至实际部署场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28566 2026-06-30 cs.IR 78%

R$^2$-Searcher: Calibrating Retrieval and Reasoning Boundaries for Agentic Search

R$^2$-Searcher:校准智能搜索中的检索与推理边界

Sheng Zhang, Junyi Li, Wenlin Zhang, Xiaowei Qian, Yichao Wang, Yingyi Zhang, Maolin Wang, Yong Liu, Xiangyu Zhao

专题命中 规划推理 :reasoning(title,abstract)

AI总结 提出R$^2$-Searcher框架,通过细粒度查询令牌引导的证据建模和检索后反思,校准检索与推理边界,在多跳问答基准上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09620 2026-06-30 cs.RO cs.SY eess.SY 新提交 78%

Motion planning for hundreds of floating robots

数百个浮动机器人的运动规划

Jan Kamm, Antonio Terpin, Raffaello D'Andrea, Aswin Ramachandran

机构 * Institute for Dynamic Systems and Control, ETH Zürich(苏黎世联邦理工学院动态系统与控制研究所)

专题命中 规划推理 :planning(title,abstract)

AI总结 针对大型浮动机器人编队的无碰撞运动规划问题,提出一种可扩展的流水线方法,通过碰撞图分解为独立子问题并行求解,在500个机器人仿真和实际演示中验证了有效性。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07913 2026-06-30 cs.RO quant-ph 78%

Multi-Agent Route Planning as a QUBO Problem

多智能体路径规划作为QUBO问题

Renáta Rusnáková, Martin Chovanec, Juraj Gazda

机构 * Department of Computers and Informatics, Faculty of Electrical Engineering and Informatics, Technical University of Košice(科希策技术大学电气工程与信息学院计算机与信息学系)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文将多智能体路径规划问题建模为QUBO问题,通过证明其NP难性并推导出编码路线效用奖励和配对重叠惩罚的二次无约束二进制优化公式,探讨了覆盖与重叠的权衡策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30627 2026-06-30 cs.LG cs.AI stat.ML 76%

Pessimism's Paradox: Conservative Offline Training Amplifies Reward Hacking During Online Adaptation in Reasoning Models

悲观的悖论:保守离线训练加剧推理模型在线适应中的奖励黑客行为

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * Horizon Research Apple Meta

专题命中 规划推理 :reasoning(title);分类 cs.AI、cs.LG

AI总结 研究发现,离线训练中越保守的DPO(高β)会压缩策略熵,降低响应多样性,反而加速在线优化中奖励模型的利用,导致更严重的奖励黑客行为。

Comments Accepted in ICML 2026 workshop on Decision-Making from Offline Datasets to Online Adaptation: Black-Box Optimization to Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03305 2026-06-30 cs.CL cs.AI cs.LG 75%

The Hidden Cost of Structured Generation in LLMs: Draft-Conditioned Constrained Decoding

结构生成在大语言模型中的隐性成本:草案条件约束解码

Avinash Reddy, Thayne T. Walker, James S. Ide, Amrit Singh Bedi

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DCCD方法,通过分步解码提升结构生成的准确性与效率,实验显示在结构推理基准中,DCCD在严格结构准确性上提升了24个百分点,且在参数效率上优于传统约束解码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29194 2026-06-30 cs.AI 74%

AI Trading's Alpha Singularity: Emergent Market Reasoning through Agent-to-Agent Self-Evolution

AI交易的阿尔法奇点:通过智能体间自我进化实现涌现性市场推理

Yuqi Li, Siyuan Liu, Bingjun Liu

专题命中 规划推理 :reasoning(title);分类 cs.AI

AI总结 提出密封联合搜索(SJS)框架,通过信息流结构条件防止过拟合,并基于Agora系统在CSI 1000上实现夏普比率+1.87,验证了评分函数与搜索联合优化的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05257 2026-06-30 cs.CL cs.AI 73%

Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions

通过增量多轮交互评估LLM代理的记忆能力

Yuanzhe Hu, Yu Wang, Julian McAuley

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MemoryAgentBench,通过多轮交互模拟记忆代理的信息积累过程,评估准确检索、测试时学习、长程理解与选择性遗忘四项核心能力。

Comments Y. Hu and Y. Wang contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20334 2026-06-30 cs.RO cs.AI cs.LG 73%

Demonstration-Free Robotic Control via LLM Agents

无需演示的机器人控制 via LLM 代理

Brian Y. Tsui, Alan Y. Fang, Tiffany J. Hwu

机构 * independent researchers(独立研究人员)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FAEA框架,利用通用大语言模型实现无需演示的机器人操控,通过迭代推理生成操控策略,在多个基准测试中取得高成功率,展示了通用代理在任务规划中的有效性。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09038 2026-06-30 cs.AI 70%

SearchSkill: Teaching LLMs to Use Search Tools with Evolving Skill Banks

SearchSkill: 教授大语言模型使用搜索工具与演进技能库

Jinchao Hu, Meizhi Zhong, Kehai Chen, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院) TikTok Inc, Beijing(字节跳动北京公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 SearchSkill通过可重用的搜索技能显式规划查询,提升开放域问答中的检索效率和推理质量,改进了知识密集型问答基准的精确匹配表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29182 2026-06-30 cs.AI cs.CL cs.LG 67%

Evidence-Informed LLM Beliefs for Continual Scientific Discovery

基于证据的LLM信念用于持续科学发现

Dhruv Agarwal, Reece Adamson, Andrew McCallum, Peter Clark, Ashish Sabharwal, Bodhisattwa Prasad Majumder

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对AutoDiscovery将惊奇视为静态量而人类惊奇是非平稳的问题,提出证据信息化的LLM信念,通过基于嵌入的检索增强生成更新先验,并修改搜索过程以避免虚假奖励,平均非平稳惊奇提高30.62%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30578 2026-06-30 cs.CL cs.LG 62%

Uncertainty-Aware Generation and Decision-Making Under Ambiguity

模糊性下的不确定性感知生成与决策

Nico Daheim, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, Technical University of Darmstadt(普遍知识处理实验室(UKP实验室),计算机科学系,达姆施塔特技术大学) National Research Center for Applied Cybersecurity ATHENE, Germany(应用网络安全国家研究中心ATHENE,德国)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 基于贝叶斯决策理论和风险规避决策,提出不确定性感知算法用于辅导和同行评审任务,通过共形预测提供策略和分数的保证,实验表明贝叶斯方法优于风险规避规则。

Comments Code available under https://github.com/UKPLab/arXiv2026-uncertainty-aware

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29490 2026-06-30 cs.LG cs.AI 62%

Reported Confidence in LLMs Tracks Commitment More Than Correctness

LLM中的报告置信度追踪承诺而非正确性

Dharshan Kumaran

机构 * Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过两阶段弃权范式,发现LLM的言语置信度预测弃权决策远优于预测答案正确性,而令牌对数概率则相反,表明言语置信度是内部承诺准备状态的行为输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28896 2026-06-30 eess.IV cs.AI cs.LG 62%

A Task-Driven and Quality-Assured Agent Framework for SAR Data Generation

面向SAR数据生成的任务驱动与质量保障智能体框架

Xuanting Wu, Fan Zhanga, Fei Ma, Ling Guan, Guochun Ma, Yongsheng Zhou

机构 * College of Information Science and Technology, Beijing University of Chemical Technology(北京化工大学信息科学与技术学院) Science and Technology on Electromagnetic Scattering Laboratory, Beijing Institute of Environmental Features(北京环境特征研究院电磁散射实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出SAGA框架,通过模式约束规划与多维度评估器,实现面向任务的SAR数据增强,提升可靠性、可复现性及下游任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06133 2026-06-30 math.OC cs.AI cs.LG 62%

LLM Serving Optimization with Variable Prefill and Decode Lengths

具有可变预填和解码长度的LLM服务优化

Meixuan Wang, Yinyu Ye, Zijie Zhou

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系) Department of Industrial Engineering and Decision Analytics, HKUST(香港科技大学工业工程与决策分析系)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究在固定KV缓存内存预算下,异构提示和响应长度的离线调度问题,提出Sorted-F算法以平衡批次大小与下游解码成本,实现常数因子近似保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07287 2026-06-30 cs.LG cs.AI 62%

Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory

具有混合情景-程序记忆的经验演化多轮工具使用智能体

Sijia Li, Yuchen Huang, Zifan Liu, Zijian Li, Jingjing fu, Lei Song, Jiang Bian, Jun Zhang, Rui Wang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出混合情景-程序记忆策略,通过动态重用部分重叠的成功经验,使多轮工具使用策略实现经验驱动的自我演化,提升多轮任务中的推理与执行效率。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03310 2026-06-30 cs.LG cs.AI 62%

Predicting Effects, Missing Distributions: Evaluating LLMs as Human Behavior Simulators in Operations Management

预测影响,缺失分布:评估LLMs作为运营管理中的人类行为模拟器

Runze Zhang, Xiaowei Zhang, Mingyang Zhao

机构 * Department of Industrial Engineering and Decision Analytics, Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文评估LLMs在运营管理中模拟人类行为的能力,通过九个实验发现LLMs能复制假设效应,但分布不匹配问题显著,轻量策略可缓解此问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30642 2026-06-30 cs.SD cs.AI 57%

LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

LeVo 2:通过层次表示建模和渐进式后训练实现稳定悦耳的歌曲生成

Shun Lei, Huaicheng Zhang, Dapeng Wu, Yaoxun Xu, Lishi Zuo, Wei Tan, Hangting Chen, Guangzheng Li, Jianwei Yu, Zhiyong Wu, Dong Yu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Tencent(腾讯) Wuhan University(武汉大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出LeVo 2混合LLM-Diffusion框架,通过层次化建模(先预测混合令牌进行语义规划,再并行预测人声和伴奏令牌)解决全曲生成中协调性与细节保真度的权衡,并引入美学引导训练策略,在主观和客观指标上超越开源基线,接近商业系统。

详情

展开后加载摘要…

URL PDF HTML 收藏