arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-27 至 2026-07-27 共收录 31 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 31 篇

2607.22182 2026-07-27 cs.CL cs.AI 新提交 91%

From Isolated Tasks to Structured Capabilities: A Multilayer Taxonomy for Large Language Models

从孤立任务到结构化能力:大语言模型的多层分类法

Shixin Fang, Jiachen Wo, Wenjuan Qin, Sihang Jiang, Yanghua Xiao

机构 * Fudan University(复旦大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究提出大语言模型多层分类法,含14个能力领域和91个子技能,以人类认知科学为指导。通过筛选和映射相关论文,分析研究关注情况,揭示领域及子技能分布,此分类法有助于大语言模型研究组织、评估等多方面工作。

Comments 34 pages, 5 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22082 2026-07-27 cs.MA 新提交 90%

When Language Models Meet NeuroGraphs: Exploring Enhanced Agentic LLM Framework Towards Brain Network Analysis

当语言模型遇上神经图谱:探索用于脑网络分析的增强型智能语言模型框架

Jiaxing Li, Rui Dong, Muyao Tang, Youyong Kong

专题命中 推理与问题求解 :LLM(title,abstract);language model(title,abstract);large language model(abstract);prompting(abstract)

AI总结 研究针对脑网络分析中现有方法解释性有限等问题,提出BrainAgent智能语言模型框架,将连接组分类设为迭代过程,经特定工具转换、知识检索等步骤生成结构化预测,实验证明其优于基线,为脑网络分析提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17981 2026-07-27 cs.SE 版本更新 86%

Planning to Hammer: Difficulty-Aware Decomposition for Automating Rocq Proofs

规划锤击:面向自动化Rocq证明的难度感知分解

Ning Zhang, Nongyu Di, Zenan Li, Yuan Yao, Xiaoxing Ma

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出Quarry框架,通过LLM规划证明分解并利用难度模型排序子目标,结合CoqHammer自动证明,在Rocq基准测试中成功率提升7%-13%。

Comments 26 pages, 8 figures; submitted to OOPSLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21616 2026-07-27 cs.AI 新提交 84%

Lost in Context: Addressing Context Anxiety in Large Language Models

迷失在上下文中:解决大语言模型中的上下文焦虑

Ifueko Igbinedion, Jillian Ross, Etienne Ricardez, Sertac Karaman, Eric So

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.AI

AI总结 研究大语言模型中因过早自我怀疑导致的上下文焦虑,通过系统研究发现其部分源于对完成任务所需tokens估计不准,会致效率损失,还表明模型可学替代策略,性能提升或可通过提高评估与适应自身局限能力实现。

Comments Accepted at ICML 2026. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21933 2026-07-27 cs.AI 新提交 83%

Semiotic logical hexagon theory for LLM logical reasoning

用于大语言模型逻辑推理的符号逻辑六边形理论

Yunyao Zhang, Xinglang Zhang, Zeliang Chen, Junqing Yu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型逻辑推理中语义组织的影响,提出HexLogicAgent框架,先组织自然语言含义再结构化验证推理。发现不完整语义表示是推理失败主因,建模语义对立结构可延迟性能下降,实验证明该框架能提高推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15591 2026-07-27 cs.IR 版本更新 80%

RecGPT-V3 Technical Report

RecGPT-V3技术报告

Bowen Zheng, Chao Yi, Dian Chen, Gaoyang Guo, Han Zhu, Jiakai Tang, Jian Wu, Mao Zhang, Wen Chen, Yifan Lu, Yujie Luo, Yuning Jiang, Zhujin Gao, Bo Zheng, Chenchi Zhang, Dixuan Wang, Hao Fang, Jiancai Liu, Jing Yu, Junjun Zheng, Ke Chen, Kewei Zhu, Mengyan Li, Mingke Xu, Wenjun Yang, Xiangheng Kong, Xinming Zhang, Xunke Xi, Zile Zhou

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22529 2026-07-27 cs.CL 新提交 79%

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

技能自我博弈:通过协同进化技能拓展大语言模型能力边界

Siyuan Huang, Pengyu Cheng, Haotian Liu, Tao Chen, Yihao Liu, Jingwei Ni, Shijie Zhou, Ziyi Yang, Gangwei Jiang, Mengyu Zhou, Yu Cheng, Xiaoxi Jiang, Guanjun Jiang

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL

AI总结 研究针对大语言模型训练困境,引入Skill Self-Play协同进化框架,由提议者、求解器和控制器构成,经强化学习循环使组件协同进化,有效弥合验证与探索差距,推动模型性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27618 2026-07-27 cs.AI cs.CY cs.HC cs.LG cs.SI 版本更新 79%

Math Education Digital Shadows for Investigating Learning with GenAI: Mathematics Performance, Anxiety, and Confidence in LLMs

数学教育数字影子:促进与LLMs学习的工具:数学表现、焦虑与自信在模拟学生和AI中的表现

Naomi Esposito, Anthony Tricarico, Luisa Porzio, Ali Aghazadeh Ardebili, Massimo Stella

机构 * CogNosco Lab, University of Trento, Department of Psychology and Cognitive Science(CogNosco实验室,特伦托大学心理学与认知科学系)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MEDS数据集,通过28000个模拟角色评估LLMs在数学教育中的表现,结合心理和社会人口数据及数学任务,探讨自我效能、数学焦虑和认知网络科学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15670 2026-07-27 cs.CV 版本更新 78%

PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation

PixDLM:一种用于无人机推理分割的双路径多模态语言模型

Shuyan Ke, Yifan Mei, Changli Wu, Yonghan Zheng, Jiayi Ji, Liujuan Cao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出PixDLM,一种用于无人机推理分割的多模态语言模型,通过构建DRSeg基准数据集,验证了该模型在处理高分辨率无人机图像中的有效性。

Comments Accepted to CVPR 2026 (highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19212 2026-07-27 cs.CL cs.AI cs.CY 版本更新 76%

When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas

当伦理与收益相悖时:道德两难情境下的大语言模型智能体

Steffen Backmann, David Guzman Piedrahita, Terry Jingchen Zhang, Emanuel Tewolde, Rada Mihalcea, Bernhard Schölkopf, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 推理与问题求解 :LLM(title);分类 cs.CL、cs.AI

AI总结 研究道德要求与利润激励冲突时LLMs在道德两难博弈中的行为,引入\msim评估九个模型,通过ATEs估计因果效应、分析推理轨迹,发现模型道德行为有情境脆弱性,揭示了部署风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22385 2026-07-27 cs.AI cs.LG 新提交 73%

Agentic Root Cause Analysis through Evidence-Grounded Reasoning

通过基于证据的推理进行智能根本原因分析

Amaury Wei, Olga Fink

机构 * EPFL - IMOS Laboratory(洛桑联邦理工学院 - IMOS实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对工业异常根本原因诊断依赖人工且现有数据驱动方法有局限的问题,提出AgentRCA框架,结合数字孪生和大语言模型进行推理,在实际设施上评估,性能与监督基线相当且能产生透明推理轨迹,为工业根本原因分析提供实用基础。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13935 2026-07-27 cs.AI cs.LG stat.ML 版本更新 73%

Statistical Early Stopping for Reasoning Models

统计早停法用于推理模型

Yangxinyu Xie, Tao Wang, Soham Mallick, Yan Sun, Georgy Noarov, Mengxin Yu, Tanwi Mallick, Edgar Dobriban

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出基于统计原理的早停方法,通过监控不确定性信号来提高大语言模型在推理任务中的效率和可靠性,尤其在数学推理中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22013 2026-07-27 cs.CV cs.AI 新提交 70%

Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

用于多模态思维链推理的视觉显著性引导蒸馏

Hao Yang, Jin Wang, Xuejie Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对多模态思维链推理在小模型中存在的问题,提出视觉显著性引导蒸馏方法,利用多模态大语言模型注意力图生成扰动图像,经奇异值分解提取引导向量指导层间蒸馏,实验证明该方法能改进推理生成和答案推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21946 2026-07-27 cs.LG 新提交 70%

Multi-Agent Debate and Visual Information Extraction for SeePhys Pro: A 1st-Place Technical Report from ICML 2026 AI4Math Track 3 Challenge

用于SeePhys Pro的多智能体辩论与视觉信息提取:ICML 2026 AI4Math赛道3挑战赛的第一名技术报告

Jiseok Kwak, Suhyeon Jo, Taewoo Kim, Yeongmin Kim, Byeonghu Na, Il-chul Moon

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对回答含图像的大学物理问题的SeePhys Pro任务,提出两阶段框架,包括视觉信息提取和多智能体辩论推理阶段,提高了准确率,在挑战赛中获第一名,分析得出编排收益及图形辅助价值与问题图像占比相关的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21835 2026-07-27 cs.CR cs.AI 新提交 70%

ToolGuardian: Declarative Security for AI Agent-Tool Interactions

ToolGuardian:人工智能代理与工具交互的声明式安全

Arun Ravindran, Saurabh Deochake

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究人工智能代理与工具交互安全问题,提出ToolGuardian框架,通过预准入审查和任务感知运行时授权保障安全,利用渐进式特征化和基于ASP的声明式策略层,实验表明该框架在审查和授权方面性能良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21609 2026-07-27 cs.AI 新提交 70%

Coupled Hierarchical Search over Topology and Execution for Agentic Workflow Synthesis

用于智能工作流合成的拓扑与执行耦合分层搜索

Dong Li, Yanchi Liu, Xujiang Zhao, Wei Cheng, Zhengzhang Chen, Xintao Wu, Zhong Chen, Chen Zhao, Haifeng Chen

机构 * Baylor University(贝勒大学) NEC Laboratories America(美国NEC实验室) University of Arkansas(阿肯色大学) Southern Illinois University(南伊利诺伊大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型结构化工作流创建自动化难题,提出拓扑与执行耦合的搜索范式,引入HierFlow架构,通过反馈引导拓扑调整与树搜索优化子工作流,经多基准测试验证其性能优于基线,平衡了质量与效率且无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21596 2026-07-27 cs.AI 新提交 70%

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills

FlowEvo:通过工作流和可执行技能的协同进化实现自我进化的智能体

Zeyu Ren, Ling Yue, Ran Li, Yishu Wang, Shengxiang Xu, Hanmo Liu, Shaowu Pan, Shimin Di

机构 * Southeast University(东南大学) Rensselaer Polytechnic Institute(伦斯勒理工学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在让大型语言模型智能体通过工作流解决复杂任务。提出FlowEvo框架,通过工作流到技能编译、技能到工作流反馈、技能管理三个机制,使智能体无需更新模型参数积累完善能力,实验显示其在基准测试中精度-成本权衡优,各机制有贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21453 2026-07-27 cs.LG 版本更新 70%

Test-Time Scaling via Error Localization

通过错误定位进行测试时缩放

Rajiv Shailesh Chitale, Rahul Madhavan, Taneesh Gupta, Deepanway Ghosal, Aravindan Raghuveer

机构 * Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对大型语言模型复杂任务性能提升问题,提出通过错误定位进行测试时缩放(TTEL)算法,利用反馈定位错误步骤,截断轨迹并分支新一代,重用有效前缀,在多个基准测试中优于竞争基线。

Comments 10 pages, 8 figures (With appendix: 27 pages, 11 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02024 2026-07-27 cs.AI 版本更新 70%

From Mind to Machine: The Rise of Manus AI as a Fully Autonomous Digital Agent

从心智到机器:Manus AI作为完全自主数字代理的崛起

Minjie Shen, Yanshu Li, Lulu Chen, Zhichao Fan, Yanhang Li, Qikai Yang, Haochen Yang

机构 * Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工学院电气与计算机工程系) Department of Computer Science, Brown University(布朗大学计算机科学系) Department of Computer Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Khoury College of Computer Sciences, Northeastern University(东北大学科里尔计算机科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Manus AI是一款通用人工智能代理,结合大语言模型的推理与规划能力,执行复杂任务并产生实际成果,本文全面介绍了其技术架构、跨行业应用及未来潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21993 2026-07-27 cs.GT 新提交 67%

Three-Body Alignment: Aligning Chess Agent with Human Reasoning through Reranked Rationale

三体对齐:通过重新排序的理由将国际象棋智能体与人类推理对齐

Jaymari Chua, Chen Wang, Liming Zhu, Lina Yao

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究如何通过国际象棋中的“三体对齐”,分析人类专家、引擎辅助评论员和大语言模型产生的理由间语义差异,构建多源理由数据集,进行实证分析与实验,开发数据集结构并开源,以改善智能体与人类对齐及决策的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21856 2026-07-27 cs.LG cs.AI cs.CL 新提交 67%

LeAct: Learning to Reason from Expert Actions

LeAct:从专家行动中学习推理

Ziran Yang, Chengshuai Shi, Raj Ghugare, Benjamin Eysenbach, Karthik Narasimhan, Chi Jin

机构 * Princeton University(普林斯顿大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究如何从专家行动中恢复思维链,提出LeAct方法,通过优化潜在变量,让学生为专家行动采样候选思维链并保留有效链。该方法在多个博弈和机器人基准测试中表现出色,使专家系统成为基础模型推理教师的新来源。

Comments 27 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21981 2026-07-27 cs.CL cs.AI 新提交 62%

J-CoT: Chain-of-Thought in J-Space

J-CoT:J空间中的思维链

Junde Wu, Jiayuan Zhu, Fengling Liu, Minhao Hu, Jiazhen Pan

机构 * University of Oxford(牛津大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究针对语言模型推理中仅依赖自然语言受限的问题,提出基于J空间的J-CoT循环推理框架,通过词汇索引系数传递中间状态,在多任务中表现出色,J-CoT-Zero匹配或超基线,J-CoT-Train获高分。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22314 2026-07-27 cs.LG 新提交 57%

Evolution-Aware MSA Reasoning for Subsampling via Factor Graphs

基于因子图的进化感知多序列比对抽样推理

Zhangzhi Xiong, Minzhang Li, Haotian Yu, Sixian Shen, Kexin Zhang, Mingrui Li, Jie Zheng, Kewei Tu, Jingyi Yu

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 研究针对MSA抽样在有限预算下难以控制进化信号的问题,提出将其作为优化问题,引入基于亲和传播的因子图方法AP-REASONER,通过特定因子和控制旋钮进行推理,实验表明该方法在下游任务中表现优异,能可控恢复蛋白质构象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22016 2026-07-27 cs.CV cs.AI 新提交 57%

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

EVL-MCoT:用于有害模因检测的增强视觉语言多思维链

Hao Yang, Jin Wang, Xuejie Zhang

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对有害模因检测,提出增强视觉语言多CoT(EVL-MCoT)方法,通过促进多CoT及设计解码框架,解决现有方法局限,在相关数据集上获良好结果,且公开了源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22002 2026-07-27 cs.AI 新提交 57%

Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning

学习随推理展开:用于高效强化学习的渐进式展开分配

Heyang Jiang, Henry Liu, Baharan Mirzasoleiman

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究针对强化学习中GRPO方法计算昂贵且不稳定的问题,提出VIGOR方法,通过方差引导在线分配展开,理论上推导其加速比,实验表明该方法在数学推理和编码任务中能减少展开次数并提升通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20525 2026-07-27 cs.AI math.CO math.NT 交叉投稿 57%

Autonomous disproofs of the sum-product conjecture over $\mathbb R$ with GPT-5.5 Pro

使用GPT-5.5 Pro对实数上的和积猜想进行自主反证

Yichen Huang

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 本文借助GPT-5.5 Pro构建智能体,通过三阶段提示管道,对实数上的和积猜想进行自主反证,8次试验中7次成功生成正确证明,每次试验平均用132.4k推理令牌,还发布相关内容供重现研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02844 2026-07-27 cs.RO cs.LG 57%

VLM as Strategist: Adaptive Generation of Safety-critical Testing Scenarios via Guided Diffusion

VLM作为策略家:通过引导扩散实现安全关键测试场景的自适应生成

Xinzheng Wu, Junyi Chen, Naiting Zhong, Yong Shen

机构 * School of Automotive Studies, Tongji University(同济大学汽车研究学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 本文提出一种结合VLM和引导扩散模型的框架,用于高效生成安全关键测试场景,提升自动驾驶系统的测试效率和安全性。

Comments 25 pages, 9 figures

Journal ref Accident Analysis & Prevention Volume 236, October 2026, 108680

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22076 2026-07-27 cs.CR cs.SE 新提交 50%

PoCEvolve: Generating Proof-of-Concept Exploits from Security Patches with Vulnerability-Aware Prompt Evolution

PoCEvolve:通过漏洞感知提示进化从安全补丁生成概念验证漏洞利用程序

Duc Manh Tran, Ratnadira Widyasari, Ivana Clairine Irsan, Huihui Huang, Ting Zhang, Shar Lwin Khin, Ouh Eng Lieh, Hong Jin Kang, David Lo

专题命中 推理与问题求解 :LLM(abstract)

AI总结 研究修复提交与详细漏洞报告可用性的延迟问题,提出PoCEvolve框架,可从漏洞修复提交直接生成概念验证漏洞利用程序,通过评估相关上下文指导提示进化,在不同模型上有不同成功率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21857 2026-07-27 cs.SD 新提交 50%

SoundscapeAgent: Agentic Soundscape Construction for Controllable Synthesis and Scalable Audio-Language Supervision

SoundscapeAgent:用于可控合成和可扩展音频-语言监督的智能音景构建

Hao Zhang, Yiwen Zhao, Yixuan Zhang, Yiwen Shao, Steve Yves

机构 * Tencent(腾讯)

专题命中 推理与问题求解 :LLM(abstract)

AI总结 提出智能音景构建框架SoundscapeAgent,基于大语言模型的智能体将用户意图转化为场景计划,经多步骤实现可控音频合成与可扩展音频-语言数据构建,在生成性能及下游音频推理方面表现出色。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21725 2026-07-27 cs.RO 新提交 50%

Addressing the Orchestration Gap in Generalist Robots via Physical Agency

通过物理智能解决通用机器人中的编排差距

Liane Galanti, Dhruv Shah, Tri Dao

机构 * Princeton University(普林斯顿大学) Together AI(联合人工智能)

专题命中 推理与问题求解 :post-training(abstract)

AI总结 研究通用机器人行动推理问题,提出将相关能力分解为语言条件策略/控制智能体与高级智能体管理器/编排器,构建物理智能体编排器Pigey,经评估其在模拟和实际任务中性能显著提升,缩小了编排差距。

详情

展开后加载摘要…

URL PDF HTML 收藏