arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1648 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1648 篇

2607.17951 2026-07-21 cs.CR cs.AI cs.RO cs.SY eess.SY 新提交 57%

RT-SHCUA: Real-Time Self-Hosted Computer-Use Agent for UAV Control

RT-SHCUA:用于无人机控制的实时自托管计算机使用代理

Di Lu, Bo Zhang, Xiyuan Li, Yongzhi Liao, Xuewen Dong, Yulong Shen, Zhiquan Liu, Jianfeng Ma

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Shaanxi Key Laboratory of Network and System Security(陕西省网络与系统安全重点实验室) College of Cyber Security, Jinan University(广州大学网络安全学院) School of Cyber Engineering, Shaanxi Key Lab of Network and System Security(陕西省网络与系统安全重点实验室)

专题命中 推理与问题求解 :language agent(abstract);分类 cs.AI

AI总结 研究针对将SHCUA用于无人机控制的结构不匹配问题,提出实时安全导向的重组方法,把SHCUA输出转换为合同约束的无人机技能调用,设计分离架构,原型评估显示RT-SHCUA能保持响应能力并支持相关特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17624 2026-07-21 cs.LG 新提交 57%

Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks

变压器真的无所不能吗?论跨任务归纳偏差的兼容性

Damien Teney, Liangze Jiang, Hemanth Saratchandran, Simon Lucey

机构 * Idiap Research Institute(Idiap研究所) EPFL(洛桑联邦理工学院) Adelaide University(阿德莱德大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 研究探讨变压器对给定任务是否最优,提出为数据集优化变压器架构的方法,在算法玩具任务和代码语言建模数据集上实验,发现标准变压器非局部最优,简单替代方案有优劣,暗示有改进架构可支持多种能力。

Comments Published as a conference paper at ICLR 2026. https://github.com/idiap/lm-afs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17570 2026-07-21 cs.LG 新提交 57%

A Weisfeiler-Leman Characterization of Global-Attention Graph Transformers for Mixed-Integer Linear Programs

用于混合整数线性规划的全局注意力图变换器的Weisfeiler-Leman特征

Md Abrar Jahin, Craig A. Knoblock, Jay Pujara

机构 * University of Southern California(南加州大学) USC Information Sciences Institute(南加州大学信息科学研究所)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.LG

AI总结 研究通过图同构测试,探讨具有全局注意力的图基础模型对混合整数线性规划的表达能力,证明一类分层图变换器受1-WL测试限制,验证多种图编码器,表明超越其表达能力源于输入编码,提供与编码器无关的诊断方法。

Comments Accepted to Topology, Algebra, and Geometry in Data Science (TAG-DS) 2026 (20 pages, 10 figures) [Lightning Oral Presentation]

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17243 2026-07-21 cs.AI 新提交 57%

LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning

LenGuard-GPC:用于空间推理强化学习的带引导提示一致性的长度保护

Xingjian Tao, Yiwei Wang, Yujun Cai, Jing Tang

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对多视图空间推理中思维链推理冗长不准确及标准GRPO奖励问题,提出LenGuard-GPC框架,通过比较标准与引导提示下预测分布得KL散度作奖励信号,并引入阶段长度奖励,提升了准确率且缩短了平均响应长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16819 2026-07-21 cs.AI 新提交 57%

FUSAR-R1: A Large-Scale Reasoning Model for Intelligent Interpretation of SAR Images

FUSAR-R1:一种用于合成孔径雷达图像智能解释的大规模推理模型

Yi Yang, Xiaokun Zhang, Yuxuan Li, Ruyi Zhang, Xinpeng Zhou, Haipeng Wang

机构 * Fudan University(复旦大学) Key Laboratory for Information Science of Electromagnetic Waves (MoE)(电磁波信息科学教育部重点实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对SAR图像智能解释问题,提出FUSAR-R1模型。通过模拟专家解释构建思维链推理数据指导指令学习,赋予基本推理能力,再用强化学习策略优化输出。该模型在多种SAR解释任务中表现优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16603 2026-07-21 cs.CL 新提交 57%

NOWJ@COLIEE 2026: Adaptive Pipelines for Legal Retrieval and Reasoning

NOWJ@COLIEE 2026:用于法律检索和推理的自适应管道

Thuong-Hieu Ngo, Hoang-Trung Nguyen, Huu-Dong Nguyen, Xuan-Bach Le, Le-Dung Nguyen, Quang-Thanh Tran, Ha-Thanh Nguyen, Thi-Hai-Yen Vuong

机构 * VNU University of Engineering and Technology(越南国立工程技术大学) Center for Juris-Informatics, ROIS-DS College of Engineering & Computer Science, VinUniversity(越南Vin大学工程与计算机科学学院法律信息学中心)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 NOWJ团队参与COLIEE 2026竞赛五项任务,针对各任务提出不同方法。如任务1的四阶段管道,任务2的多种方法结合,任务3的检索增强框架等,通过这些方法在法律检索、推理等方面取得相应成果。

Comments Presented at COLIEE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15647 2026-07-20 cs.AI 新提交 57%

Neuro-Symbolic AI for LEED compliance: Document-Centric Benchmarking, Deterministic Numeric Checking, and When Multimodal Hurts

用于LEED合规的神经符号人工智能:以文档为中心的基准测试、确定性数值检查以及多模态何时有害

Aritro De, Juliana Felkner

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究小型本地部署语言模型对LEED文档筛选及符号组件作用,引入神经符号管道,通过对齐PDF、检索证据、语言模型验证和数值检查器检查来验证合规性,实验表明特定模型在任务中表现较好,管道及基线提供了参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15442 2026-07-20 cs.AI 新提交 57%

Beyond a Joke: Multi-Angle Reasoning for Detecting and Explaining Harmful Humor in Memes

超越玩笑:用于检测和解释表情包中有害幽默的多角度推理

Shanhong Liu, Pai Chet Ng, De Wen Soh, Malika Meghjani, Konstantinos N. Plataniotis

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究如何检测和解释表情包中有害幽默,提出MAR-12框架,利用视觉语言模型,从十二个角度解读表情包,经注意力机制和原型分类器预测,在多数据集上准确率超现有方法,且能给出有说服力的解释。

Comments Accepted for Publication at AAAI-ICWSM 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15254 2026-07-17 cs.AI cs.HC 新提交 57%

teLLMe Why (Ain't Nothing but a Jam): Exploratory Causal Analysis of Urban Driving Data

告诉我为什么(不过是一场拥堵):城市驾驶数据的探索性因果分析

Qiwei Li, Jorge Ortiz

机构 * Rutgers University(罗格斯大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究城市驾驶数据因果问题,提出teLLMe系统,结合多种方法从结构化事件表出发,通过模式感知大语言模型映射问题,返回‘因果卡片’总结相关内容,能揭示合理关系,用于假设生成和专家推理。

Comments Accepted at the NeurIPS 2025 Workshop on UrbanAI. 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15253 2026-07-17 cs.IR cs.CL 新提交 57%

Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic Search

桥梁证据:静态检索效用无法预测多步智能体搜索中的因果效用

Debayan Mukhopadhyay, Utshab Kumar Ghosh, Shubham Chatterjee

机构 * University of Calcutta(卡塔克大学) Missouri University of Science and Technology(密苏里科技大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 研究智能体检索中静态检索效用与因果效用的差异,通过在HotpotQA上用ReAct风格智能体实验,比较原始与反事实运行得CTU分数,发现两者近乎独立,约三分之一文档为桥梁文档,还确定了相关机制,指出优化静态相关性无法带来因果有用性。

Comments Preprint; extended version in preparation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14735 2026-07-17 cs.CL 新提交 57%

CoTu at EXACT 2026: Neuro-Symbolic Reasoning for Transparent Educational QA

CoTu在EXACT 2026中的应用:用于透明教育问答的神经符号推理

Quoc-Khang Tran, Minh-Thien Nguyen, Phu-An Thai, Xuan-Tung Bui, Truong-Thanh Ma, Nguyen-Khang Pham

机构 * Can Tho University(芹苴大学) Tay Do University(西原大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 EXACT 2026竞赛要求用最多8B参数的自托管模型解决教育问答问题。CoTu团队开发神经符号思维程序管道,结合Z3编码、数值Python等,经答案类型路由等方法,在物理任务中获满分,决赛技术得分最高,总体第三,证明小模型也能实现可验证推理。

Comments The 2nd International XAI Challenge for Transparent Educational Question-Answering @ IEEE IJCNN 2026 Competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14582 2026-07-17 cs.AI 新提交 57%

MathCoPilot: An Interactive System for Human-AI Symbiotic Paradigm of Mathematical Research

MathCoPilot:一种用于数学研究的人机共生范式的交互式系统

Junjie Zhang, Jiayu Liu, Wenbin Liu, Zhenya Huang, Doudou Wang, Yan Jiang, Leiye Xu, Tao Xiong, Wen Huang, Qi Liu, Guoping Hu, Enhong Chen, Mengping Zhang, Xiangdong Ye

机构 * University of Science and Technology of China(中国科学技术大学) School of Mathematical Sciences, University of Science and Technology of China(中国科学技术大学数学科学学院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究提出MathCoPilot这人机共生的数学研究系统,统一三项核心能力。通过它在特定子集和定理上比较四个大语言模型,发现当前模型处理本科问题成功率高,但在特定领域定理上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12856 2026-07-15 cs.LG 新提交 57%

Verifier-Based Reinforcement Fine-Tuning of Reasoning Models for Thermal Energy Storage Control

基于验证器的热能存储控制推理模型强化微调

Takumi Shioda, Kohei Terashima, Tatsuo Nagai

机构 * The University of Tokyo(东京大学) Tokyo University of Science(东京理科大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG

AI总结 研究针对建筑物热能存储控制中模型难以扩展的问题,采用基于可验证奖励的强化学习,通过强化微调训练开放权重推理模型,在简单办公楼TES基准测试中取得较好效果,明确了规划模式转移情况,推动了相关测试与验证器发展。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12480 2026-07-15 cs.AI 新提交 57%

TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments

TRACE:可审计的智能体承诺的操作推理模式

Edward Y. Chang, Emily J. Chang

机构 * Stanford University(斯坦福大学) Quadrivium AI(四元数人工智能)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出TRACE模式用于记录推理轨迹,通过字段和测试应对推理不在语言模型中的问题,给出参考程序和操作规范,借助记录-消费者契约形成操作接口,通过示例展示应用,贡献了模式及其契约。

Comments 46 pages, 18 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11598 2026-07-14 cs.AI 新提交 57%

Interaction Scaling: Grounding the Third Axis of Test-Time Compute

交互缩放:奠定测试时计算的第三轴基础

Bojie Li, Noah Shi

机构 * Pine AI(松树人工智能公司) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究测试时增加计算量的新方法,提出交互缩放概念,通过模型与外部仪器交互突破传统方法局限,在硬编码任务和视觉工件处理上展现优势,表明交互缩放真实且区别于推理和采样,需反馈和度量基于实际。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11258 2026-07-14 cs.CL 新提交 57%

TreeThink: A Modular Tree Search Library for Mathematical Reasoning with LLMs

TreeThink:用于大语言模型数学推理的模块化树搜索库

Burak S. Akbudak, Zeynel A. Uluşan, Can S. Erer, Gözde Gül Şahin

机构 * Bogazici University(博阿齐奇大学) Codeway Studios(Codeway工作室) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) Koç University(科克大学) KUIS AI Lab(KUIS人工智能实验室)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 介绍开源Python库TreeThink,用于神经定理证明的模块化全异步树搜索,集成多种方法技术,支持多种语言,连接REPL服务器,经评估在miniF2F和MATH500上有跨语言证明搜索等优势及异步加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11119 2026-07-14 cs.RO cs.AI 新提交 57%

VIA: Visual Interface Agent for Robot Control

VIA:用于机器人控制的视觉接口代理

Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10991 2026-07-14 cs.RO cs.AI cs.CV 新提交 57%

Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies

在重要时刻思考:用于社交导航的基于RL策略的条件VLM推理

Ali Ahmadi, Hamed Rahimi, Adrien Jacquet Cretides, Marie Samson, Mahdi Khoramshahi, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique (ISIR)(智能系统与机器人研究所)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究社交机器人导航中强化学习策略缺乏语义推理能力的问题,提出HUMA混合架构,动态平衡RL策略与VLM的优势。在基准测试中任务成功率提高,减少碰撞,消融研究验证组件,实际部署证明方法可行。

Comments CoRL 2026 submission. 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10299 2026-07-14 cs.LG 新提交 57%

Empowering Long-form Omni-modal Understanding with Robust Audio Perception

通过强大的音频感知增强长格式全模态理解

Kaiying Yan, Luoyi Sun, Xiao Zhou, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学 上海人工智能研究院) Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 推理与问题求解 :instruction tuning(abstract);分类 cs.LG

AI总结 为解决全模态理解不足问题,提出AVDC数据集及AVDC-QA-CoT数据集,利用现成模型标注视频,采用两阶段训练范式,在多下游任务实验中取得显著性能提升,推动全模态感知发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09709 2026-07-14 cs.AI cs.SE 新提交 57%

The Verifier is the Curriculum: Execution-Gated Self-Distillation for Cross-Family Game Generation

验证器即课程:用于跨家族游戏生成的执行门控自蒸馏

Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou

机构 * Institute of Science Tokyo(东京科学研究所) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.AI

AI总结 研究针对游戏生成中代码生成器的优化,提出执行门控自蒸馏方法,通过严格启动过滤器提升跨家族泛化能力,在GameCraft-Bench上实验表明该方法显著提高干净生成率和覆盖率,验证器对模型学习有重要作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09366 2026-07-13 cs.SE cs.AI cs.LO 新提交 57%

Diversifying to Verify: When Task-Equivalent Programs Differ in Verifiability

多样化以进行验证:当任务等效程序在可验证性上存在差异时

Shirley Yu, Ruben Martins

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究任务等效程序的可验证性差异,提出基于大型语言模型的Diversify2Verify管道,通过推断契约、生成测试不同实现并修复注释来验证,构建基准测试,结果表明实现多样性有助于验证,提高了验证成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09217 2026-07-13 cs.AI cs.MS 新提交 57%

OpenProver: Agentic and Interactive Theorem Proving with Lean 4

OpenProver:使用Lean 4进行智能且交互式的定理证明

Matěj Kripner, Milan Straka

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理系)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 介绍用于大语言模型驱动的自动化定理证明的开源系统OpenProver,它集成特定架构,完全开源,能自动验证证明,提供交互式界面,通过在ProofNet上评估展示自动验证在定量消融实验中的潜力。

Comments 7 pages, 2 figures. Accepted at the 19th Conference on Intelligent Computer Mathematics (CICM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08758 2026-07-10 cs.AI 新提交 57%

Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation

思想有基因组:科学谱系推理与基于谱系的思想生成基准测试

Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 该研究提出IG-Bench基准测试,用于科学谱系推理与基于谱系的思想生成。围绕IdeaGene框架构建,支持两种评估。通过对14个基于大语言模型的科学家实验,发现存在组合瓶颈,最强系统谱系推理精确准确率低,结构化谱系上下文改变系统排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08724 2026-07-10 cs.LG cs.RO 新提交 57%

Latent Memory Palace: Reasoning for Control as Autoregressive Variational Inference

潜在记忆宫殿:作为自回归变分推理的控制推理

Chuning Zhu, Eva Xu, Jose Barreiros, Krishnan Srinivasan, Paarth Shah, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Toyota Research Institute(丰田研究院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 研究将语言模型的推理能力应用于连续控制策略的问题,提出潜在记忆宫殿(LMP)方法,通过自回归潜在空间组织信息进行变分推理,推导强化学习技术优化下限,该方法在模拟和现实领域表现良好,还产生高性能动作分词器,为控制的潜在推理提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08651 2026-07-10 cs.LG cs.DC 新提交 57%

Secure Decentralized Federated Learning via Gossip and Virtual Voting

通过八卦和虚拟投票实现安全的去中心化联邦学习

Amirhossein Taherpour, Xiaodong Wang

机构 * Columbia University(哥伦比亚大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 研究如何实现安全的去中心化联邦学习,提出gspDAG-FL框架,通过八卦历史达成共识,结合多种验证方法提高弹性,经实验验证其在减少协调瓶颈、提高吞吐量及检测无效起源等方面效果良好,学习质量接近基于验证的账本FL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08288 2026-07-10 cs.CR cs.AI 新提交 57%

From Legacy Documentation to OSCAL: An MCP-Based Agent Pipeline for Threat-Informed Continuous Compliance in Critical Infrastructure

从遗留文档到OSCAL:基于MCP的代理管道,用于关键基础设施中的威胁情报驱动的持续合规性

Lea Roxanne Muth, Marian Margraf

机构 * Department of Mathematics and Computer Science(数学与计算机科学系)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究针对关键基础设施运营技术环境无法主动扫描但需主动系统反馈的问题,提出基于MCP的多代理管道,将自然语言描述转换为知识图谱和OSCAL工件,架构解耦推理与检索,降低风险,在场景中取得一定召回率并生成报告,虽有错误但可人工审查。

Comments Accepted for publication at the 2026 IEEE International Conference on Cyber Security and Resilience (IEEE CSR), Lisbon, Portugal, August 3-5, 2026. 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08173 2026-07-10 cs.AI 新提交 57%

Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets

过度思考:放大推理权重以提取学习到的秘密

Jack Hopkins, Dipika Khullar, Fabien Roger

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究针对语言模型黑盒审计可能遗漏隐藏信息的问题,提出“过度思考”方法,通过特定模型构建及新策略放大推理,经实验证明该方法能更频繁揭示隐藏信息,不同秘密浮现方式有别。

Comments Accepted at ICML 2026. 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07727 2026-07-10 cs.PL cs.CL 新提交 57%

SPL: Orchestrating Workflows with Declarative Deterministic-Probabilistic Composition

SPL:使用声明式确定性-概率性组合编排工作流

Wen G. Gong

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 研究提出SPL语言统一确定性与概率性计算模式,通过共享语法等实现跨平台运行。经实验验证,求解器分支有较高机器验证正确性,对比仅用大语言模型的分支,呈现后端难度梯度,主要失败模式为求解器错误。

Comments 24 pages, 2 figures, under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08003 2026-07-10 physics.chem-ph cs.AI 新提交 57%

Reaction-network reasoning with frontier models for experimentally confirmed catalyst-selectivity hypotheses

使用前沿模型进行反应网络推理以获得实验证实的催化剂选择性假设

Sutanay Choudhury, Anwesha Banerjee, Udishnu Sanyal, Jorin Dawidowicz, Chiezugolum Ijeoma Odilinye, Jesun Firoz, Liney Arnadottir, Simone Raugei, Johannes Lercher, Arnab Dutta

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究复杂反应中催化剂选择性问题,利用前沿语言模型开发人机协同思考框架,通过识别控制途径竞争的物理杠杆发现新型催化剂,指导合成的催化剂使乙酸盐选择性提高三倍,转变计算范式,提供材料发现蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07601 2026-07-09 cs.RO cs.AI 新提交 57%

CARLA-GS: Decoupling Representation, Reasoning, and Physics Simulation for Autonomous Driving Corner-Case Synthesis

CARLA-GS:用于自动驾驶极端情况合成的解耦表示、推理和物理模拟

Kaicong Huang, Meng Ma, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究自动驾驶极端情况合成问题,提出CARLA-GS模块化管道,解耦视觉表示、语义推理和物理执行并保持跨模块耦合,能从实际驾驶数据生成可编辑场景,经多智能体大语言模型推理等步骤,实现可控生成及逼真、时空一致的视频。

详情

展开后加载摘要…

URL PDF HTML 收藏