arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-07 至 2026-04-07 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 14 篇

2601.11109 2026-04-07 cs.CV cs.AI cs.GR 79%

Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning

通过交错多模态推理的视觉-反图形代理

Shaofeng Yin, Jiaxin Ge, Zora Zhiruo Wang, Chenyang Wang, Xiuyu Li, Michael J. Black, Trevor Darrell, Angjoo Kanazawa, Haiwen Feng

机构 * University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Impossible, Inc.(Impossible公司)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出VIGA框架,通过符号逻辑与视觉感知的交叉验证,解决视觉语言模型在单次设置中重建图像的挑战,支持2D文档生成、3D重建等任务。

Comments Project page: https://fugtemypt123.github.io/VIGA-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13218 2026-04-07 cs.AI cs.CL cs.LG cs.LO 78%

Scaling the Scaling Logic: Agentic Meta-Synthesis of Logic Reasoning

扩展扩展逻辑:代理元合成逻辑推理

Bowen Liu, Zhi Wu, Runquan Xie, Zhanhui Kang, Jia Li

专题命中 逻辑推理 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SSLogic框架,通过代理迭代生成和优化可执行的生成器-验证器对,生成具有新规则和难度梯度的任务家族,提升训练效率。

Comments 41 pages, 8 figures, 5 tables in the main body. Project page: https://github.com/AdAstraAbyssoque/Scaling-the-Scaling-Logic, typos corrected, claims cleared

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04869 2026-04-07 cs.LG 77%

Optimizing LLM Prompt Engineering with DSPy Based Declarative Learning

基于DSPy的声明式学习优化大语言模型提示工程

Shiek Ruksana, Sailesh Kiran Kurra, Thipparthi Sanjay Baradwaj

机构 * Vasavi College of Engineering(瓦萨维工程学院) Amazon(亚马逊) Texas(德克萨斯州)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出基于DSPy的声明式学习方法,通过符号规划、无梯度优化和自动模块重写提升提示优化的可靠性、效率和泛化能力,实验显示事实准确率提升30-45%,幻觉率降低25%。

Comments Best paper Award ,IEEE International Conference on Emerging Smart Computing and Informatics (ESCI) Pune, India. Mar 11-13, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04233 2026-04-07 cs.RO cs.CL 70%

Precise Robot Command Understanding Using Grammar-Constrained Large Language Models

利用语法约束大语言模型实现精确的机器人指令理解

Xinyun Huo, Raghav Gnanasambandam, Xinyao Zhang

机构 * Industrial and Manufacturing Engineering, Florida State University(佛罗里达州立大学工业与制造工程系)

专题命中 逻辑推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 本文提出一种结合语法驱动NLU系统和微调LLM的混合模型,通过两阶段过程确保生成的指令在机器人可读的JSON格式中有效,提升工业人机协作的安全性和效率。

Comments Accepted at ASME MSEC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03356 2026-04-07 cs.AI 70%

Evaluating Artificial Intelligence Through a Christian Understanding of Human Flourishing

通过基督教对人类繁荣的理解评估人工智能

Nicholas Skytland, Lauren Parsons, Alicia Llewellyn, Steele Billings, Peter Larson, John Anderson, Sean Boisen, Steve Runge

机构 * Gloo WinShape Foundation(WinShape基金会) Biblica

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出基督教单轮Flourishing AI基准,评估前沿模型在七个维度上的人类繁荣表现,发现AI默认采用世俗主义,导致道德和神学推理不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08392 2026-04-07 cs.RO cs.AI cs.CV 70%

ST-BiBench: Benchmarking Multi-Stream Multimodal Coordination in Bimanual Embodied Tasks for MLLMs

ST-BiBench:多流多模态协调在双臂具身任务中的基准测试

Xin Wu, Zhixuan Liang, Yue Ma, Mengkang Hu, Zhiyuan Qin, Xiu Li

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) HKUST(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出ST-BiBench框架,用于评估多流多模态协调,揭示MLLMs在高阶策略与精细物理执行间的协调悖论。

Comments 42 pages, 9 figures. Project page:https://stbibench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03691 2026-04-07 astro-ph.GA astro-ph.IM 67%

LensAgent: A Self Evolving Agent for Autonomous Physical Inference of Sub-galactic Structure

LensAgent:一种用于自主物理推断亚银河结构的自演化代理

Xiaotang Feng, Zihan Wang, Zilang Shu, Jean-Paul Kneib, Philip Torr

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 本文提出LensAgent,一种无需训练的大型语言模型驱动框架,用于自主推断质量分布,克服了质量片退化和手动或神经网络建模的可扩展性问题,成功重建了SLACS Grade A强引力透镜系统的质量分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03925 2026-04-07 cs.CL cs.AI 62%

AdaptFuse: Training-Free Sequential Preference Learning via Externalized Bayesian Inference

AdaptFuse:通过外部化贝叶斯推断实现无需训练的序列偏好学习

Fangzhou Lin, Peiran Li, Shuo Xing, Siyuan Yang, Qianwen Ge, Kazunori Yamada, Ziming Zhang, Haichong Zhang, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯农工大学) Worcester Polytechnic Institute(伍斯特理工学院) Tohoku University(东北大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AdaptFuse通过外部化贝叶斯推断实现无需训练的序列偏好学习,利用符号模块和冻结LLM结合熵自适应融合,提升推荐系统性能,无需敏感用户数据训练。

Comments 20 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05012 2026-04-07 cs.DB cs.AI cs.CL 62%

Making Prompts First-Class Citizens for Adaptive LLM Pipelines

使提示成为自适应大语言模型流水线中的第一公民

Ugur Cetintemel, Shu Chen, Alexander W. Lee, Deepti Raghavan, Duo Lu, Andrew Crotty

机构 * Brown University(布朗大学) Northwestern University(西北大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SPEAR框架,通过结构化提示管理、动态提示细化和策略驱动控制,解决提示在流水线中的脆弱性和不透明性问题,提升重用性和运行时适应性。

Comments 6 pages, 2 figures, appears in CIDR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04527 2026-04-07 cs.SE cs.AI cs.PL 57%

ENCRUST: Encapsulated Substitution and Agentic Refinement on a Live Scaffold for Safe C-to-Rust Translation

ENCRUST:在活体支架上进行封装替换和代理细化以实现安全的C到Rust翻译

Hohyun Sim, Hyeonjoong Cho, Ali Shokri, Zhoulai Fu, Binoy Ravindran

机构 * Korea University(高丽大学) University of Houston(休斯顿大学) State University of New York Korea(纽约州立大学韩国分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 ENCRUST通过封装替换和代理细化方法,解决C到Rust翻译中的类型不匹配和不安全构造问题,通过ABI保持封装模式和整体代码库验证,实现安全且可编译的转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03968 2026-04-07 cs.CR cs.AI 57%

TraceGuard: Structured Multi-Dimensional Monitoring as a Collusion-Resistant Control Protocol

TraceGuard:结构化多维监控作为抗合谋的控制协议

Khanh Linh Nguyen, Hoa Nghiem, Tu Tran

机构 * Independent Researchers(独立研究人员) Apart Research

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TraceGuard,一种结构化多维监控协议,通过五个维度评估代理行为,结合LLM调用和启发式检测器,有效区分攻击与诚实行为,防止合谋攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03759 2026-04-07 cs.RO cs.AI 57%

Build on Priors: Vision--Language--Guided Neuro-Symbolic Imitation Learning for Data-Efficient Real-World Robot Manipulation

基于先验知识:视觉-语言引导的神经符号模仿学习用于数据高效的现实机器人操作

Pierrick Lorang, Johannes Huemer, Timothy Duggan, Kai Goebel, Patrik Zips, Matthias Scheutz

机构 * Tufts University(塔夫茨大学) Austrian Institute of Technology GmbH (AIT)(奥地利技术研究所(AIT))

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种可扩展的神经符号框架,通过少量未标注的示范数据自动构建符号规划领域和高效控制策略,无需手动领域工程,提升现实机器人操作的效率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03616 2026-04-07 cs.CL 57%

The Format Tax

格式税

Ivan Yee Lee, Loris D'Antoni, Taylor Berg-Kirkpatrick

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文发现要求大语言模型以JSON等结构化形式输出会显著降低推理和写作性能,提出分离推理与格式生成的方法可恢复大部分损失的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04081 2026-04-07 physics.comp-ph physics.ed-ph physics.soc-ph quant-ph 50%

Co-Authoring with AI: How I Wrote a Physics Paper About AI, Using AI

与AI共同撰写:我如何用AI写了一篇关于AI的物理学论文

Yi Zhou

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文探讨AI在科学写作中的作用,强调人类在保持物理逻辑和学术规范中的关键责任,提出必须发表完整的AI交互记录以确保科学记录的完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏