arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 197 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 197 篇

2502.02061 2026-07-29 cs.IR 版本更新 50%

Reason4Rec: Deliberative User Preference Alignment of Large Language Models for Recommendation

Reason4Rec:用于推荐的大语言模型的审慎用户偏好对齐

Yi Fang, Wenjie Wang, Yang Zhang, Fengbin Zhu, Qifan Wang, Fuli Feng, Xiangnan He

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究旨在开发更可靠的推荐LLMs,引入“审慎推荐”任务并提出“推理驱动的推荐器”框架,利用语言化用户反馈增强推理能力,经实验验证该框架能提升预测准确性和推理质量。

Comments Accepted to IEEE TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11157 2026-07-28 hep-ph astro-ph.CO physics.comp-ph 版本更新 50%

DarkAgents

DarkAgents:利用大语言模型和确定性测试代码构建理论天体粒子物理研究的协同管道

Michele Lucente, Silvia Pascoli, Filippo Sala, Matteo Zandi

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 DarkAgents利用大语言模型和确定性测试代码构建理论天体粒子物理研究的协同管道,解决模型构建、复杂计算和假设审计等挑战,提供参数拟合、约束条件及假设审计报告。

Comments 12 pages, 2 figures, code at https://github.com/PhysicsZandi/DarkAgents

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00031 2026-07-28 cs.SE 版本更新 50%

Git Context Controller: Manage the Context of LLM-based Agents like Git

Git Context Controller: 管理基于LLM的代理的上下文像Git一样

Junde Wu, Minhao Hu, Jiayuan Zhu, Jiazhen Pan, Yuyuan Liu, Min Xu, Yueming Jin

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 Git-Context-Controller通过版本化文件系统管理LLM代理上下文,提升多轨迹问题解决能力,在SWE-Bench等基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18681 2026-07-27 cs.CV 版本更新 50%

Moving Beyond Diversity: Visual Token Pruning as Subspace Reconstruction for Efficient VLMs

超越多样性:将视觉令牌剪枝视为子空间重建以实现高效视觉语言模型

Jaeyeon Lee, Shunjie Wen, Dong-Wan Choi

机构 * Inha University(延世大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出SPARE方法,将令牌剪枝重构为子空间重建问题,通过迭代选择投影残差大的令牌进行剪枝,并引入反相关性机制保留上下文信息,在LLaVA上剪枝94%令牌仍保持95%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00368 2026-07-27 cs.DC 版本更新 50%

TENT: A Declarative Slice Spraying Engine for Performant and Resilient Data Movement in Disaggregated LLM Serving

TENT:一种用于高性能和容错数据移动的声明式切片喷射引擎

Feng Ren, Ruoyu Qin, Teng Ma, Shangming Cai, Zheng Liu, Chao Lei, Dejiang Zhu, Ke Yang, Zheming Li, Jialei Cui, Weixiao Huang, Yikai Zhao, Yineng Zhang, Hao Wu, Xiang Gao, Yuhao Fu, Jinlei Jiang, Yongwei Wu, Mingxing Zhang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 TENT通过解耦传输意图与物理执行,统一异构互连技术为动态资源池,实现高效、容错的数据传输,提升LLM推理和RL流水线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13359 2026-07-23 cs.MA 版本更新 50%

Learning Latency-Aware Orchestration for Multi-Agent Systems

学习多智能体系统的延迟感知编排

Xi Shi, Mengxin Zheng, Qian Lou

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对多智能体系统推理延迟高的问题,提出延迟感知多智能体系统(LAMaS)。训练时通过约束优化学习延迟感知执行图,推理时用轻量级控制器补充。实验显示其在降低端到端延迟超50%的同时保持精度,且具模块化可移植性。

Comments This submission was intended to be an updated version of arXiv:2601.10560. Any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20785 2026-07-17 cs.CV 版本更新 50%

ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking

ME-IQA: 通过重新排序增强的记忆图像质量评估

Kanglong Fan, Tianhe Wu, Wen Wen, Jianzhao Liu, Le Yang, Yabin Zhang, Yiting Liao, Junlin Li, Li Zhang

机构 * City University of Hong Kong(香港城市大学) ByteDance Inc.(字节跳动公司)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ME-IQA通过构建记忆库和利用推理摘要检索语义和感知对齐的邻居,将VLM重构为概率比较器,并通过门控反思和记忆巩固提升未来决策,从而实现更密集的失真敏感预测,缓解离散崩溃问题。

Comments Published as a conference paper at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17848 2026-07-14 cs.CR cs.SE 版本更新 50%

RISKTAGGER: Evidence-Guided LLM Agent for Post-Incident Forensic Analysis of Money Laundering in Web3

RISKTAGGER:用于Web3中洗钱事件后法医分析的证据引导大语言模型智能体

Dan Lin, Yanli Ding, Weipeng Zou, Jiajing Wu, Zhiyin Wu, Jiachi Chen, Xiapu Luo, Zibin Zheng

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对Web3加密货币洗钱法医分析面临的挑战,提出RISKTAGGER,将大语言模型作为证据约束决策组件,从公共事件材料提取线索,递归扩展资金流图并生成报告。经多案例评估,能恢复资金路径、识别风险账户,组织证据成可验证报告。

Comments 11 pages(main text), 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04809 2026-07-09 cs.SE 版本更新 50%

Watts This Smell: A Comprehensive Taxonomy of Software Energy Smells

一种经过验证的软件能耗异味分类

Mohammadjavad Mehditabar, Saurabhsingh Rajput, Tushar Sharma

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出了一种全面的软件能耗异味分类,通过系统文献综述和雪球抽样,将320种低效模式分类为12种主要能耗异味和65种根本原因。通过实证验证,发现71%的样本存在多种共存的异味,内存相关异味的修复节能效果最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23115 2026-07-07 cs.CV 版本更新 50%

AgentFoX: LLM Agent-Guided Fusion with eXplainability for AI-Generated Image Detection

AgentFoX: 基于可解释性的大语言模型引导融合的AI生成图像检测

Yangxin Yu, Yue Zhou, Bin Li, Kaiqing Lin, Haodong Li, Jiangqun Ni, Bo Cao

机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室) SZU-AFS Joint Innovation Center for AI Technology(深圳大学-AFS人工智能技术联合创新中心) Shenzhen University(深圳大学) School of Cyber Science and Technology(网络安全科学与技术学院) The Smart City Research Institute of China Electronics Technology Group Corporation(中国电子科技集团有限公司智慧城市研究院)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 AgentFoX通过多阶段分析流程提升AI生成图像检测的可靠性,结合专家和上下文聚类资料,生成可读性强的报告以增强可解释性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21573 2026-07-02 cs.CV 版本更新 50%

Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs

重新思考视觉隐私:一种用于严重性评估的组合隐私风险框架与VLM

Efthymios Tsaprazlis, Tiantian Feng, Anil Ramakrishna, Sai Praneeth Karimireddy, Rahul Gupta, Shrikanth Narayanan

机构 * University of Southern California(南加州大学) Meta Superintelligence Labs(Meta超级智能实验室) Amazon AGI(亚马逊AGI)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出组合隐私风险分类法(CPRT),将视觉属性按独立可识别性和组合危害潜力分级,并构建6.7K图像数据集,评估VLM在组合隐私风险评估中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14792 2026-06-24 cs.CV 版本更新 50%

MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection

MSPL: 用于开放词汇目标检测的多步伪标签方法

Hojun Choi, Youngsun Lim, Jaeyo Shin, Hyunjung Shim

机构 * KAIST AI(韩国韩世大学AI研究所) Boston University(波士顿大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出MSPL框架,通过多步视觉推理(目标定位、类别识别、背景确认)生成伪标签,解决开放词汇检测中单步图像-文本匹配忽略中间推理步骤的问题,在OV-COCO和OV-LVIS上取得最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18288 2026-06-19 cs.SE 版本更新 50%

Can Large Language Models Reason About Complex Execution Paths? An Empirical Study on Python

大型语言模型能否推理复杂执行路径?基于Python的实证研究

Wenhan Wang, Kaibo Liu, Zeyu Sun, An Ran Chen, Ge Li, Gang Huang, Lei Ma

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文实证研究大型语言模型在Python执行路径推理中的可行性,构建测试用例生成和缺陷分类任务,发现LLM能提升路径覆盖率,但强推理模型不一定优于弱模型。

Comments Accepted by ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07036 2026-06-18 physics.ed-ph 版本更新 50%

Using Large Language Models to Analyze Engagement in Computational Thinking via Computational Physics Essays

使用大型语言模型通过计算物理论文分析计算思维中的参与度

Sean Savage, Amir Bralin, Paul Hur, N. Sanjay Rebello

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本研究利用多模态大型语言模型自动评估100篇学生计算物理论文中的计算思维参与度,在明确子任务上达到84%的准确率,但主观整体质量评估准确率仅71%。

Comments 13 pages, 3 figures, 3 tables. Submitted to Physical Review Physics Education Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18746 2026-06-17 cs.CV 版本更新 50%

Bridging Modality Disconnect in Self-Reflection via Closed-Loop Visually Grounded Verification

通过闭环视觉基础验证弥合自我反思中的模态脱节

Haoyu Zhang, Yuwei Wu, Pengxiang Li, Xintong Zhang, Zhi Gao, Rui Gao, Mingyang Gao, Che Sun, Yunde Jia

机构 * Beijing Institute of Technology(北京理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出MIRROR框架,通过闭环视觉反思(草稿-批评-区域验证-修订)减少VLM幻觉,并构建ReflectV数据集训练视觉基础的多轮反思。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03852 2026-06-10 physics.geo-ph 版本更新 50%

Advancing Subsurface Discovery and Geothermal Monitoring with an Agentic Artificial Intelligence Framework

基于智能体人工智能框架推进地下发现与地热监测

Randy Harsuko, Zhengfa Bi, Guodong Chen, Nori Nakata

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出GAIA系统,结合大语言模型、数字孪生与检索增强生成,实现地热开发中的多学科任务自动化与智能决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16136 2026-06-09 cs.RO 版本更新 50%

Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning

基于思维图的奖励进化:一种用于强化学习的双层语言模型框架

Changwei Yao, Xinzi Liu, Chen Li, Marios Savvides

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Tokyo(东京大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出RE-GoT框架,结合LLM与VLM的图思维推理,通过任务分解和视觉反馈迭代优化奖励函数,实验表明在RoboGen和ManiSkill2任务中均优于现有方法。

Journal ref IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏