arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-28 至 2026-07-28 共收录 543 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 89 篇

2606.11157 2026-07-28 hep-ph astro-ph.CO physics.comp-ph 版本更新 75%

DarkAgents

DarkAgents:利用大语言模型和确定性测试代码构建理论天体粒子物理研究的协同管道

Michele Lucente, Silvia Pascoli, Filippo Sala, Matteo Zandi

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 DarkAgents利用大语言模型和确定性测试代码构建理论天体粒子物理研究的协同管道,解决模型构建、复杂计算和假设审计等挑战,提供参数拟合、约束条件及假设审计报告。

Comments 12 pages, 2 figures, code at https://github.com/PhysicsZandi/DarkAgents

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03815 2026-07-28 cs.SE cs.AI cs.CL cs.LG 75%

Synergizing LLMs and Knowledge Graphs: A Novel Approach to Software Repository-Related Question Answering

融合大语言模型与知识图谱:一种针对软件仓库相关问答的新型方法

Samuel Abedu, SayedHassan Khatoonabadi, Emad Shihab

机构 * Data-driven Analysis of Software (DAS) Lab Department of Computer Science \& Software Engineering Concordia University Montreal QC Canada Concordia University

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出融合大语言模型与知识图谱的方法,提升软件仓库问答的准确性与效率。

Comments Submitted to ACM Transactions on Software Engineering and Methodology for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03753 2026-07-28 cs.HC 版本更新 75%

VisTR: Visualizations as Representations for Time-series Table Reasoning

VisTR:将可视化作为时间序列表推理的表示

Jianing Hao, Zhuowen Liang, Chunting Li, Yuyu Luo, Jie Li, Wei Zeng

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对时间序列表推理难题,VisTR框架以可视化核心,利用其连接数据与认知,通过多模态大语言模型对齐输入,集成机制处理大数据,实现交互式可视化,经评估和案例验证了其在时间序列推理任务中的有效性和适用性。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20952 2026-07-28 cs.LG cs.CL 版本更新 73%

The Weight of Silence: A Causal Case for Weights Over the Scratchpad in Latent Chess Reasoning

沉默的权重:潜在国际象棋推理中权重优于暂存器的因果案例

Ishan S. Kshirsagar

专题命中 推理与问题求解 :language model(abstract);SFT(abstract);分类 cs.CL、cs.LG

AI总结 研究国际象棋模型潜在推理,通过分阶段潜在推理课程训练并强化学习,发现强化学习增加对干扰的鲁棒性而非依赖思维内容,反驳潜在思维是推理时暂存器的假设,表明其主要作用是塑造模型参数,还展示了强化学习在国际象棋领域的有效提升。

Comments 28 pages, 5 figures, preprint also available at Zenodo: https://zenodo.org/records/21619703 v2: added statistical significance testing on the n=1000 causal battery replication (Appendix A.8), added SVD-based weight-space rank analysis (Appendix A.11), corrected false-checkmate rate to reflect larger-sample data

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09239 2026-07-28 cs.CL cs.LG 版本更新 73%

Repeated-Token Counting Reveals a Dissociation Between Representations and Outputs

重复标记计数揭示了表示与输出之间的脱节

Sohan Venkatesh

机构 * Manipal Institute of Technology Bengaluru(班加罗尔Manipal理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究发现大语言模型在重复标记计数任务中表现不佳,但通过线性探针发现错误源于多层感知机块的固定错误覆盖,而非表示层的缺陷。

Comments Code is available at https://github.com/sohv/counting-failure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01348 2026-07-28 cs.CL cs.LG 版本更新 73%

Does Faithfulness-Guided Alignment Hurt Accuracy? Unlocking Accurate and Faithful Post-Retrieval Reasoning

CRAFT: 通过强化学习进行多跳问答的校准推理与答案忠实轨迹

Yu Liu, Wenxiao Zhang, Diandian Guo, Cong Cao, Fangfang Yuan, Qiang Sun, Yanbing Liu, Jin B. Hong, Zhiyuan Ma

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 CRAFT通过强化学习框架提升多跳问答的推理准确性和答案忠实度,结合确定性奖励和判官奖励,增强推理轨迹的可审计性与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23700 2026-07-28 cs.AI 新提交 70%

Offline-Online Curriculum RL for Multimodal Reasoning

用于多模态推理的离线-在线课程强化学习

Wendi Deng, Hang Du, Guoshun Nan, Haokun Tian, Jiaqi Yu, Xinlei Cao, Jaile Li, Jingfeng Chen, Ling Deng, Ting Li, Hao Yang, Jun Liu, Xudong Jiang, Sicong Leng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) BUPT Shenzhen Institute(北京邮电大学深圳研究院) Carnegie Mellon University(卡内基梅隆大学) Lancaster University(兰卡斯特大学) Nanyang Technological University(南洋理工大学) China Telecom Corporation Limited Sichuan Branch(中国电信股份有限公司四川分公司) Changsha University of Science & Technology(长沙理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态推理中模型中间步骤有缺陷的问题,提出$O^2$-CritiCuRL框架,通过离线多步展开分析和在线渐进式强化学习策略,区分关键与冗余步骤,提升模型性能及训练和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23678 2026-07-28 cs.AI 新提交 70%

Focus Is All You Need: Adaptive Goal-aware Attention Orchestration for Multi-Agent Graph Systems

你所需要的只是专注:多智能体图系统的自适应目标感知注意力编排

Mingzhou Fan, Siyuan Xu, Mingxuan Yuan

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多智能体图系统中注意力分配问题,提出自适应目标感知注意力编排框架AGAO,结合目标、拓扑、资源感知注意力,将静态图转变为自适应系统,经实验验证其能提高任务有效性并减少计算等消耗,确立注意力工程方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23055 2026-07-28 cs.AI 新提交 70%

SymStep: Symbolic Step Verification for Logical Reasoning

SymStep:用于逻辑推理的符号步骤验证

Aida Usmanova, Rui Gao, Dilshod Azizov, Ricardo Usbeck, Zangir Iklassov

机构 * Leuphana University of Lüneburg(吕讷堡莱普芬纳大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 研究针对约束密集型逻辑推理任务中思维链提示的不足,提出SymStep方法,通过语言模型分步声明、约束传播器检查一致性等进行推理,在多个逻辑推理任务上表现优异,最小剩余值指导和一致性检查起关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22864 2026-07-28 cs.CV cs.AI 新提交 70%

Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests

空间智商:通过分层能力测试解构空间智能

Patrick Rim, Tom Long, Ekta Prashnani, Ruth Rosenholtz, Ben Boudaoud, Peter Xenopoulos, Alex Wong, Joohwan Kim, Jae-Hyun Jung

机构 * NVIDIA Research(英伟达研究院) Yale University(耶鲁大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型空间推理能力不足问题,提出Spatial-IQ分层诊断框架,分解物体计数任务为子任务,生成数据集评估模型,发现模型存在问题,且用思维链监督和强化学习训练可提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22713 2026-07-28 cs.AI 新提交 70%

SEGRA: Structured Experience-Guided Graph Reasoning Agent for Gremlin Based Question Answering

SEGRA:用于基于Gremlin的问答的结构化经验引导图推理代理

Saiyue Lyu, Mariam Dundua, Vishaal Kapoor, Sarthak Ahuja, Neda Kordjazi, Evren Yortucboylu, Harsh Amin, Rebecca Steinert

机构 * University of British Columbia(英属哥伦比亚大学) Amazon(亚马逊)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 针对企业文本到Gremlin问答难题,SEGRA引入经验引导代理,集成多种技术,包括意图路由、查询生成等。在企业IT支持基准测试中成绩出色,平均评判分数大幅提高,技能库还降低了成本,提升了企业图问答的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22692 2026-07-28 cs.AI 新提交 70%

Risk Governance for Generative AI Mental Health Support: A Multi-Turn Safety Architecture

生成式人工智能心理健康支持的风险治理:一种多轮安全架构

Anabela C. Areias, Catarina Botelho, António Farinhas, Areti Vassilopoulos, Dora Janela, Xin Tong, Nuno M. Guerreiro, Maya D'Eon, Fabíola Costa, Ricardo Rei

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型用于心理健康支持时缺乏风险治理机制的问题,开发了一种多轮安全架构,结合多种方法用于心理健康交互,经测试在多方面表现良好,能改善模型管理风险方式,提供安全部署框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22609 2026-07-28 cs.AI 新提交 70%

Evaluating LLMs as Interpretable Controllers for Dynamical Systems

评估大语言模型作为动态系统的可解释控制器

Aleksander Østensen, Alberto Mino Calero, Anastasios M. Lekkas, Adil Rasheed

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨大语言模型能否成为动态热环境的可解释控制器,评估五个不同规模模型在多场景下的表现。结果显示控制性能与模型复杂度有关,高复杂度模型表现更佳,整合物理模型可提升性能,还揭示了不同规模模型推理的进展,为混合控制策略提供机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22602 2026-07-28 cs.AI 新提交 70%

DeepLook: Deeper Thinking with Lookahead

DeepLook:通过前瞻进行更深入思考

Tingxin Yang, Zefeng Wang, Mengyue Wang, Xingcheng Zhou, Yunpu Ma

机构 * Technical University of Munich(慕尼黑工业大学) LMU Munich(慕尼黑大学) MCML, LMU, MemAgents Lab(慕尼黑大学机器学习中心、记忆代理实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在改进大语言模型推理,提出无需训练的DeepLook框架,通过将前瞻计算集中在不确定性瓶颈处,聚合令牌级置信度为段级信号并排序投票。在四个数学基准测试中,该方法改变准确率与令牌成本的帕累托前沿,提升准确率并减少令牌生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19451 2026-07-28 math.NT cs.AI 版本更新 70%

Computational Experiments in Number Theory

数论中的人工智能:用于算法生成的大型语言模型和用于猜想验证的集成方法

Ali Saraeb

机构 * Ali Saraeb

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了人工智能在数论算法和分析数论中的应用,通过测试大型语言模型在算法问题上的准确性和验证狄利克雷L函数猜想的集成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09159 2026-07-28 cs.AI 版本更新 70%

Do LLMs Experience an Internal Polylogue? Investigating Reasoning through the Lens of Personas

大语言模型是否经历内部多声部?通过人物设定的视角探究推理

Nils A. Herrmann, Leander Girrbach, Kirill Bykov, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过人物设定的视角探究推理过程,提出多声部概念,利用激活空间中的动态信号进行可解释的干预,提升模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03314 2026-07-28 cs.CV cs.AI 版本更新 70%

From Camera-Based Sensing to Reasoning: A Comprehensive Review Toward Proactive Vulnerable Road User Safety

从基于摄像头的感知到推理:面向主动弱势道路使用者安全的全面综述

Shucheng Zhang, Yan Shi, Bingzhang Wang, Yuang Zhang, Muhammad Monjurul Karim, Kehua Chen, Chenxi Liu, Mehrdad Nasri, Yinhai Wang

机构 * University of Washington(华盛顿大学) University of Utah(犹他大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 综述基于摄像头的主动弱势道路使用者安全方法,将文献分为视觉感知、运动建模和行为理解三部分,构成统一分层管道实现早期风险预测和及时干预,纳入新兴AI范式,识别关键挑战并讨论研究方向,提供VRU安全系统开发基础。

Comments 18 pages, 4 figures, 5 tables

Journal ref IEEE Transactions on Intelligent Transportation Systems, 2026, pp. 1-17

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18334 2026-07-28 cs.RO cs.AI cs.MA 版本更新 70%

CoopReflect: Towards Natural Language Communication for Cooperative Autonomous Driving via Multi-Agent Learning

CoopReflect:通过多智能体学习实现协同自动驾驶的自然语言通信

Jiaxun Cui, Chen Tang, Jarrett Holtz, Janice Nguyen, Alessandro G. Allievi, Hang Qiu, Peter Stone

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Robert Bosch LLC(罗伯特·博世有限公司) University of California, Riverside(加州大学河滨分校) Sony AI(索尼人工智能)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 研究探索自然语言用于车对车通信的潜力,开发基于大语言模型的驾驶智能体,引入CoopReflect多智能体学习框架,通过试错等为智能体配备相关知识,实验表明其能生成更优消息,实现跨场景泛化并降低决策延迟。

Journal ref Proc. 25th Int. Conf. Autonomous Agents and Multiagent Systems (AAMAS), 744-752 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24407 2026-07-28 cs.CV 新提交 67%

Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

思想令牌混合:统一感知与推理以实现自由形式多模态基础定位

Tianyi Gao, Han Fang, Tianyi Ding, Hao Li, Xin Wei, Hongbo Sun, Xiaodong Dong, Ye Yuan, Jinglin Xu, Kongming Liang, Hao Sun, Jingmin Xin

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究旨在统一多模态基础定位中的感知与推理。提出思想令牌混合(Motto)方法,通过空间接地思想令牌化及上下文自适应令牌链实现,构建PR-Bench基准,实验证明该方法在自由形式接地任务中达领先性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23806 2026-07-28 cs.CL cs.AI cs.IR cs.LG cs.PF 新提交 67%

A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever

一个冻结的12B模型在经过验证的任务上超越前沿模型:100%准确率、零token、位精确、永远如此

Sietse Schelpe

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究提出一种让模型冻结,通过增长持久内存来解决问题的方法。在多个问题族实例上,四种架构得分优异,执行与参数扩展解耦。该方法在开放式推理中也有效,内存选择快,存储规模大,在已验证任务上超越前沿模型。

Comments Industry experience report. 14 pages, 8 figures. Public testbench: https://corbenic-galahad-bench.hf.space; companion repository with SHA-256 provenance manifest: https://github.com/corbenicai/galahad-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23472 2026-07-28 cs.CV 新提交 67%

VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation

VIPER:用于物理上合理的视频生成的视觉上下文物理推理

Tianxiao Chen, Hanmo Chen, Huajin Chen, Bo Li, Qi Ye, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究针对视频生成模型控制物理行为难的问题,提出VIPER框架,利用多模态大语言模型提取物理线索,通过分层训练引导图像到视频生成器,构建VIPER-19K数据集,实验证明该框架能实现物理行为转移且效果良好。

Comments tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09113 2026-07-28 eess.SP 版本更新 67%

Redefining Digital Twins as Predictive Decision Engines for AI-Native Wireless Networks

迈向智能无线网络:生成式AI与数字孪生的协同

Afan Ali, Ali Arshad Nasir, Naveed Iqbal, Daniel Benevides da Costa

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出一种生成式AI赋能的数字孪生框架,通过实时同步信道、移动性、流量和能量信息,实现系统级主动优化,在无人机辅助非地面网络场景中节能约69.2%。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23440 2026-07-28 cs.CL cs.AI 新提交 62%

Reasoning or Memorization: Can LLMs Understand and Generate Chinese Xiehouyu Riddles?

推理还是记忆:大语言模型能理解并生成中国歇后语谜语吗?

Hai Hu, Siyuan Song, Chongtian Shao, Kejia Zhang, Tianjian Zhu, Xiaojing Zhao

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究通过在新歇后语游戏中测试大语言模型,用多项选择题、自由形式解释生成和新歇后语创作评估其能力,发现前沿中文模型记忆能力较强,新歇后语创作中Gemini 3.1 Pro表现出色,但LLMs整体创造力仍落后于人类专家,凸显数据污染对评估LLMs推理能力的影响。

Comments 20 pages; exp 3 is work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22841 2026-07-28 cs.IR cs.AI cs.CL 新提交 62%

Language-Routed RAG and Direct Option Scoring for Multilingual Financial QA: DS@GT at FinMMEval

用于多语言金融问答的语言路由RAG和直接选项评分:FinMMEval上的DS@GT

Justice Ayela, Kabir Sahni

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对多语言金融问答基准FinMMEval 2026任务1,构建基于LangGraph的检索增强管道,用RADS评分,通过加权倒数排名融合低资源语言索引,采用语言路由选择模型,揭示语言感知检索等对多语言金融推理的重要性。

Comments Accepted for publication in the CLEF 2026 Working Notes. 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22610 2026-07-28 cs.AI cs.CL 新提交 62%

Tokengeist: Multi-Turn Attribution Tracing in Agentic Conversations

Tokengeist:智能对话中的多轮归因追踪

Jessica Tang, Shraddha Barke, Sharad Agarwal

机构 * University of Toronto(多伦多大学) Microsoft Research(微软研究院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究多轮对话中语言模型响应的归因问题,提出多轮上下文归因及 Tokengeist 框架,通过有向无环图递归遍历恢复依赖路径,发布基准 MTCABench,实验表明 Tokengeist 能有效解决现有方法多跳依赖恢复不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11912 2026-07-28 cs.LG cs.AI 版本更新 62%

How Transformers Learn to Plan via Multi-Token Prediction

Transformer 如何通过多令牌预测学习规划

Jianhao Huang, Zhanpeng Zhou, Renqiu Xia, Baharan Mirzasoleiman, Weijie Su, Wei Huang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) University of Pennsylvania(宾夕法尼亚大学) RIKEN Center for Advanced Intelligence Project(日本理化学研究院先进智能项目中心) The Institute of Statistical Mathematics(统计数学研究所)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究多令牌预测如何促进推理,特别是规划,通过实验和理论分析展示其优于单令牌预测的性能及背后的机制。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24582 2026-07-28 cs.CV cs.AI 新提交 57%

CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding

CADER:用于长视频理解的置信度感知动态证据推理

Jinlong Yang, Wenhao Zhang, Kuanwei Lin, Sijie Cheng

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对长视频理解中现有系统推理过程不考虑难度的问题,提出CADER框架。它先全局推理估计置信度让高置信度示例提前退出,对不确定示例激活第二阶段工具增强循环定位证据,实验证明其能提升长视频推理能力并提供实用推理路线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24471 2026-07-28 cs.CL 新提交 57%

Grounding latent algorithm routing in transformer reasoning

在变压器推理中为潜在算法路由建立基础

Xiangbo Zhang, Xiaoxu Ma

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 研究变压器能否围绕不同归纳偏差族组织情节级适应,通过潜在算法路由及ROUTEBENCH基准实验,发现从零训练的密集仅解码器变压器能开发类似路由的内部变量,缩小最优路由差距,但未建立通用路由。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24167 2026-07-28 cs.AI 新提交 57%

Falsifiable Commitment Planning for Self-Correcting Web Agents

用于自我纠正网络代理的可证伪承诺规划

Guangyi Liu, Huan Zhao, Quanming Yao

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究长期运行网络代理易偏离轨道问题,提出FCPAgent框架,将计划步骤表示为FCU,通过计划-测试-修复循环执行,经混合承诺测试模块和范围感知修复提高成功率,在WebArena上相比基线有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24064 2026-07-28 cs.CV cs.AI 新提交 57%

MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

MarineEVT:通过视觉工具推理推进以事件为中心的海洋视频理解

Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu, Ziqiang Zheng, Sai-Kit Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对海洋视频理解面临的挑战,构建MarineEVT数据集,将其理解分解为EVT-R1过程,利用视觉工具驱动模型。实验显示EVT-R1优于多个SOTA VLMs,为海洋相关发展奠定基础并推动VLMs进步。

Comments Accepted to The 19th European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏