arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-25 至 2026-03-25 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 14 篇

2603.22352 2026-03-25 cs.LG cs.AI 81%

WIST: Web-Grounded Iterative Self-Play Tree for Domain-Targeted Reasoning Improvement

WIST:基于网页的迭代自我对战树用于领域针对性推理改进

Fangyuan Li, Pengfei Li, Shijie Wang, Junqi Gao, Jianxing Liu, Biqing Qi, Yuqiang Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 WIST通过基于网页的迭代自我对战树框架,无需预设领域语料,直接从开放网络学习,提升领域推理能力,优于纯内生自我进化和语料基础自我对战基线。

Comments 23 pages, 4 figures. Submitted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23489 2026-03-25 cs.CV 78%

AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation

AgentRVOS: 基于对象跟踪的零样本视频对象分割

Woojeong Jin, Jaeho Lee, Heeseong Shin, Seungho Jang, Junhwan Heo, Seungryong Kim

机构 * KAIST AI Project(韩国科学技术院人工智能项目)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 AgentRVOS通过结合SAM3和MLLM的优势,提出无需训练的管道,利用生成的掩码跟踪提供可靠的时空信息,通过查询引导的推理实现零样本视频对象分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22855 2026-03-25 cs.AR cs.LG 74%

TorR: Towards Brain-Inspired Task-Oriented Reasoning via Cache-Oriented Algorithm-Architecture Co-design

TorR: 向基于大脑的面向任务推理迈进:通过面向缓存的算法-架构联合设计

Hyunwoo Oh, SungHeon Jeong, Suyeon Jang, Hanning Chen, Sanggeon Yun, Tamoghno Das, Mohsen Imani

机构 * Department of Computer Science, University of California, Irvine(加州大学尔湾分校计算机科学系)

专题命中 其他推理 :reasoning(title);分类 cs.LG

AI总结 TorR通过将CLIP式的密集对齐替换为超维(HDC)关联推理,实现了高效的实时推理。在算法层面引入部分相似性重用,在架构层面设计了可扩展的位切内存和轻量控制器,以满足实时性需求,同时在能耗和精度上优于现有基线。

Comments Accepted to DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04648 2026-03-25 cs.LG cs.AI 62%

When Sensors Fail: Temporal Sequence Models for Robust PPO under Sensor Drift

当传感器失效时:用于在传感器漂移下鲁棒PPO的时序序列模型

Kevin Vogt-Lowell, Theodoros Tsiligkaridis, Rodney Lafuente-Mercado, Surabhi Ghatti, Shanghua Gao, Marinka Zitnik, Daniela Rus

机构 * MIT Lincoln Laboratory(MIT林肯实验室) Harvard(哈佛大学) MIT(麻省理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在传感器漂移下PPO的鲁棒性,通过引入时序序列模型提升政策在部分可观测性和表示偏移下的性能。

Comments Accepted at ICLR 2026 CAO Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23443 2026-03-25 cs.SE cs.AI 57%

Evaluating LLM-Based Test Generation Under Software Evolution

评估基于大语言模型的测试生成在软件演化中的表现

Sabaat Haroon, Mohammad Taha Khan, Muhammad Ali Gulzar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究评估了基于大语言模型的测试生成在软件演化中的性能,发现其在代码变化时表现下降,测试覆盖和回归检测能力不足。

Comments 10 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23091 2026-03-25 cs.CL 57%

When Language Models Lose Their Mind: The Consequences of Brain Misalignment

当语言模型失去理智:大脑错位的后果

Gabriele Merlin, Mariya Toneva

机构 * MPI-SWS(马克斯·普朗克研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了大脑对齐对语言能力的影响,通过创建大脑错位模型发现其显著损害下游性能,强调了大脑对齐在实现稳健语言能力中的关键作用。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22837 2026-03-25 cs.CL 57%

Analysing LLM Persona Generation and Fairness Interpretation in Polarised Geopolitical Contexts

分析极化地缘政治背景下大语言模型的人格生成与公平性解释

Maida Aizaz, Quang Minh Nguyen

机构 * Graduate School of Data Science(数据科学研究生院) KAIST(韩国科学技术院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了五种流行LLM在640种实验条件下生成巴勒斯坦和以色列身份人格的分布特征,揭示了模型在不同情境下对地缘政治身份的公平性解释差异。

Comments EACL 2026 Student Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22791 2026-03-25 cs.AI 57%

ABSTRAL: Automatic Design of Multi-Agent Systems Through Iterative Refinement and Topology Optimization

ABSTRAL:通过迭代精进与拓扑优化自动设计多智能体系统

Weijia Song, Jiashu Yue, Zhe Pang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 ABSTRAL通过对比追踪分析将多智能体系统架构视为演化的自然语言文档,发现多智能体协调成本测量、设计知识迁移与专有角色发现三大核心贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01047 2026-03-25 cs.CV cs.AI 57%

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

残差解码:通过历史感知残差引导减轻大视觉-语言模型中的幻觉

Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

机构 * Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出残差解码方法,通过利用历史信息辅助解码,纠正大视觉-语言模型中的语言先验偏差,有效抑制幻觉并提升视觉接地能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23186 2026-03-25 cs.CV 50%

ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting

ViKey:通过视觉提示增强视频中的时间理解

Yeonkyung Lee, Dayun Ju, Youngmin Kim, Seil Kang, Seong Jae Hwang

机构 * Yonsei University(延世大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 ViKey通过视觉提示和轻量级关键词-帧映射模块提升视频模型的时间推理能力,在减少帧数的情况下保持性能。

Comments accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22673 2026-03-25 cs.HC 50%

Design Implications for Student and Educator Needs in AI-Supported Programming Learning Tools

面向学生和教育者需求的AI支持编程学习工具设计启示

Boxuan Ma, Yinjie Xie, Huiyong Li, Gen Li, Li Chen, Atsushi Shimada, Shin'Ichi Konomi

专题命中 其他推理 :reasoning(abstract)

AI总结 本文通过对比教育者与学生对AI编程助手需求的调研,揭示了间接支架支持与直接帮助之间的差异,并提出平衡学生自主性与教学约束的设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22538 2026-03-25 hep-ph 50%

The FERMIACC: Agents for Particle Theory

FERMIACC:粒子理论中的代理

Prateek Agrawal, Nathaniel Craig, Amalia Madden, Iñigo Valenzuela Lombera

专题命中 其他推理 :reasoning(abstract)

AI总结 FERMIACC基于OpenAI代理构建,可自主生成并定量验证高能物理数据的理论假设。

Comments 15 pages, 9 figure, 4 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22474 2026-03-25 cs.SE 50%

From Brittle to Robust: Improving LLM Annotations for SE Optimization

从易碎到稳健:改进LLM注释以优化SE性能

Lohith Senthilkumar, Tim Menzies

专题命中 其他推理 :chain-of-thought(abstract)

AI总结 本文提出SynthCore策略,通过集成多个LLM意见提升多目标优化任务的标注效果,优于现有方法,且无需人工参与。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04087 2026-03-25 cs.IR 50%

E-CARE: An Efficient LLM-based Commonsense-Augmented Framework for E-Commerce

E-CARE: 一种高效的基于大语言模型的常识增强框架用于电子商务

Ge Zhang, Rohan Deepak Ajwani, Yaochen Hu, Tony Zheng, Hongjian Gu, Wei Guo, Mark Coates, Yingxue Zhang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出E-CARE框架,利用大语言模型的常识推理能力提升电子商务推荐效率,无需监督微调或人工标注,实验显示在两个下游任务中精度@5提升了12.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏