arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-06 至 2026-04-06 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 10 篇

2505.09339 2026-04-06 cs.NI 78%

RAG-Enabled Intent Reasoning for Application-Network Interaction

支持应用-网络交互的意图推理(RAG)

Salwa Mostafa, Mohamed K. Abdel-Aziz, Mohammed S. Elbamby, Mehdi Bennis

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出基于RAG的意图推理框架,用于自动网络操作与管理。通过结合机器推理、检索增强生成和生成式AI技术,实现不同应用的意图翻译,提升网络交互的智能化和领域适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02485 2026-04-06 cs.CL cs.LG 62%

Failing to Falsify: Evaluating and Mitigating Confirmation Bias in Language Models

未能证伪:评估和缓解语言模型中的确认偏见

Ayush Rajesh Jhaveri, Anthony GX-Chen, Ilia Sucholutsky, Eunsol Choi

机构 * New York University(纽约大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究评估了大型语言模型是否表现出确认偏见,并提出干预策略以减少其影响,通过实验发现干预可显著提高规则发现率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02339 2026-04-06 cs.LG cs.CL 62%

SIEVE: Sample-Efficient Parametric Learning from Natural Language

SIEVE: 从自然语言中高效参数学习

Parth Asawa, Alexandros G. Dimakis, Matei Zaharia

机构 * University of California, Berkeley(加州大学伯克利分校) Bespoke Labs

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 SIEVE通过合成数据生成管道实现高效参数学习,仅需三个查询示例即可提升模型性能,适用于需要上下文的推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02783 2026-04-06 cs.HC cs.AI 57%

Disrupting Cognitive Passivity: Rethinking AI-Assisted Data Literacy through Cognitive Alignment

打破认知惰性:通过认知对齐重新思考人工智能辅助的数据素养

Yongsu Ahn, Nam Wook Kim, Benjamin Bach

机构 * Boston College(波士顿学院) Inria(法国国家信息与自动化研究所) University of Edinburgh(爱丁堡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过认知对齐框架,重新设计人工智能辅助的数据素养,以避免认知惰性,促进主动思考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02678 2026-04-06 stat.ME cs.AI stat.AP 57%

Eligibility-Aware Evidence Synthesis: An Agentic Framework for Clinical Trial Meta-Analysis

有资格意识的证据合成:一个用于临床试验元分析的代理框架

Yao Zhao, Zhiyue Zhang, Yanxun Xu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 EligMeta框架整合了自动化试验发现与有资格意识的元分析,通过自然语言查询生成可复现的试验选择,并基于资格对研究加权,以产生特定群体的汇总估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02674 2026-04-06 cs.MA cs.AI 57%

Do Agent Societies Develop Intellectual Elites? The Hidden Power Laws of Collective Cognition in LLM Multi-Agent Systems

智能体社会是否发展出知识分子?LLM多智能体系统中集体认知的隐藏幂律

Kavana Venkatesh, Jiaming Cui

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究LLM多智能体系统中协调动态,揭示协调遵循幂律级联、集中于知识分子精英及系统规模增长时极端事件频发的三大定律,提出整合瓶颈机制及Deficit-Triggered Integration方法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03045 2026-04-06 cs.CV cs.MM 50%

STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models

STEAR:面向视频大语言模型的层感知时空证据干预以缓解幻觉

Linfeng Fan, Yuan Tian, Ziwei Li, Zhiwu Lu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 STEAR通过层感知的时空证据干预框架,缓解视频大语言模型中的空间和时间幻觉,提升解码的准确性与一致性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02665 2026-04-06 cs.SE 50%

AgentSZZ: Teaching the LLM Agent to Play Detective with Bug-Inducing Commits

AgentSZZ: 教授LLM代理通过引发缺陷的提交进行调查

Yunbo Lyu, Jieke Shi, Hong Jin Kang, Ratnadira Widyasari, Junda He, Yuqing Niu, Chengran Yang, Junkai Chen, Zhou Yang, Julia Lawall, David Lo

专题命中 其他推理 :reasoning(abstract)

AI总结 AgentSZZ通过LLM代理探索仓库并识别缺陷引发提交,结合专用工具、领域知识和ReAct循环,提升跨文件和幽灵提交的召回率,实现F1分数提升27.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02547 2026-04-06 cs.SE 50%

Beyond Resolution Rates: Behavioral Drivers of Coding Agent Success and Failure

超越分辨率率:编码代理成功与失败的行为驱动因素

Tural Mehtiyev, Wesley Assunção

专题命中 其他推理 :reasoning(abstract)

AI总结 本文通过大规模实证研究分析了9374条轨迹,探讨了编码代理在特定任务中失败的原因,发现行为模式和LLM能力对成功与失败有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00683 2026-04-06 cs.CV 50%

Video Understanding: Through A Temporal Lens

视频理解:通过时间视角

Thong Thanh Nguyen

机构 * Institute of Data Science(数据科学研究所)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文通过时间视角探讨如何利用视频元素间的时间关系提升视频理解,提出自动标注框架、参数高效微调策略、状态空间层整合、新型对比学习框架及对大视觉-语言模型的全面研究,揭示了视觉-语言接口对时间推理的瓶颈。

Comments PhD Thesis, NUS, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏