arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-08 至 2026-06-08 共收录 106 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 20 篇

2603.24481 2026-06-08 cs.AI cs.CL cs.LG 版本更新 82%

Multi-Agent Reasoning with Consistency Verification Improves Uncertainty Calibration in Medical MCQA

基于一致性验证的多智能体推理改进医学多项选择题问答中的不确定性校准

John Ray B. Martinez

机构 * Department of Data Science and Analytics(数据科学与分析系)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出多智能体框架,结合领域专家智能体与两阶段验证及S分数加权融合,在医学MCQA中显著降低校准误差并提升判别能力。

Comments 20 pages, 6 figures. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09402 2026-06-08 cs.CL 版本更新 79%

SEEK: Steering LLM Reasoning for RAG via Internal Reasoning Sketches

SEEK: 通过内部推理草图引导LLM推理用于RAG

Xinze Li, Yuqing Lan, Zhenghao Liu, Haidong Xin, Yukun Yan, Shuo Wang, Zheni Zeng, Sen Mei, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系,人工智能研究院) School of Intelligent Science and Technology, Nanjing University, China(南京大学智能科学与技术学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出SEEK框架,通过构建结构化引导草图,迭代检索和填充知识槽,减少冗余检索,提升RAG性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06532 2026-06-08 cs.CV 新提交 78%

GOPAgen: Motion-Aware and Efficient Agentic Long-Video Understanding with Structural Memory and Hierarchical Reasoning

GOPAgen: 基于结构记忆与层次推理的运动感知高效智能长视频理解

Haozhe Chi, Yang Jin, Yadong Mu

机构 * Peking University(北京大学)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 提出GOPAgen方法,通过视频编解码的GOP运动代理、GOP树推理算法和结构记忆机制,实现高效长视频理解,在多个VQA基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07279 2026-06-08 physics.ed-ph cs.CY 新提交 78%

Detective scaffolding for within-session reasoning development: a three-phase framework evaluated in polymer engineering and pre-university outreach

侦探式脚手架用于课内推理发展:在聚合物工程和大学预科推广中评估的三阶段框架

Haolin Feng, Holly Barrett, Xinru Deng, Dimitrios G Papageorgiou, Yiwei Sun

专题命中 其他推理 :reasoning(title,abstract)

AI总结 提出侦探式脚手架三阶段教学框架,通过设计课堂投票作为证据探针,引导工程专业学生推理工业缺陷根因,实验表明该结构而非学科内容驱动收敛效应,具有跨学科可移植性。

Comments 24 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07380 2026-06-08 cs.CL 版本更新 70%

Mining Useful General Data for Low-Resource Domain Adaptation

挖掘低资源领域适应的有用通用数据

Pingjie Wang, Hongcheng Liu, Yusheng Liao, Ziqing Fan, Yaxin Du, Shuo Tang, Yanfeng Wang, Yu Wang

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对低资源领域数据稀缺问题,提出NTK-Selector方法,利用神经正切核从通用数据中筛选有用样本,显著提升领域适应效果。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06464 2026-06-08 cs.CL cs.AI 交叉投稿 62%

Human Adults and LLMs as Scientists: Who Benefits from Active Exploration?

人类成人与LLM作为科学家:谁从主动探索中受益?

Mandana Samiei, Eunice Yiu, Anthony GX-Chen, Dongyan Lin, Jocelyn Shen, Blake A. Richards, Alison Gopnik, Doina Precup

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) University of California Berkeley(加州大学伯克利分校) New York University(纽约大学) Meta FAIR MIT Media Lab(麻省理工学院媒体实验室) Montreal Neurological Institute(蒙特利尔神经科学研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过主动探索实验,发现主动探索能显著提升成人对合取因果规则的推理能力,但合取规则仍需更多测试;同时比较了大型语言模型的表现,发现部分模型在假设推断准确率上接近人类,但探索策略效率较低且存在类似的合取-析取性能差距。

Comments Accepted at the 48th Annual Conference of the Cognitive Science Society (CogSci 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01850 2026-06-08 cs.CV cs.AI cs.LG cs.MM 版本更新 62%

MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs

MoDA: 面向指令型多模态大语言模型的细粒度视觉定位的调制适配器

Wayner Barrios, Andrés Villa, Juan León Alcázar, SouYoung Jin, Bernard Ghanem

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出MoDA调制适配器,通过指令引导的通道级乘法调制增强细粒度视觉定位,在12个基准上对三种MLLM架构取得一致提升,计算开销极小。

Comments Accepted at ICML 2026. Code is available at https://github.com/waybarrios/MoDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07441 2026-06-08 cs.CL 新提交 57%

Sycophantic Praise: Evaluating Excessive Praise in Language Models

谄媚式赞美:评估语言模型中的过度赞美

Daniel Vennemeyer, Phan Anh Duong, Meryl Ye, Ruihong Huang, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学) Carnegie Mellon University(卡内基梅隆大学) Texas A&M University(德克萨斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出参数化框架衡量赞美是否过度,发现谄媚式赞美在社交和解释性领域远多于客观推理领域,且现有方法无法可靠测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06991 2026-06-08 cs.CV cs.AI 新提交 57%

Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding

不要暂停:面向在线视频理解的流式视频-语言同步

Zhenyu Yang, Kairui Zhang, Shengsheng Qian, Weiming Dong, Changsheng Xu

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出流式视频-语言同步(SVLS)范式,通过帧驱动转换控制器和流式令牌调节器实现视频帧与语言生成的细粒度同步,在不中断感知的情况下进行实时交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06865 2026-06-08 cs.CL 新提交 57%

Are Large Language Models Suitable for Graph Computation? Progress and Prospects

大型语言模型是否适合图计算?进展与展望

Yuting Zhang, Yi Han, Kai Wang, Wei Ni, Angela Bonifati, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院) Edith Cowan University(埃迪斯科文大学) Lyon 1 University(里昂第一大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文通过角色分类法综述LLM在图计算中的应用,分析作为执行者和规划者的两种范式,指出LLM适用于简单小规模任务,但在大规模和精确性要求高的任务中不可靠,并总结数据集和未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03280 2026-06-08 cs.AI 版本更新 57%

A Negative Result on Cross-Model Activation Transfer in a Pythia Multi-Hop Setting

Pythia多跳设置中跨模型激活迁移的负面结果

Peiyan Zhang, Jason Xin

机构 * Independent Researcher(独立研究者)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究在Pythia-160M到Pythia-410M的多跳推理设置中,通过线性翻译层传递隐藏状态是否能够改善下游回答,结果发现离线表示对齐不足以实现有用的因果通信。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01802 2026-06-08 cs.SD cs.AI 版本更新 57%

MOSS-Audio Technical Report

MOSS-Audio 技术报告

Chen Yang, Chufan Yu, Hanfu Chen, Jie Zhu, Jingqi Chen, Ke Chen, Wenxuan Wang, Yang Wang, Yaozhou Jiang, Yi Jiang, Zhengyuan Lin, Ziqi Chen, Zhaoye Fei, Chenghao Liu, Donghua Yu, Jun Zhan, Kang Yu, Kexin Huang, Liwei Fan, Mingshu Chen, Qinyuan Cheng, Ruixiao Li, Shimin Li, Songlin Wang, Xingjian Zhao, Yang Gao, Yitian Gong, Yiyang Zhang, Zhe Xu, Xipeng Qiu

机构 * OpenMOSS Team(开放MOSS团队)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出统一音频-语言模型 MOSS-Audio,通过 DeepStack 跨层特征注入和时间标记实现语音、环境声和音乐的理解,在音频字幕、时间感知问答、时间戳转录和音频推理任务上取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25171 2026-06-08 cs.CL 版本更新 57%

Re-defining Humor Data Objects for AI Humor Research

为AI幽默研究重新定义幽默数据对象

Anna Arnett, Bang Nguyen, Meng Jiang

机构 * Department of Computer Science and Engineering, University of Notre Dame(诺特大学计算机科学与工程系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究将幽默视为具有上下文和解释的社会互动,通过定义幽默推理数据对象并改进提示策略,使LLM生成更高质量的幽默解释,为AI幽默研究的数据合成与增强奠定基础。

Comments Added link to code and data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07101 2026-06-08 cs.HC 新提交 50%

CANote: Empowering Fact-checking Note Writing Through Scaffolded and Provenance-based Human-AI Collaboration

CANote: 通过支架式和基于来源的人机协作增强事实核查笔记撰写

Shuning Zhang, Jingruo Chen, Yuwei Chuai, Dai Shi, Yifan Wang, Xin Yi, Hewu Li

专题命中 其他推理 :reasoning(abstract)

AI总结 提出CANote系统,通过子主张提取、证据链接和结构化草稿辅助用户撰写高质量辟谣笔记,显著提升非专家用户的笔记质量至专家水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06914 2026-06-08 cs.CR 新提交 50%

DPAgent-in-the-Middle: Agentic Defense and Repair Against AI-Groomed Deceptive Patterns

中间DPAgent:针对AI诱导欺骗模式的代理防御与修复

Zewei Shi, Ruoxi Sun, Haoyang Li, Seong Oun Hwang, Feng Liu, Minhui Xue, Xingliang Yuan

专题命中 其他推理 :reasoning(abstract)

AI总结 针对网络界面中的隐私欺骗模式,提出DPAgent框架,通过四个专门代理结合潜在空间净化与防御性提示,主动检测并修复欺骗性界面,检测率达90.98%,修复率77%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06767 2026-06-08 cs.CR cs.SE 新提交 50%

The Custody Envelope Threshold: Authority-Scaled Admission of External Artifacts in Institutional Infrastructure

托管信封阈值:机构基础设施中外部工件的权限缩放准入

Amadeus Brandes

专题命中 其他推理 :reasoning(abstract)

AI总结 提出托管信封阈值模型,根据工件身份、入口路径和撤销能力的封闭程度与执行权限的关系,决定机构对外部工件的准入策略,并应用于多种工件类型。

Comments 32 pages. Preregistered framework and protocol paper; empirical pilot is a separate planned study. OSF preregistration and replication package: https://doi.org/10.17605/OSF.IO/E57FJ

详情

展开后加载摘要…

URL PDF HTML 收藏