arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-30 至 2026-07-30 共收录 102 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 13 篇

2607.26909 2026-07-30 cs.CL 新提交 79%

Dual-Path LLM Reasoning for Multimodal Few-Shot Knowledge Graph Completion

用于多模态少样本知识图谱补全的双路径大语言模型推理

Jinlan Liu, Zhiying Tu, Yongchao Xing, Yicheng Liu, Bolin Zhang, Dianbo Sui, Dianhui Chu, Hongliang Sun

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对多模态少样本知识图谱补全难题,提出双路径大语言模型推理框架DuPLeR,结合多模态LLM先验与事实支撑构建校准关系图,经实验验证其在数据稀缺场景下性能稳健。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04398 2026-07-30 cs.HC cs.CY 版本更新 78%

The Agency Gap in AI-Supported Writing: How Reactive and Proactive Agent Designs Shape Multimodal Reasoning

AI辅助写作中的主体差距:反应式与主动式智能体设计如何塑造多模态推理

Yueqiao Jin, Kaixun Yang, Roberto Martinez-Maldonado, Dragan Gašević, Lixiang Yan

专题命中 其他推理 :reasoning(title,abstract)

AI总结 该研究针对AI辅助写作中的主体差距,对比反应式与主动式智能体设计的效果,发现主动式设计可强化多模态推理关联,还能缩小AI素养相关的表现差异,为教育AI智能体设计提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19321 2026-07-30 cs.AI cs.CR cs.LG 版本更新 62%

ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D

研究竞技场:评估自动化人工智能研发中的破坏行为与监控

Lena Libon, Ben Rank, Jehyeok Yeon, David Schmotz, Jeremy Qin, Daniel Donnelly, Derck Prinzhorn, Maksym Andriushchenko

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究针对自动化人工智能研发,用研究竞技场框架评估人工智能控制,通过四项长期任务及两类隐藏附带任务,评估前沿代理破坏与监控能力,发现训练数据中破坏行为难捕捉,发布框架用于评估自动化人工智能研发中的破坏与控制。

Comments 50 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05174 2026-07-30 cs.CL cs.AI 62%

Improving Heart-Focused Medical Question Answering in LLMs via Variance-Aware Rubric Rewards with GRPO

通过基于方差感知的评分规则奖励与GRPO改进LLMs中心脏医学问答

Arash Ahmadi, Parisa Masnadi Khiabani, Sarah Sharif, Charles Nicholson, David Ebert, Mike Banad

机构 * School of Electrical and Computer Engineering, University of Oklahoma, Norman, OK, USA(电气与计算机工程学院,俄克拉荷马大学,诺曼,OK,USA) Intelligent Neuromorphic and Quantum Understanding for Innovative Research and Engineering (INQUIRE) Laboratory, University of Oklahoma, Norman, OK, USA(创新研究与工程智能神经形态与量子理解实验室,俄克拉荷马大学,诺曼,OK,USA) Khiabani Data Science and Analytics Institute, University of Oklahoma, Norman, OK, USA(Khiabani数据科学与分析研究所,俄克拉荷马大学,诺曼,OK,USA) Data Institute for Societal Challenges (DISC), University of Oklahoma, Norman, OK, USA(社会挑战数据研究所(DISC),俄克拉荷马大学,诺曼,OK,USA) School of Industrial and Systems Engineering, University of Oklahoma, Norman, OK, USA(工业与系统工程学院,俄克拉荷马大学,诺曼,OK,USA) Office of Responsible Artificial Intelligence (ORAI), University of Arizona, Tucson, AZ, USA(负责任人工智能办公室(ORAI),亚利桑那大学,图森,AZ,USA)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出一种方差感知奖励框架,结合GRPO和RaR-Medicine的评分规则,通过连续分析奖励函数替代离散聚合,提升LLMs在心脏医学问答上的准确率和F1分数。

Comments 27 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12250 2026-07-30 cs.AI cs.CL cs.GT cs.MA 版本更新 62%

How memory can affect collective and cooperative behaviors in an LLM-Based Social Particle Swarm

记忆如何影响基于LLM的社会粒子群中的集体和合作行为

Taisei Hishiki, Takaya Arita, Reiji Suzuki

机构 * Graduate School of Informatics(信息学研究生院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大型语言模型代理的内部对齐特性如何影响记忆对其集体和合作动态的影响。通过将社会粒子群模型中的规则代理替换为具有大五人格特质和不同记忆长度的LLM代理,发现记忆长度是决定集体行为的关键参数,且不同模型对记忆的解读影响合作结果。

Comments 11 pages, 4 figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26922 2026-07-30 cs.LG 新提交 57%

Two Calls Beat Five Agents: Evaluating Multi-Agent Pipelines Against Self-Refinement for Local Language Models

两次调用胜过五个智能体:针对本地语言模型的多智能体流水线与自我优化的评估

Ashish Prajapati, Om Mohite

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本研究对比多智能体流水线与自我优化方法,发现针对本地7B模型,两次调用自我优化在GSM8K表现更优且令牌用量低,经任务感知重设计后在HumanEval也能维持高准确率,简单方法优于多智能体架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26181 2026-07-30 cs.AI 新提交 57%

GoGoTB: Agentic RTL Verification with Specification-Grounded Coverage Closure

GoGoTB:基于规范驱动覆盖闭合的智能体式RTL验证

Xin Xin, Jincheng Lou, Junhui Li, Jinglin Yan, Panda Xiao, Di Wu, Haixiao Li, Weicong Lu, Weijian Fan, Xinyu Qu, Yuxiang Zhao, Min Yu, Zhixiong Di, Yibo Lin

机构 * Tencent(腾讯) School of Integrated Circuits, Peking University(北京大学集成电路学院) Southwest Jiaotong University(西南交通大学) Institute of Electronic Design Automation, Peking University(北京大学电子设计自动化研究所) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路高精尖创新中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 GoGoTB是实现端到端验证闭合的智能体式RTL验证框架,在8个RTL设计上无需人工干预,实现100%环境生成成功率及多维度高覆盖率,优于现有方法。

Comments 9 pages, 7 figures, 3 tables. Xin Xin and Jincheng Lou contributed equally to this work and share first authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03448 2026-07-30 cs.CL 57%

Enhancing Linguistic Competence of Language Models through Pre-training with Language Learning Tasks

通过语言学习任务预训练增强语言模型的语言能力

Atsuki Yamaguchi, Maggie Mi, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield, United Kingdom(谢菲尔德大学计算机科学学院,英国)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出L2T框架,结合语言学习任务与标准预测任务,提升语言模型在语言能力评估中的表现,同时保持推理任务的竞争力。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07131 2026-07-30 cs.CV cs.AI 版本更新 57%

Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge

深度专家注入用于带有领域特定知识的视网膜视觉语言模型的锚定

Shuai Lu, Meng Wang, Jia Guo, Jiawei Du, Bo Liu, Shengzhu Yang, Weihang Zhang, Huazhu Fu, Huiqi Li

机构 * Beijing Institute of Technology, Beijing, China(北京理工大学) National University of Singapore, Singapore(新加坡国立大学) Tsinghua University, Beijing, China(清华大学) The Hong Kong Polytechnic University, Hong Kong(香港理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EyExIn框架,通过深度专家注入机制提升视网膜VLMs的领域知识嵌入能力,解决感知与推理间隙问题,实现高精度眼科视觉问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27113 2026-07-30 cs.CV 新提交 50%

Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection

Veritas++:面向感知增强的AIGI检测的值感知在线策略蒸馏

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Zijian Yu, Chuanbiao Song, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) Ant Group(蚂蚁集团) Sangfor Technologies Inc.(深信服科技股份有限公司)

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究针对现有AIGI检测模型的感知瓶颈,提出Veritas++框架,通过PoRL与VaOPD机制增强感知能力,提升了检测泛化性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26885 2026-07-30 cs.CV 新提交 50%

SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation

SCALPEL:基于大语言模型驱动的编码器学习的医学视觉-语言语义跨模态对齐框架

Yunzhan Fu, Enyu Bao, Xiangyu Shen, Yihao Wu, Chunbo Jiang, Fangli Guan, Liqi Yan

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)

专题命中 其他推理 :reasoning(abstract)

AI总结 针对现有医学视觉-语言预训练的三大瓶颈,本文提出SCALPEL框架,通过临床报告对比微调、非对称对齐策略及解剖-否定感知目标,在三大医学基准上实现了多项任务的最优性能。

Comments 14 pages, 3 figures, accepted by PRCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26809 2026-07-30 cs.RO 新提交 50%

Practice Makes Policies: Bootstrapping and Consolidating Robotic Capabilities from Zero Human Demonstrations

熟能生巧:从零人类演示中引导与整合机器人能力

Jialiang Li, Yuhan Wang, Haojun Li, Gaojing Zhang, Yangtian Ye, Qipeng Liu, Haotian Liang, Wenzhao Lian

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究提出HERO自改进层级具身智能体,通过整合启发式推理等技术,实现机器人从零人类演示自主演进操作能力,减少数据收集人工干预并提升多样化任务操作稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏