arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-09 至 2026-07-09 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 4 篇

2607.07690 2026-07-09 cs.LG cs.AI cs.CL 新提交 82%

Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning

Agon:具有隐式推理对手评分的竞争性跨模型强化学习

Vladislav Beliaev

机构 * Independent Researcher(独立研究者)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对可验证奖励强化学习只评最终答案的问题,提出Agon方法,让两个竞争模型相互评分,通过轮流扮演角色隐式判断推理,在难题上提升了模型表现,且该排序在多种场景和模型家族中可复制。

Comments 15 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07605 2026-07-09 cs.CY 新提交 78%

User identity conditions moral wrongness ratings in non-reasoning large language models

用户身份影响非推理大语言模型的道德错误评级

Willem Fourie, Isabel Ray, Gray Manicom

专题命中 其他推理 :reasoning(title,abstract)

AI总结 研究通过行为自下而上方法,评估两个非推理大语言模型,发现用户身份影响其道德错误评级,严重伤害行为有上限效应,有争议规则行为有角色条件性变化,为人工智能价值对齐讨论提出问题并助力重构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11840 2026-07-09 cs.LG cs.AI cs.CY cs.MA 版本更新 66%

Diversity Without Fidelity: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation Simulation

当推理模型损害行为模拟:多智能体大语言模型谈判中的求解器-采样器不匹配

Sandro Andric

专题命中 其他推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG

AI总结 研究指出推理增强模型在模拟行为时可能表现不佳,通过三个多智能体谈判环境实验发现,有界推理能产生更多样且妥协导向的轨迹,强调模拟应将模型视为采样器而非求解器。

Comments 20 pages, 2 figures. Substantially revised. Formerly titled "When Reasoning Models Hurt Behavioral Simulation: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00533 2026-07-09 cs.LG cs.IT math.IT 版本更新 57%

Toward Robust Open-set Adaptation: Synapse Consolidation Inspired by Rac1/MAPK Pathways

在开放测试流中学习并适应未知

Xiao Zhang, Tianyu Hu, Juntao Lyu, Qianchuan Zhao, Huimin Ma

机构 * University of Science and Technology Beijing(北京科技大学) Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出SyCo方法,通过Rac1和MAPK路径实现参数高效适应,解决LLM在动态任务中的适应问题,实验表明其在18个NLP数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏