arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-04 至 2026-06-04 共收录 172 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 13 篇

2601.07408 2026-06-04 cs.CL cs.LG 81%

Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning

基于结果锚定的优势重塑用于数学推理中的细粒度信用分配

Ziheng Li, Liu Kang, Feng Xiao, Luxi Xing, Qingyi Si, Zhuoran Li, Weikang Gong, Deqing Yang, Yanghua Xiao, Hongcheng Guo

机构 * Fudan University(复旦大学) XingYun lab, HUJING Digital Media & Entertainment Group(星云实验室,HUJING数字媒体与娱乐集团) University of Science and Technology Beijing(北京科技大学) Chinese Academy of Sciences(中国科学院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出结果锚定优势重塑(OAR),通过两种策略(OAR-P和OAR-G)实现细粒度信用分配,显著提升GRPO在数学推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03606 2026-06-04 cs.CR cs.AI 79%

Testing LLM Arithmetic Reasoning Generalization with Automatic Numeric-Remapping Attacks

测试大语言模型算术推理泛化能力:自动数值重映射攻击

Malia Barker, Bishal Lakha, Edoardo Serra, Francesco Gullo

机构 * Department of Computer Science, Boise State University(计算机科学系,博伊州立大学) University of L’Aquila(拉奎拉大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出自动数值重映射攻击算法,通过保持推理程序的小数值变化测试LLM算术推理鲁棒性,发现GSM8K上准确率下降12-26个百分点,而MAWPS和MultiArith更稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09803 2026-06-04 cs.LG 79%

Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement Learning

好的推理产生好的示范:通过上下文强化学习进行隐式推理质量监督

Tiehua Mei, Minxuan Lv, Leiyu Pan, Zhenpeng Su, Hongru Hou, Hengrui Chen, Ao Xu, Deqing Yang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) University of Chinese Academy of Sciences(中国科学院大学) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出In-Context RLVR方法,利用策略模型自身的上下文学习能力衡量示范效用(Demonstration Utility),通过隐式奖励加权提升推理质量和准确性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05106 2026-06-04 cs.CL cs.AI cs.CY 79%

Arithmetic Pedagogy for Language Models

语言模型的算术教学法

Andhika Bernard Lumbantobing, Hokky Situngkir

机构 * Bandung Fe Institute & Adjunct Science Fellow in InaAI(巴旦格Fe研究所及InaAI兼职科学研究员) AI Research Center IT Del & Bandung Fe Institute(IT Del人工智能研究中心及巴旦格Fe研究所)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 借鉴人类数学教学法,通过将GASING方法操作化为链式思维监督训练小规模GPT-2模型,使其在算术推理上达到高准确率并展现出联想式心算能力。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04465 2026-06-04 cs.CL cs.AI 79%

SePO: Self-Evolving Prompt Agent for System Prompt Optimization

SePO: 用于系统提示优化的自我进化提示智能体

Wangcheng Tao, Han Wu, Weng-Fai Wong

机构 * National University of Singapore(新加坡国立大学) City University of Hong Kong(香港城市大学)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SePO方法,通过自我指涉设计让提示智能体同时优化任务智能体和自身的系统提示,采用两阶段进化训练,在多个基准上平均准确率提升4.49%。

Comments 26 pages. Code: https://github.com/taowangcheng/SePO

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15158 2026-06-04 cs.LG cs.AI 73%

Outcome-Based RL Provably Leads Transformers to Reason, but Only With the Right Data

基于结果的强化学习可证明地引导Transformer进行推理,但仅在合适的数据条件下

Yuval Ran-Milo, Yotam Alexander, Shahar Mendel, Nadav Cohen

机构 * Tel Aviv University(特拉维夫大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析单层Transformer在合成图遍历任务上的策略梯度动力学,证明了基于结果的强化学习能够使Transformer自发学习出结构化的迭代推理算法,并揭示了训练数据中“简单示例”的分布对推理能力涌现的关键作用。

Comments 94 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11214 2026-06-04 cs.CL 70%

T$^\star$: Progressive Block Scaling for Masked Diffusion Language Models Through Trajectory Aware Reinforcement Learning

T$^\star$:通过轨迹感知强化学习实现掩码扩散语言模型的渐进块缩放

Hanchen Xia, Baoyou Chen, Yutang Ge, Guojiang Zhao, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) School of Mathematical Sciences(数学科学学院) Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 提出T$^\star$方法,利用基于TraceRL的训练课程,在掩码扩散语言模型中渐进增大块大小,实现高并行解码且性能损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05633 2026-06-04 cs.CL 70%

GIFT: Games as Informal Training for Generalizable LLMs

GIFT:游戏作为通用型LLM的非正式训练

Nuoyan Lyu, Bingbing Xu, Xueyun Tian, Weihao Meng, Yige Yuan, Yang Zhang, Zhiyong Huang, Tat-Seng Chua, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 提出将游戏作为非正式训练环境,结合协调子任务训练(CST)方法,提升LLM在抽象推理、规划、创造力等通用能力上的泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04244 2026-06-04 cs.AI cs.CL cs.CV cs.LG 67%

VAMPS: Visual-Assisted Mathematical Problem Solving Benchmark

VAMPS: 视觉辅助数学问题求解基准

Amirhossein Dabiriaghdam, Shayan Vassef, Mohammadreza Bakhtiari, Yasamin Medghalchi, Ilker Hacihaliloglu, Mesrob Ohannessian, Lele Wang, Giuseppe Carenini

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出VAMPS基准,通过1,168道双语多选题评估多模态大模型在借助绘图工具进行数学推理时的表现,发现直接解析求解优于工具辅助视觉求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04535 2026-06-04 cs.CL cs.AI 62%

Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language Models

扩散大语言模型中用于格式约束生成的动态填充锚点

Boyan Han, Yiwei Wang, Yi Song, Yujun Cai, Chi Zhang

机构 * AGI Lab, Westlake University, China(西溪大学AGI实验室,中国) University of California, Merced, USA(加州大学梅尔德分校,美国) Teeni AI, China(Teeni AI,中国) The University of Queensland, Australia(昆士兰大学,澳大利亚)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出动态填充锚点(DIA),一种无需训练的方法,通过动态估计结束锚点位置调整生成长度,确保格式约束下的结构正确性和语义连贯性,在GSM8K和MATH上实现零样本性能提升。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04964 2026-06-04 cs.CL 57%

SemBlock: Semantic Boundary Dynamic Blocks for Diffusion LLMs

SemBlock: 扩散语言模型的语义边界动态块

Xinrui Song, Zhuoran Wang, Mingju Gao, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出SemBlock框架,通过预测语义边界动态构建解码块,利用轻量预测器在冻结的LLaDA隐状态上训练,并在自然语言、数学和代码任务中优于固定块解码和AdaBlock。

Comments Code: https://github.com/TH-AI-Lab-PKU/SemBlock

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04889 2026-06-04 cs.CL 57%

GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards

GRAIL: 基于梯度重加权优势的可验证奖励强化学习

Tej Deep Pala, Vernon Toh, Soujanya Poria

机构 * DeCLaRe Lab, Nanyang Technological University(DeCLaRe实验室,南洋理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 针对强化学习中统一优势分配导致梯度信号稀释的问题,提出基于梯度激活显著性的令牌级优势重加权方法GRAIL,无需过程级监督即可提升推理对齐,在多个模型上平均准确率提升3.60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.03535 2026-06-04 q-fin.MF econ.GN q-fin.EC 50%

General Stopping Behaviors of Naive and Non-Committed Sophisticated Agents, with Application to Probability Distortion

朴素和非承诺的复杂代理的通用停止行为,及其在概率扭曲中的应用

Yu-Jui Huang, Adrien Nguyen-Huu, Xun Yu Zhou

专题命中 数学推理 :reasoning(abstract)

AI总结 本文研究了在时间不一致的收益函数下停止扩散过程的问题,分析了朴素代理的连续再优化决策和复杂代理的均衡策略,并探讨了概率扭曲对停止策略的影响。

Journal ref Mathematical Finance, Vol. 30 (2020), Issue 1, pp 310-340

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 4 篇

1710.02770 2026-06-04 cs.LO cs.SE cs.SY eess.SY 78%

Proceedings 2nd International Workshop on Causal Reasoning for Embedded and safety-critical Systems Technologies

第二届嵌入式和安全关键系统技术因果推理国际研讨会论文集

Alex Groce, Stefan Leue

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 本文探讨了复杂嵌入式和安全关键系统中因果推理的方法,旨在促进不同领域研究者之间的交流,以提升关键系统故障根本原因分析的科学性。

Journal ref EPTCS 259, 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09464 2026-06-04 cs.SE cs.AI cs.CL 62%

AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms

AlgoVeri:面向经典算法的验证代码生成对齐基准

Haoyu Zhao, Ziran Yang, Jiawei Li, Deyuan He, Zenan Li, Chi Jin, Venugopal V. Veeravalli, Aarti Gupta, Sanjeev Arora

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 代码与定理证明 :test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 为解决跨范式验证代码生成评估缺乏统一方法的问题,提出AlgoVeri基准,在Dafny、Verus和Lean三种语言上评估77个经典算法的验证代码生成,揭示不同验证系统的能力差距。

Comments Accepted to ICML 2026, 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04450 2026-06-04 cs.CL cs.CY 57%

Listening to the Workforce: Measuring Construction Worker Safety Attitudes from Social Media Discourse Using LLMs

倾听劳动力:使用LLMs从社交媒体话语中测量建筑工人安全态度

Farouq Sammour, Yuxin Zhang, Zhenyu Zhang

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 提出并验证了建筑安全态度框架(CSAF),通过LLM分类器从Reddit社区话语中测量工人安全态度,实现高精度多维分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03303 2026-06-04 cs.AI 57%

LEAP: Supercharging LLMs for Formal Mathematics with Agentic Frameworks

LEAP:利用智能体框架增强形式化数学的大语言模型

Po-Nien Kung, Linfeng Song, Dawsen Hwang, Jinsung Yoon, Chun-Liang Li, Simone Severini, Mirek Olšák, Edward Lockhart, Quoc V Le, Burak Gokturk, Thang Luong, Tomas Pfister, Nanyun Peng

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google Cloud(谷歌云) Google DeepMind(谷歌DeepMind)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出LEAP智能体框架,通过分解问题、与Lean编译器交互及自我优化,使通用大模型在形式化定理证明上达到最先进性能,并在Putnam竞赛和Lean-IMO-Bench上超越专业系统。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 16 篇

2606.05030 2026-06-04 cs.CL cs.SC 92%

Imbuing Large Language Models with Bidirectional Logic for Robust Chain Repair

赋予大语言模型双向逻辑以进行稳健的链修复

Zehua Cheng, Wei Dai, Jiahao Sun, Thomas Lukasiewicz

机构 * Department of Computer Science, University of Oxford, UK(英国牛津大学计算机系) FLock.io Institute of Logic and Computation, TU Wien, Austria(奥地利技术大学逻辑与计算研究所)

专题命中 逻辑推理 :reasoning(summary_cn,abstract);logical reasoning(summary_cn,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 针对自回归链式推理中错误雪崩问题,提出Teleological Reasoning Infilling (TRI)框架,通过将错误推理段重构为填充中间任务并引入前缀-后缀-中间序列重排,结合符号验证器监督微调和直接偏好优化,实现仅修复受损段的高效链修复。

Comments 25 Pages

Journal ref In Proceedings of European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14054 2026-06-04 cs.AI cs.CV 85%

Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning

Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning

Haozhe Wang, Qixin Xu, Changpeng Wang, Taofeng Xue, Chong Peng, Wenhu Chen, Fangzhen Lin

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 逻辑推理 :reasoning(title,title_cn);分类 cs.AI

AI总结 提出一种基于强化学习的模态感知信用分配框架(MoCA),通过感知验证和结构化口头验证解决视觉语言模型中感知与推理的权衡问题,实现多任务性能提升。

Comments Accepted by ICML 2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04381 2026-06-04 cs.LG cs.AI 81%

From Symbolic to Geometric: Enabling Spatial Reasoning in Large Language Models

从符号到几何:在大语言模型中实现空间推理

Chen Chu, Bita Azarijoo, Li Xiong, Khurram Shafique, Cyrus Shahabi

机构 * University of Southern California(南加州大学) Emory University(埃默里大学) Novateur Research Solutions(Novateur研究解决方案)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出空间语言模型(SLM),通过将位置信息作为一等模态并学习空间表示,在推理过程中实现几何空间推理,显著优于基于符号推理的现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04223 2026-06-04 cs.AI 79%

Consensus is Strategically Insufficient: Reasoning-Trace Disagreement as a Knowledge-Representation Signal

共识在策略上是不充分的:推理轨迹分歧作为知识表示信号

Michał Wawer, Jarosław A. Chudziak

机构 * Laboratory of The New Ethos(新伦理实验室) Warsaw University of Technology(华沙理工大学) Institute of Computer Science(计算机科学研究所) Faculty of Electronics and Information Technology(电子与信息技术学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出在价值负载任务中,分歧可能反映规范不确定性而非错误,通过将推理轨迹和决策抽象为符号分歧状态,构建知识表示层以支持可废止策略路由,连接亚符号LLM审议与符号知识表示。

Comments Accepted to LAMAS&SR workshop at FLoC 2026 (KR + ICPL + LICS + CP + FSCD)

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.01579 2026-06-04 eess.SY cs.RO cs.SY 78%

Motion and Cooperative Transportation Planning for Multi-Agent Systems under Temporal Logic Formulas

多智能体系统在时序逻辑公式下的运动与协作运输规划

Christos K. Verginis, Dimos V. Dimarogonas

机构 * KTH Center for Autonomous Systems(KTH 自主系统中心)

专题命中 逻辑推理 :planning(title,abstract)

AI总结 本文提出一种混合控制框架,用于在高阶目标表达为线性时序逻辑(LTL)公式的情况下,多智能体系统的运动规划。设计控制协议以实现智能体在预定义兴趣区域间的过渡及协作运输物体。通过抽象智能体与物体的耦合行为为有限状态转移系统,设计满足智能体和物体规格的高层多智能体计划。

Comments Submitted to IEEE Transactions on Automation Science and Engineering. arXiv admin note: text overlap with arXiv:1611.05186

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.11085 2026-06-04 eess.SY cs.SY 78%

Communication-aware Motion Planning for Multi-agent Systems from Signal Temporal Logic Specifications

面向信号时间逻辑规范的多智能体通信感知运动规划

Zhiyu Liu, Jin Dai, Bo Wu, Hai Lin

专题命中 逻辑推理 :planning(title,abstract)

AI总结 本文提出一种数学框架,用于合成满足复杂高层正式局部规范的多智能体运动计划,通过联合优化运动规划与无线通信,确保通信质量的同时避免碰撞。

Comments 6 pages, 3 figures. arXiv admin note: text overlap with arXiv:1705.10259

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04360 2026-06-04 cs.CL cs.LG 76%

Deliberate Evolution: Agentic Reasoning for Sample-Efficient Symbolic Regression with LLMs

Deliberate Evolution: 基于智能体推理的样本高效符号回归与LLM

Xinyu Pang, Zhanke Zhou, Xuan Li, Fangrui Lv, Shanshan Wei, Sen Cui, Bo Han, Changshui Zhang

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组) Beijing National Research Center for Information Science(北京信息科学国家研究中心) Technology (BNRist), Department of Automation, Tsinghua University, Beijing, P.R. China(技术(BNRist),自动化系,清华大学,北京,中华人民共和国) Lenovo Research(联想研究)

专题命中 逻辑推理 :reasoning(title);分类 cs.CL、cs.LG

AI总结 提出Deliberate Evolution框架,通过解耦符号生成与搜索控制,利用自适应算子、分析工具和反思记忆,在仅用40%样本预算下超越现有LLM符号回归方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.06888 2026-06-04 eess.SY cs.SY 71%

On the Timed Temporal Logic Planning of Coupled Multi-Agent Systems

关于耦合多智能体系统的时序时序逻辑规划

Alexandros Nikou, Dimitris Boskos, Jana Tumova, Dimos V. Dimarogonas

专题命中 逻辑推理 :planning(title)

AI总结 本文提出一种自动控制器合成方法,用于满足耦合约束的多智能体系统。通过设计分布式抽象和形式验证技术,计算满足高阶任务的个体运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04816 2026-06-04 cs.AI cs.LG 62%

Beyond Objective Equivalence: Constraint Injection for LLM-Based Optimization Modeling on Vehicle Routing Problems

超越目标等价性:基于LLM的车辆路径问题优化建模的约束注入

Xizi Luo, Changhong He, Dongdong Geng, Chenggong Shi, Yu Mei

机构 * Beihang University(北京航空航天大学) Baidu Inc.(百度公司)

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM在约束密集的运筹问题中可能添加虚假约束或遗漏必要约束的问题,提出约束注入方法,结合差分测试形成双重验证器,并在车辆路径问题上验证其有效性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03542 2026-06-04 cs.CL cs.LG 62%

Can Large Language Models Generalize Procedures Across Representations?

大型语言模型能否跨表示泛化过程?

Fangru Lin, Valentin Hofmann, Xingchen Wan, Weixing Wang, Zifeng Ding, Anthony G. Cohn, Janet B. Pierrehumbert

机构 * Stanford University(斯坦福大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 研究大型语言模型在代码、图与自然语言等不同表示间泛化过程的能力,提出两阶段强化学习课程来弥合差距。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.10532 2026-06-04 eess.SY cs.AI cs.LG cs.SY 62%

Interpretable Apprenticeship Learning with Temporal Logic Specifications

具有时序逻辑规范的可解释模仿学习

Daniel Kasenberg, Matthias Scheutz

专题命中 逻辑推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过多目标优化从MDP中的行为轨迹推断LTL规范,采用违反成本概念设计状态和动作基于的目标函数,并通过遗传算法在简单领域验证方法有效性。

Comments Accepted to the 56th IEEE Conference on Decision and Control (CDC 2017)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04325 2026-06-04 cs.CL 57%

Parameter-Efficient Fine-Tuning with Learnable Rank

可学习秩的参数高效微调

Arpit Garg, Simon Lucey, Hemanth Saratchandran

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出LR-LoRA方法,通过训练过程中学习适配器秩而非固定秩,在语言理解和常识推理基准上达到最先进性能。

Comments In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29928 2026-06-04 cs.HC cs.AI 57%

Label Over Logic? How Source Cues Bias Human Fallacy Judgments More Than LLMs

标签胜过逻辑?源标签如何比LLMs更严重地偏差人类的谬误判断

Mahjabin Nahar, Nafis Irtiza Tripto, Aiping Xiong, Ting-Hao 'Kenneth' Huang, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 通过在线实验和LLM对比,发现人类在评估逻辑谬误时显著受到内容源标签(如人类、AI等)的影响,而LLM评估相对稳定,表明源标签偏差主要是人类的弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏