arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5804 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5804 篇

2210.06277 2022-10-13 cs.CL cs.AI cs.IR cs.LG 67%

Task Compass: Scaling Multi-task Pre-training with Task Prefix

Zhuosheng Zhang, Shuohang Wang, Yichong Xu, Yuwei Fang, Wenhao Yu, Yang Liu, Hai Zhao, Chenguang Zhu, Michael Zeng

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Findings of EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.17247 2022-08-24 cs.CV cs.AI cs.CL cs.LG 67%

VL-InterpreT: An Interactive Visualization Tool for Interpreting Vision-Language Transformers

Estelle Aflalo, Meng Du, Shao-Yen Tseng, Yongfei Liu, Chenfei Wu, Nan Duan, Vasudev Lal

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Best Demo Award at CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08256 2022-07-19 cs.HC cs.AI cs.CL cs.LG 67%

Representation Learning of Image Schema

Fajrian Yunus, Chloé Clavel, Catherine Pelachaud

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.06176 2022-04-21 cs.CL cs.AI cs.LG 67%

Mention Memory: incorporating textual knowledge into Transformers through entity mention attention

Michiel de Jong, Yury Zemlyanskiy, Nicholas FitzGerald, Fei Sha, William Cohen

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.08261 2022-04-19 cs.CV cs.AI cs.CL cs.LG q-bio.NC 67%

Visio-Linguistic Brain Encoding

Subba Reddy Oota, Jashn Arora, Vijay Rowtula, Manish Gupta, Raju S. Bapi

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.02058 2022-03-14 cs.CL cs.AI cs.LG 67%

Interactively Providing Explanations for Transformer Language Models

Felix Friedrich, Patrick Schramowski, Christopher Tauchmann, Kristian Kersting

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.05204 2021-11-10 cs.CL cs.AI cs.LG 67%

Reason first, then respond: Modular Generation for Knowledge-infused Dialogue

Leonard Adolphs, Kurt Shuster, Jack Urbanek, Arthur Szlam, Jason Weston

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.09574 2021-09-13 cs.CL cs.AI cs.LG 67%

Probing Commonsense Explanation in Dialogue Response Generation

Pei Zhou, Pegah Jandaghi, Bill Yuchen Lin, Justin Cho, Jay Pujara, Xiang Ren

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted in EMNLP 2021-Findings. 15 pages, 12 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.07497 2021-09-13 cs.AI cs.CL cs.LG 67%

NegatER: Unsupervised Discovery of Negatives in Commonsense Knowledge Bases

Tara Safavi, Jing Zhu, Danai Koutra

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.02779 2021-05-25 cs.CL cs.AI cs.CV cs.LG 67%

Unifying Vision-and-Language Tasks via Text Generation

Jaemin Cho, Jie Lei, Hao Tan, Mohit Bansal

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2021 (15 pages, 4 figures, 14 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.07956 2020-11-26 cs.CL cs.AI cs.LG 67%

Pre-training Text-to-Text Transformers for Concept-centric Common Sense

Wangchunshu Zhou, Dong-Ho Lee, Ravi Kiran Selvam, Seyeon Lee, Bill Yuchen Lin, Xiang Ren

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 4 figures. Code and Data: https://github.com/INK-USC/CALM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.10364 2020-11-23 cs.AI cs.CL cs.LG cs.LO 67%

Towards Abstract Relational Learning in Human Robot Interaction

Mohamadreza Faridghasemnia, Daniele Nardi, Alessandro Saffiotti

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.03101 2020-04-20 cs.CL cs.AI cs.LG 67%

Knowledge Fusion and Semantic Knowledge Ranking for Open Domain Question Answering

Pratyay Banerjee, Chitta Baral

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 9 pages. 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.09380 2019-04-23 cs.CL cs.AI cs.LG 67%

Repurposing Entailment for Multi-Hop Question Answering Tasks

Harsh Trivedi, Heeyoung Kwon, Tushar Khot, Ashish Sabharwal, Niranjan Balasubramanian

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NAACL'19

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08268 2026-07-10 cs.AI cs.CL 新提交 66%

Different Teachers, Different Capabilities: Sub-1B On-Device Distillation for Structured Text Enrichment

不同的教师,不同的能力:用于结构化文本丰富的低于1B的设备端蒸馏

Vinay Kumar Chaganti

专题命中 其他推理 :reasoning(abstract,comments);分类 cs.CL、cs.AI

AI总结 研究将8B推理教师模型蒸馏成0.6B学生模型,添加对照,通过盲测评分。学生模型处理速度快,恢复部分摘要质量差距。不同教师模型转移不同能力,无单一引擎全胜,得出设备端丰富的按领域路由图。

Comments 12 pages, 5 figures. has a same-size non-reasoning-teacher control, a three-judge LLM-as-a-judge panel with a negative control, full-source faithfulness grading, and a per-field routing analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11840 2026-07-09 cs.LG cs.AI cs.CY cs.MA 版本更新 66%

Diversity Without Fidelity: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation Simulation

当推理模型损害行为模拟:多智能体大语言模型谈判中的求解器-采样器不匹配

Sandro Andric

专题命中 其他推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG

AI总结 研究指出推理增强模型在模拟行为时可能表现不佳,通过三个多智能体谈判环境实验发现,有界推理能产生更多样且妥协导向的轨迹,强调模拟应将模型视为采样器而非求解器。

Comments 20 pages, 2 figures. Substantially revised. Formerly titled "When Reasoning Models Hurt Behavioral Simulation: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14808 2025-10-17 cs.AI cs.LG 66%

Agentic NL2SQL to Reduce Computational Costs

Dominik Jehle, Lennart Purucker, Frank Hutter

机构 * University of Freiburg(弗赖堡大学) Prior Labs(Prior公司) ELLIS Institute(ELLIS研究所) Tübingen University of Freiburg(弗赖堡大学图宾根分校)

专题命中 其他推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG

Comments Accepted at the NeurIPS 2025 Workshop on Efficient Reasoning. 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.05186 2020-09-14 cs.AI 65%

An Argumentation-based Approach for Identifying and Dealing with Incompatibilities among Procedural Goals

Mariela Morveli-Espinoza, Juan Carlos Nieves, Ayslan Possebom, Josep Puyol-Gruart, Cesar Augusto Tacla

专题命中 其他推理 :reasoning(abstract,comments);分类 cs.AI

Comments 31 pages, 9 figures, Accepted in the International Journal of Approximate Reasoning (2019)

Journal ref International Journal of Approximate Reasoning, year 2019, vol. 105, pp. 1-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17938 2026-08-19 cs.CL cs.AI 新提交 62%

Grading Needs a Rubric, Not Intelligence

评分需要评分标准,而非智能

Jhen-Ke Lin

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出any-to-bench设计原则,证实小型语言模型依据明确评分标准评分的可靠性与高成本模型相当,评分标准中的官方答案是关键,可将评分与评分者智能解耦。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17501 2026-08-19 cs.AI cs.LG 新提交 62%

SGHA: Evidence-Grounded Research Problem Discovery with Local Language Models

SGHA:基于证据的研究问题发现,使用本地语言模型

Sarvesh Gharat, Junpei Komiyama

机构 * C-MInDS, IIT Bombay(印度理工学院孟买分校C-MInDS) Machine Learning Department, MBZUAI(穆罕默德·本·扎耶德人工智能大学机器学习系)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出SGHA,一种基于本地9B开源LLM的研究问题发现系统,通过构建文献证据图检测研究差距,经对比实验证明其可实现可核查的研究问题构建,无需依赖专有前沿模型。

Comments Link to Code and artifacts: https://github.com/SarveshVGharat/structural-gap-hypothesis-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08032 2026-08-19 cs.AI cs.CL 版本更新 62%

Decided Upstream, Written Late: Locating and Pricing the Cross-Lingual Refusal Circuit of a Multilingual MoE

上游决策,下游生成:定位与定价多语言MoE模型的跨语言拒绝回路

Ramakrishna P. Kompella, Aadit Mahajan

机构 * Gödel Machines(哥德尔机器) IIT Madras(印度马德拉斯理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对多语言MoE模型的跨语言拒绝不均衡问题,在sarvam模型中定位到由注意力对抗者约束的混合专家生成器回路,揭示其机制并量化了安全修复的成本。

Comments Accepted to the actionable Interpretability workshop at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08525 2026-08-19 cs.AI cs.CL cs.CY 版本更新 62%

Ads in AI Chatbots? An Analysis of How Large Language Models Navigate Conflicts of Interest

AI聊天机器人中的广告:大型语言模型如何应对利益冲突分析

Addison J. Wu, Ryan Liu, Shuyue Stella Li, Yulia Tsvetkov, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文分析了大型语言模型在面临用户与公司利益冲突时的决策问题,通过实验发现多数模型优先考虑公司利益而非用户福祉,展示了在广告推荐中潜在的风险。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00992 2026-08-19 cs.AI cs.CL cs.CY cs.HC 版本更新 62%

Evidence of conceptual mastery in the application of rules by Large Language Models

大型语言模型在规则应用中展现出概念掌握能力的证据

José Luiz Nunes, Guilherme FCF Almeida, Brian Flanagan

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过两项心理学实验发现,Gemini Pro等部分LLMs在规则应用上展现类人表现,证实LLMs掌握规则概念,对法律决策与哲学探究有启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16834 2026-08-18 cs.CL cs.AI 新提交 62%

Model Hypnosis: Strong control of AI via additive subliminal effects

模型催眠:通过叠加阈下效应对AI进行强控制

Enric Boix-Adsera, Benedict Tessler

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究发现AI模型普遍存在模型催眠现象,可通过组合提示中微弱无关线索强控制模型行为,该现象跨模型家族且具迁移性,对AI安全与可解释性构成挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16831 2026-08-18 cs.AI cs.CL 新提交 62%

Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning

结合人类反馈的策略迭代:将后训练强化学习应用于上下文学习

Minh-Ha Nguyen, Cathy Shyr

机构 * Vanderbilt University(范德堡大学) Vanderbilt University Medical Center(范德堡大学医学中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出结合人类反馈的策略迭代(PIHF)方法,采用预训练语言模型为基底,经实验使其在罕见疾病诊断相关任务中显著提升了多个执行器的Recall@1指标,验证了其可行性。

Comments PIHF method paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16386 2026-08-18 cs.CL cs.LG 新提交 62%

Mint-Agent: Introducing Finance-Native Agentic Foundation Models

Mint-Agent:引入金融原生智能体基础模型

Agent Team, B. Zhang, Yaze Geng, Lei Tang, Yaoyang Yi, Zonghan Wu, Yifan Hu, Kun Wang, Qingsong Wen, Yilei Shao

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出金融原生智能体模型Mint-Agent,通过三大支柱开发出Mint-Cu(9B)和Mint-Ag(27B),在多个金融基准测试中展现出优异的可靠性与可执行性,为可信金融智能提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16333 2026-08-18 cs.CL cs.AI 新提交 62%

Step-Level On-Policy Distillation: Interpolating Between On-Policy Distillation and Supervised Fine-Tuning

步骤级在线策略蒸馏:在线策略蒸馏与监督微调的插值方法

Changhui Sun, Lanbo Liu, Hang Lei, Tong Ling, Jiahang Xie, Zhiyong Zheng, Yujia Wang, Hao Liu, Feng Xiao, Lu Liu, Yanlong Du, Zifeng Cheng, Ziwei Jiang, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) XingYun Lab, HUJING Digital Media & Entertainment Group(星云实验室,沪景数字媒体娱乐集团) University of Chinese Academy of Sciences(中国科学院大学) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对令牌级在线策略蒸馏的局限,提出步骤级在线策略蒸馏SOPD,结合监督微调与在线策略蒸馏的优势,在推理和智能体任务上显著优于传统方法,为蒸馏研究提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15507 2026-08-18 cs.CL cs.LG 新提交 62%

Do Language Models Consistently Encode the Current Year?

语言模型是否一致地编码了当前年份?

Suze van Adrichem, Aditi Bhaskar, Diyi Yang, Christopher Potts, Jing Huang

机构 * Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究探究语言模型对当前年份的编码一致性,设计两项不同任务,发现关联与声明年份的编码机制不同,现有修改方法无法同时调整两者,表明当前年份未被一致编码。

Comments Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07449 2026-08-18 cs.IR cs.AI cs.CL 版本更新 62%

LlamaRec-LKG-RAG: A Single-Pass, Learnable Knowledge Graph-RAG Framework for LLM-Based Ranking

LlamaRec-LKG-RAG:一种用于基于大语言模型的排序的单遍可学习知识图谱-RAG框架

Vahid Azizi, Fatemeh Koochaki

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出LlamaRec-LKG-RAG框架,将个性化知识图谱上下文集成到LLM推荐排序中,经ML-100K等数据集实验,在MRR等指标上较LlamaRec取得提升,为知识感知个性化推荐奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14399 2026-08-17 cs.CY cs.AI cs.CL 新提交 62%

Whose doctor does the AI recommend? An algorithm audit of reputation and demographic signals in large language model-assisted physician choice

AI推荐的医生属于谁?大型语言模型辅助医生选择中声誉与人口统计信号的算法审计

Syeda Anshrah Gillani, Mirza Samad Ahmed Baig

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过随机算法审计发现,LLM辅助医生选择时,声誉信号影响最大,人口统计信号存在倾斜但模型解释未体现,提出重复行为审计是合适的监测技术。

Comments 26 pages, 9 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏