arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-29 至 2026-04-29 共收录 40 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 40 篇

2604.25053 2026-04-29 cs.CL cs.AI 92%

Analyzing LLM Reasoning to Uncover Mental Health Stigma

分析LLM推理以揭示心理健康污名

Sreehari Sankar, Aliakbar Nafar, Mona Barman, Hannah K. Heitz, Ashwin Kumar, Pouria Tohidi, Dailun Li, Danish Hussain, Russell DuBois, Hamed Hasheminia, Farshad Majzoubi

机构 * BetterHelp

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析LLM推理过程,揭示隐藏的污名化语言及内部逻辑,利用临床专业知识分类污名化模式,并扩展心理健康污名基准以识别模型逻辑缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07236 2026-04-29 cs.AI cs.CL 91%

How Much Heavy Lifting Can an Agent Harness Do?: Measuring the LLM's Residual Role in a Planning Agent

代理能承载多少实质性工作?:测量规划代理中LLM的残余作用

Sungwoo Jung, Seonil Son

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过外部测量规划代理各层,量化LLM在决策中的残余作用,发现声明性规划承担主要工作,而符号反思和LLM支持的修订仅在特定情况下生效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24790 2026-04-29 cs.CR cs.AI 91%

Semantic Denial of Service in LLM-controlled robots

语义拒绝服务在LLM控制的机器人中

Jonathan Steinberg, Oren Gal

机构 * Swarms & AI Lab (SAIL) University of Haifa(群集与人工智能实验室(SAIL)海法大学)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 本文研究了LLM控制机器人中语义拒绝服务攻击,发现通过注入安全可信的短语可触发安全推理中断,提出防御策略需平衡攻击抑制与真实危险响应,强调系统架构而非提示级别的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15707 2026-04-29 cs.CL cs.AI 91%

Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?

大型语言模型在推理任务上的表现是否受提问方式的影响?

Seok Hwan Song, Mohna Chakraborty, Qi Li, Wallapak Tavanapong

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究探讨了不同提问方式对大型语言模型推理任务准确性的影响,发现问题类型显著影响模型表现,选项数量和用词选择也会影响最终答案选择的准确性。

Comments ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14248 2026-04-29 cs.AI cs.CL 90%

Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective

为什么基于大语言模型的网络代理会失败?一种分层规划视角

Mohamed Aghzal, Gregory J. Stein, Ziyu Yao

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文从分层规划角度分析了LLM网络代理失败原因,发现低层执行是主要瓶颈,改进感知接地和自适应控制对实现人类可靠性至关重要。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12283 2026-04-29 cs.HC 90%

Large Language Models have Chain-of-Affect

大型语言模型具有情感链

Junjie Xu, Xingjiao Wu, Luwei Xiao, Yuzhe Yang, Jie Zhou, Zihao Zhang, Luhan Wang, Yi Huang, Nan Wu, Yingbin Zheng, Chao Yan, Cheng Jin, Honglin Li, Liang He

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 研究探讨了大型语言模型在持续交互中情感状态的演变,发现其情感动态具有结构性和可重复性,影响生成、用户体验及集体动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25880 2026-04-29 cs.SE 89%

From Threads to Trajectories: A Multi-LLM Pipeline for Community Knowledge Extraction from GitHub Issue Discussions

从线程到轨迹:一个多LLM管道用于从GitHub问题讨论中提取社区知识

Nazia Shehnaz Joynab, Soneya Binta Hossain

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 本文提出SWE-MIMIC-Bench数据集,通过多LLM管道从GitHub讨论生成问题轨迹,用于提取复杂问题的结构化知识,提升软件工程社区的协作理解与LLM训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25247 2026-04-29 cs.CR 89%

R-CoT: A Reasoning-Layer Watermark via Redundant Chain-of-Thought in Large Language Models

R-CoT:通过冗余链式推理的推理层水印

Ziming Zhang, Li Li, Guorui Feng, Hanzhou Wu, Xinpeng Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 本文提出R-CoT方法,通过在大语言模型的推理路径中嵌入水印,利用双轨迹优化机制实现水印与原推理路径共存,提升水印的鲁棒性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24832 2026-04-29 cs.LG cs.AI 88%

On the Trainability of Masked Diffusion Language Models via Blockwise Locality

通过块级局部性训练掩码扩散语言模型

Yuxiang Wang, Yu Xiang, Baojian Zhou, Qifang Zhao, Keyue Jiang, Yanghua Xiao, Xiaoxiao Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Alibaba Group, China(阿里巴巴集团,中国)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过块级局部性改进掩码扩散语言模型,发现其在结构生成任务中稳定性不足,提出Jigsaw和Scatter模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25039 2026-04-29 cs.CL cs.AI 87%

Dual-Track CoT: Budget-Aware Stepwise Guidance for Small LMs

双轨CoT:面向小语言模型的预算感知逐步引导

Sagnik Chatterjee, Atharva Patil, Sricharan Ramesh

专题命中 推理与问题求解 :SLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出双轨CoT方法,旨在通过预算感知的逐步引导提升小语言模型的多步推理能力,解决传统方法在计算和token预算限制下的性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25684 2026-04-29 cs.AI 86%

Think Before You Act -- A Neurocognitive Governance Model for Autonomous AI Agents

在行动前思考--一种用于自主AI代理的神经认知治理模型

Eranga Bandara, Ross Gore, Asanga Gunaratna, Sachini Rajapakse, Isurunima Kularathna, Ravi Mukkamala, Sachin Shetty, Xueping Liang, Amin Hass, Tharaka Hewa, Abdul Rahman, Christopher K. Rhea, Anita H. Clayton, Preston Samuel, Atmaram Yarlagadda

机构 * Old Dominion University(老奥德纳大学) AI Motion Labs(AI运动实验室) Department of Psychiatry and Neurobehavioral Sciences(精神病学与神经行为科学系) University of Virginia School of Medicine(弗吉尼亚大学医学院) Florida International University(佛罗里达国际大学) Accenture Technology Labs(埃森哲技术实验室) Center for Wireless Communications(无线通信中心) University of Oulu(奥卢大学) Blanchfield Army Community Hospital(布莱恩菲尔德陆军社区医院) McDonald Army Health Center(麦克唐纳陆军健康中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种神经认知治理框架,通过将人类自我治理过程映射到LLM驱动的代理推理中,实现95%的合规准确率和零人工监督升级,展示嵌入治理的代理推理能产生更一致、可解释和可审计的合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05205 2026-04-29 cs.CL 86%

RELIC: Evaluating Complex Reasoning via the Recognition of Languages In-Context

RELIC:通过上下文语言识别评估复杂推理

Jackson Petty, Michael Y. Hu, Wentao Wang, Shauli Ravfogel, William Merrill, Tal Linzen

机构 * Department of Linguistics(语言学系) Center for Data Science(数据科学中心) New York University(纽约大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RELIC通过评估语言是否属于上下文无关文法生成的语言,衡量LLM的复杂推理能力,发现先进模型在任务复杂度增加时推理计算减少,策略转向猜测。

Comments Accepted to TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24831 2026-04-29 cs.SE cs.LG 83%

FGDM: Reasoning Aware Multi-Agentic Framework for Software Bug Detection using Chain of Thought and Tree of Thought Prompting

FGDM:基于推理的多智能体框架用于软件缺陷检测的链式思维和树式思维提示

Srita Padmanabhuni, Bhargavi Karuturi, Jerusha Karen Indupalli, Santhan Reddy Chilla, Vivek Yelleti

机构 * SRM University, Andhra Pradesh(安得拉邦SRM大学)

专题命中 推理与问题求解 :prompting(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出FGDM框架,利用链式思维和树式思维提示,通过流程图识别代码错误并生成修复代码,有效提升大型代码库中缺陷检测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25482 2026-04-29 cs.CL cs.AI 82%

From World-Gen to Quest-Line: A Dependency-Driven Prompt Pipeline for Coherent RPG Generation

从World-Gen到Quest-Line:一种依赖驱动的提示管道用于连贯的RPG生成

Dominik Borawski, Marta Szulc, Robert Chudy, Małgorzata Giedrowicz, Piotr Mironowicz

机构 * Gdańsk University of Technology(格但斯克技术大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种依赖驱动的提示管道,通过结构化中间表示建模叙事依赖,以生成连贯的RPG内容。该方法通过分阶段生成世界构建、NPC创建、玩家角色创建、战役级任务规划和任务扩展,减少叙事漂移并支持可扩展的叙事元素生成。

Comments 13 pages, 1 figure, 5 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25419 2026-04-29 cs.AI 81%

JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR

JURY-RL: 选票提议,证明判定用于无标签的RLVR

Xinjie Chen, Biao Fu, Jing Wu, Guoxin Chen, Xinggao Liu, Dayiheng Liu, Minpeng Liao

机构 * Zhejiang University, Hangzhou, China(浙江大学,杭州,中国) Tongyi Lab, Alibaba Group, Hangzhou, China(通义实验室,阿里巴巴集团,杭州,中国)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 JURY-RL提出一种无标签RLVR框架,通过模型回放提议候选答案,形式验证器判定是否可获正奖,从而稳定训练并提升数学推理性能。

Comments Preprint. 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24996 2026-04-29 cs.AI 81%

Sparse Personalized Text Generation with Multi-Trajectory Reasoning

稀疏个性化文本生成与多轨迹推理

Bo Ni, Haowei Fu, Qinwen Ge, Franck Dernoncourt, Samyadeep Basu, Nedim Lipka, Seunghyun Yoon, Yu Wang, Nesreen K. Ahmed, Subhojyoti Mukherjee, Puneet Mathur, Ryan A. Rossi, Tyler Derr

机构 * Department of Computer Science, Vanderbilt University, Nashville, Tennessee(范德比尔特大学计算机科学系) Adobe Research, San Jose, California(Adobe研究) University of Orgeon, Eugene, Oregon(奥尔戈恩大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PAT框架,通过双轨迹检索和强化学习机制提升冷启动场景下个性化文本生成的质量和对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21598 2026-04-29 cs.SE cs.AI 81%

You Don't Need Public Tests to Generate Correct Code

你不需要公共测试来生成正确代码

Kaushitha Silva, Srinath Perera

机构 * WSO2(WSO2公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DryRUN框架,通过让大语言模型自主生成测试输入并模拟执行,避免依赖公共测试用例,从而减少过自信偏差并提升代码生成效率。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16558 2026-04-29 cs.CR cs.AI 81%

A First Look at the Security Issues in the Model Context Protocol Ecosystem

对模型上下文协议生态系统安全问题的首次观察

Xiaofan Li, Xing Gao

机构 * University of Delaware, USA(德克萨斯大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次研究了模型上下文协议生态系统中的跨实体安全问题,揭示了注册表层面的漏洞和代码层面的攻击风险,提出了MCPInspect工具检测漏洞和可疑元数据。

Comments This paper has been accepted to DSN 2026. The title has been updated from the anonymous submission version used during double-blind review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16918 2026-04-29 cs.CV 80%

AdaTooler-V: Adaptive Tool-Use for Images and Videos

AdaTooler-V:面向图像和视频的自适应工具使用

Chaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MML实验室) THU(清华大学) SJTU(上海交通大学) DB Group, CUHK(香港中文大学DB小组) UCF(佛罗里达大学) Sangfor(Sangfor公司) JMU(约翰·霍普金斯大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AdaTooler-V,通过自适应工具使用提升多模态大语言模型的视觉推理能力,通过强化学习算法和定制数据集优化工具调用策略,实验证明其在多种视觉任务中表现优异。

Comments ACL 2026 Findings, Project page: https://github.com/CYWang735/AdaTooler-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03043 2026-04-29 cs.CV 80%

OneThinker: All-in-one Reasoning Model for Image and Video

OneThinker:面向图像和视频的统一推理模型

Kaituo Feng, Manyuan Zhang, Hongyu Li, Kaixuan Fan, Shuang Chen, Yilei Jiang, Dian Zheng, Peiwen Sun, Yiyuan Zhang, Haoze Sun, Yan Feng, Peng Pei, Xunliang Cai, Xiangyu Yue

机构 * MMLab, CUHK(CUHK多媒体实验室) Meituan Home(美团家)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 OneThinker提出一个统一的多模态推理模型,整合图像和视频理解,涵盖问答、描述生成、空间时间定位、跟踪和分割等任务,通过构建大规模训练语料和EMA-GRPO算法提升多任务强化学习效果。

Comments CVPR 2026, Project page: https://github.com/tulerfeng/OneThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25276 2026-04-29 cs.CV 80%

OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding

OmniVTG:一种大规模数据集和开放世界视频时间定位的训练范式

Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Central Media Technology Institute, Huawei Technologies Ltd.(华为技术有限公司中央媒体技术研究所) PKU-WUHAN Institute for Artificial Intelligence, Peking University(北京大学武汉人工智能研究所)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出OmniVTG数据集和Self-Correction Chain-of-Thought训练范式,通过语义覆盖迭代扩展管道构建大规模数据集,并利用多模态大语言模型的密集描述能力提升视频时间定位性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25155 2026-04-29 eess.SP 80%

Rethinking Wireless Communications through Formal Mathematical AI Reasoning

通过形式数学AI推理重新思考无线通信

Changyuan Zhao, Jiacheng Wang, Dusit Niyato, Zan Li, Abbas Jamalipour, Shiwen Mao, Xianbin Wang, Dong In Kim

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出通过形式数学AI推理重新构建无线通信理论,提出验证、推导和发现三层框架,推动无线数学知识的建立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22875 2026-04-29 cs.CV cs.AI 79%

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

SketchVLM:视觉语言模型可以注释图像以解释思路并引导用户

Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(阿伯拉罕大学) Adobe Research(Adobe研究)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 SketchVLM通过生成可编辑的SVG叠加图提升视觉推理和绘图任务的准确性与注释质量,实现高达28.5%的精度提升和1.48倍的注释质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16518 2026-04-29 cs.RO cs.CL cs.CV 79%

MiMo-Embodied: X-Embodied Foundation Model Technical Report

MiMo-Embodied:X-Embodied基础模型技术报告

Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhui Meng, Yuchen Zhang, Jing Wu, Jinghui Lu, Chenxu Dang, Jiayi Guan, Jianhua Wu, Zhiyi Hou, Hanbing Li, Shumeng Xia, Mingliang Zhou, Yinan Zheng, Zihao Yue, Shuhao Gu, Hao Tian, Yuannan Shen, Jianwei Cui, Wen Zhang, Shaoqing Xu, Bing Wang, Haiyang Sun, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Chaofan Zhang, Wenbo Ding, Kun Ma, Guang Chen, Rui Cai, Diyun Xiang, Heng Qu, Fuli Luo, Hangjun Ye, Long Chen

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.CL

AI总结 MiMo-Embodied是首个跨具身基础模型,成功整合并实现自动驾驶和具身AI领域的最先进性能,在17个具身AI基准和12个自动驾驶基准中均取得新纪录,通过多阶段学习、数据构建和CoT/RL微调实现领域间的强正迁移。

Comments Code: https://github.com/XiaomiMiMo/MiMo-Embodied | Model: https://huggingface.co/XiaomiMiMo/MiMo-Embodied-7B

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19699 2026-04-29 cs.CL cs.CY 77%

Epistemic orientation in parliamentary discourse is associated with deliberative democracy

议会话语中的认知倾向与 deliberative democracy 的关联

Segun Aroyehun, Stephan Lewandowsky, David Garcia

机构 * Department of Politics and Public Administration, University of Konstanz(康斯坦茨大学政治与公共行政系) School of Psychological Science, University of Bristol(布里斯托大学心理学科学学院) Complexity Science Hub(复杂性科学中心) Department of Psychology, University of Potsdam(波茨坦大学心理学系)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过EMI评分分析议会话语中的认知倾向,发现其与democratic deliberation和治理质量正相关,揭示政治话语的认知特性对民主和治理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24179 2026-04-29 cs.CL cs.AI 73%

MemeScouts@LT-EDI 2026: Asking the Right Questions -- Prompted Weak Supervision for Meme Hate Speech Detection

MemeScouts@LT-EDI 2026:问对问题——针对弱监督的提示方法用于表情包仇恨言论检测

Ivo Bueno, Lea Hirlimann, Enkelejda Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种提示弱监督方法,通过分解表情包理解为基于问题的标注函数,提升多语言多模态仇恨言论检测效果,尤其在中文和印地语中表现突出。

Comments Accepted at Sixth Workshop on Language Technology for Equality, Diversity and Inclusion at ACL2026 (LT-EDI@ACL26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25423 2026-04-29 cs.CL cs.AI 73%

Do LLMs Capture Embodied Cognition and Cultural Variation? Cross-Linguistic Evidence from Demonstratives

大语言模型能捕捉具身认知和文化差异吗?来自跨语言证据的示范词研究

Yu Wang, Emmanuele Chersoni, Chu-Ren Huang

机构 * Department of Language Science and Technology(语言科学与技术系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过示范词研究探讨大语言模型对具身认知和文化差异的捕捉能力,发现人类在视角转换和距离判断上存在文化差异,而LLMs则缺乏这种理解且默认英语中心化推理。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14862 2026-04-29 cs.CL cs.AI 73%

Schema Key Wording as an Instruction Channel in Structured Generation under Constrained Decoding

模式键作为在受限解码下的指令通道在结构生成中的应用

Yifan Le

机构 * Zhejiang University(浙江大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了在受限解码中模式键作为隐式指令通道的作用,提出结构生成是多通道指令问题,并通过实验展示模式键词汇对准确性的影响,揭示了不同模型对不同通道的依赖性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14174 2026-04-29 cs.CL cs.LG 73%

Cheaper, Better, Faster, Stronger: Robust Text-to-SQL without Chain-of-Thought or Fine-Tuning

更便宜、更好、更快、更强:无需链式思维或微调的鲁棒性文本到SQL

Yusuf Denizay Dönder, Derek Hommel, Andrea W Wen-Yi, David Mimno, Unso Eun Seo Jo

机构 * Gena Co.(Gena公司) Cornell University(康奈尔大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出N-rep一致性方法,通过多重表示缓解单一表示的弱点,以更低成本实现与更昂贵方法相似的BIRD基准表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25521 2026-04-29 cs.AI 70%

Automated Adversarial Collaboration for Advancing Theory Building in the Cognitive Sciences

自动化对抗协作促进认知科学理论构建

Suyog Chandramouli, George Kachergis, Akshay Jagadish

机构 * Department of Psychology, Princeton University(普林斯顿大学心理学系) Department of Psychology, Stanford University(斯坦福大学心理学系) Princeton AI Lab, Princeton University(普林斯顿大学人工智能实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出自动化对抗协作框架,通过闭环模拟验证认知科学理论 adjudication,展示了在噪声环境下恢复真实理论的可行性。

Comments 2 pages

详情

展开后加载摘要…

URL PDF HTML 收藏