arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-06 至 2026-03-06 共收录 236 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 18 篇

2603.05498 2026-03-06 cs.AI cs.CL 62%

The Spike, the Sparse and the Sink: Anatomy of Massive Activations and Attention Sinks

尖峰、稀疏与汇点:大规模激活与注意力汇点的解剖

Shangwen Sun, Alfredo Canziani, Yann LeCun, Jiachen Zhu

机构 * New York University(纽约大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了Transformer中大规模激活与注意力汇点的关联性及作用机制,指出预归一化配置是二者共存的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04688 2026-03-06 q-bio.NC cs.AI cs.LG stat.ML 62%

Why the Brain Consolidates: Predictive Forgetting for Optimal Generalisation

为何大脑进行巩固:为最优泛化而预测遗忘

Zafeirios Fountas, Adnan Oomerjee, Haitham Bou-Ammar, Jun Wang, Neil Burgess

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) AI Centre, Department of Computer Science, University College London(大学计算机科学系人工智能中心) UCL Institute of Cognitive Neuroscience, University College London(大学认知神经科学研究所) UCL Queen Square Institute of Neurology, University College London(大学Queen Square神经学研究所)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出高容量神经网络通过预测遗忘优化存储表征的泛化能力,揭示了离线巩固在优化保留与泛化权衡中的计算作用。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04815 2026-03-06 cs.AI 57%

EchoGuard: An Agentic Framework with Knowledge-Graph Memory for Detecting Manipulative Communication in Longitudinal Dialogue

EchoGuard: 一种基于知识图谱记忆的代理框架,用于检测纵向对话中的操纵性沟通

Ratna Kandala, Niva Manchanda, Akshata Kishore Moharir, Ananth Kandala

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 EchoGuard通过知识图谱记忆和结构化循环检测纵向对话中的操纵性沟通,提升个体识别能力与自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01145 2026-03-06 cs.AI 57%

AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolution

AutoSkill: 通过技能自我进化实现经验驱动的终身学习

Yutao Yang, Junsong Li, Qianjun Pan, Bihao Zhan, Yuxuan Cai, Lin Du, Jie Zhou, Kai Chen, Qin Chen, Xin Li, Bo Zhang, Liang He

机构 * School of Computer Science and Technology, East China Normal University(1 计算机科学与技术学院,东华大学) Shanghai AI Laboratory(2 上海人工智能实验室)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 AutoSkill通过技能自我进化实现经验驱动的终身学习,使LLM代理能够自动推导、维护和重用技能,提升个性化能力的持续性和可重用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04826 2026-03-06 cs.DC 50%

The Semantic Arrow of Time, Part V: The Leibniz Bridge -- Toward a Unified Theory of Semantic Time

时间的语义箭头,第五部分:莱布尼茨桥——语义时间的统一理论

Paul Borrill

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文通过构建莱布尼茨桥,提出一个连接哲学、协议工程和物理的统一框架,解决FITO系统中的分布式计算难题。

Comments 6 figures. Part V of V in "The Semantic Arrow of Time" series

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 44 篇

2601.02663 2026-03-06 cs.CL cs.AI 90%

When Do Tools and Planning Help Large Language Models Think? A Cost- and Latency-Aware Benchmark

当工具和规划如何帮助大语言模型思考?一个成本和延迟感知的基准测试

Subha Ghoshal, Ali Al-Bustami

机构 * College of Engineering(工程学院) University of Michigan-Dearborn(密歇根大学-迪尔伯恩分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究通过对比不同配置评估工具和规划对大语言模型性能的影响,发现工具增强能显著提升准确性但增加延迟,而复杂工具协调易导致模型退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08211 2026-03-06 cs.CL cs.AI 90%

Large Language Models are Contrastive Reasoners

大型语言模型是对比推理器

Liang Yao

机构 * Sun Yat-sen University Shenzhen, China(中山大学深圳校区)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出对比提示方法,通过简单提示提升大型语言模型的推理能力,在算术和常识推理任务中优于零样本和少样本方法。

Journal ref Expert Systems With Applications 301 (2026) 130407

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10534 2026-03-06 cs.AI 89%

Achieving Olympia-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning

通过复杂度提升强化学习实现奥lympia级几何大语言模型代理

Haiteng Zhao, Junhao Shen, Yiming Zhang, Songyang Gao, Kuikun Liu, Tianyou Ma, Fan Zheng, Dahua Lin, Wenwei Zhang, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) ICMAT Spanish National Research Council(西班牙国家研究委员会ICMAT) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 InternGeometry通过复杂度提升强化学习实现几何问题求解,仅用13K训练示例解决44个IMO问题,超越平均金牌得主得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04948 2026-03-06 cs.LG 87%

$\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space

∇-Reasoner: 通过潜在空间中的测试时间梯度下降进行LLM推理

Peihao Wang, Ruisi Cai, Zhen Wang, Hongyuan Mei, Qiang Liu, Pan Li, Zhangyang Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) UC San Diego(圣地亚哥大学) TTIC Georgia Tech(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 ∇-Reasoner通过潜在空间中的测试时间梯度下降提升LLM推理能力,实现20%以上的准确率提升并减少模型调用次数。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11063 2026-03-06 cs.RO cs.AI cs.CV cs.LG cs.MA 86%

EmboTeam: Grounding LLM Reasoning into Reactive Behavior Trees via PDDL for Embodied Multi-Robot Collaboration

EmboTeam: 通过PDDL将LLM推理接地为反应式行为树以实现具身多机器人协作

Haishan Zeng, Mengna Wang, Peng Li

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 EmboTeam通过PDDL将LLM推理转化为反应式行为树,提升多机器人协作任务的成功率和目标回忆率

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21033 2026-03-06 cs.AI 85%

Towards Trustworthy Legal AI through LLM Agents and Formal Reasoning

通过LLM代理和形式推理实现可信的法律AI

Linze Chen, Yufan Cai, Zhe Hou, Jin Song Dong

机构 * National University of Singapore(国立新加坡大学) Griffith University(格里菲斯大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 L4L通过LLM代理与形式推理实现法律AI的可信性,通过四个阶段确保法律推理的逻辑性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03153 2026-03-06 cs.SE cs.AI 85%

RefAgent: A Multi-agent LLM-based Framework for Automatic Software Refactoring

RefAgent:一种基于大型语言模型的多智能体框架,用于自动软件重构

Khouloud Oueslati, Maxime Lamothe, Foutse Khomh

机构 * Polytechnique Montreal(蒙特利尔大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RefAgent是一种基于多智能体的LLM框架,用于自动化软件重构,通过自我反思和工具调用能力提升重构效率和代码质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10539 2026-03-06 cs.CL 85%

Detecting Hallucinations in Authentic LLM-Human Interactions

检测真实LLM-人类交互中的幻觉

Yujie Ren, Niklas Gruhlke, Anne Lauscher

机构 * Trustworthy AI Lab, University of Hamburg, Germany(可信AI实验室,汉堡大学,德国)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出首个基于真实LLM-人类交互的幻觉检测基准,揭示了LLM在日常交互中产生幻觉的比例,并探讨了使用LLM自身作为检测器的潜力。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04893 2026-03-06 cs.CL cs.AI 81%

Free Lunch for Pass@$k$? Low Cost Diverse Sampling for Diffusion Language Models

免费午餐吗?低成本的多样化采样用于扩散语言模型

Sean Lamont, Christian Walder, Paul Montague, Amir Dezfouli, Michael Norrish

机构 * Australian National University(澳大利亚国立大学) Defence Science and Technology Group(国防科学与技术集团) Google DeepMind(谷歌DeepMind) BIMLOGIQ

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种低成本方法,通过修改中间样本以增强扩散语言模型的生成多样性,从而提升Pass@$k$任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05134 2026-03-06 cs.CL cs.AI 79%

LBM: Hierarchical Large Auto-Bidding Model via Reasoning and Acting

LBM:通过推理与行动构建的分层大自动竞价模型

Yewen Li, Zhiyi Lyu, Peng Jiang, Qingpeng Cai, Fei Pan, Bo An, Peng Jiang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LBM模型,通过分层推理与行动机制,结合双嵌入和GQPO技术,提升自动竞价策略的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00177 2026-03-06 cs.CL cs.AI 79%

PrefDisco: Benchmarking Proactive Personalized Reasoning

PrefDisco:主动个性化推理的基准测试

Shuyue Stella Li, Avinandan Bose, Faeze Brahman, Simon Shaolei Du, Pang Wei Koh, Maryam Fazel, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能联盟)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PrefDisco提出了一种评估方法,通过心理基础的人设将静态基准转化为互动个性化任务,定义PrefAlign作为细粒度的偏好对齐度量,揭示个性化推理需要专门开发而非自然产生。

Comments 65 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00121 2026-03-06 cs.MA 78%

Graph-theoretic Agreement Framework for Multi-agent LLM Systems

图论同意框架用于多智能体大语言模型系统

Muhammad Umar Javed

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 本文提出图论框架用于分析多智能体大语言模型中的共识稳定性,通过映射Transformer交叉熵到带符号拉普拉斯矩阵,解决不可观测死锁问题,并验证了共识定理和多项式时间算法。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05017 2026-03-06 cs.RO 78%

Direct Contact-Tolerant Motion Planning With Vision Language Models

直接接触容忍的运动规划与视觉语言模型

He Li, Jian Sun, Chengyang Li, Guoliang Li, Qiyu Ruan, Shuai Wang, Chengzhong Xu

机构 * State Key Laboratory of Internet of Things for Smart City (SKL-IOTSC), University of Macau(物联网智能城市国家重点实验室,澳门大学) Shenzhen Institutes of Advanced Technology (SIAT), Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出直接接触容忍运动规划方法,利用视觉语言模型实现接触感知导航,提升机器人在拥挤环境中的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22571 2026-03-06 cs.AI 77%

PerfGuard: A Performance-Aware Agent for Visual Content Generation

PerfGuard: 一种面向视觉内容生成的性能感知代理

Zhipeng Chen, Zhongrui Zhang, Chao Zhang, Yifan Xu, Lan Yang, Jun Liu, Ke Li, Yi-Zhe Song

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) Beijing Digital Native Digital City Research Center, China(北京数字原生数字城市研究中心) School of Computer Science and Engineering, Beihang University, China(北航计算机科学与工程学院) SketchX, CVSSP, University of Surrey, United Kingdom(SketchX、CVSSP、英国萨里大学) Chenxi Shuzhi (Beijing) Technology Co., Ltd, China(北京晨曦智数科技有限公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PerfGuard通过性能感知机制提升视觉内容生成任务中工具选择的准确性与执行可靠性。

Comments This paper has been accepted by ICLR 2026. The original paper link is: https://openreview.net/pdf?id=tdN42GTv4S The code repository link is: https://github.com/FelixChan9527/PerfGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06690 2026-03-06 cs.CL 77%

Think-While-Generating: On-the-Fly Reasoning for Personalized Long-Form Generation

在生成过程中思考:面向个性化长文本生成的即兴推理

Chengbing Wang, Yang Zhang, Wenjie Wang, Xiaoyan Zhao, Fuli Feng, Xiangnan He, Tat-Seng Chua

机构 * University of Science and Technology of China(科学技术大学) National University of Singapore(国立新加坡大学) The Chinese University of Hong Kong(香港中文大学) National Engineering Laboratory for BITA, University of Science and Technology of China(BITA国家工程实验室,科学技术大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FlyThinker通过在生成过程中进行动态推理,提升个性化长文本生成的效率和效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09016 2026-03-06 cs.LG 77%

SPEED-RL: Faster Training of Reasoning Models via Online Curriculum Learning

SPEED-RL: 通过在线课程学习加速推理模型训练

Ruiqi Zhang, Daman Arora, Song Mei, Andrea Zanette

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.LG

AI总结 SPEED-RL通过在线课程学习方法,提升推理模型训练效率,实现2-6倍的加速,同时保持准确性。

Comments There are some bugs in the experiments, and we cannot fix them to make it satisfactory to us

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23506 2026-03-06 cs.RO 75%

Ask, Reason, Assist: Robot Collaboration via Natural Language and Temporal Logic

提问、推理、协助:通过自然语言和时序逻辑实现机器人协作

Dan BW Choe, Sundhar Vinodh Sangeetha, Steven Emanuel, Chih-Yuan Chiu, Samuel Coogan, Shreyas Kousik

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于自然语言和时序逻辑的机器人协作协议,通过LLM实现冲突检测与帮助请求,利用MILP优化选择最优助人,有效提升协作效率。

Comments arXiv admin note: substantial text overlap with arXiv:2505.13376

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04464 2026-03-06 cs.LG cs.AI 73%

Understanding the Dynamics of Demonstration Conflict in In-Context Learning

理解上下文学习中演示冲突的动力学

Difan Jiao, Di Wang, Lijie Hu

机构 * University of Toronto(多伦多大学) King Abdullah University of Science(卡布斯国王科学大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究探讨了上下文学习中演示冲突的处理机制,发现模型在冲突证据下表现出两阶段计算结构,通过注意力头分析揭示了模型对腐败证据的敏感性,并验证了针对性消融对性能提升的显著影响。

Comments 19 pages,12 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18876 2026-03-06 cs.CV cs.AI cs.CL 73%

Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs

抓取任意区域:迈向多模态大语言模型的精确、上下文像素理解

Haochen Wang, Yuhao Wang, Tao Zhang, Yikang Zhou, Yanwei Li, Jiacong Wang, Jiani Zheng, Ye Tian, Jiahao Meng, Zilong Huang, Guangcan Mai, Anran Wang, Yunhai Tong, Zhuochen Wang, Xiangtai Li, Zhaoxiang Zhang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所、中国科学院(CASIA)) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) Wuhan University(武汉大学) ByteDance(字节跳动)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GAR通过RoI对齐特征重放技术实现多区域精准理解与复杂推理,提升多模态大语言模型的上下文感知能力。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08762 2026-03-06 q-fin.ST cs.CE cs.CL cs.LG 73%

EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements

EDINET-Bench:利用日本财务报表评估大语言模型在复杂财务任务中的表现

Issa Sugiura, Takashi Ishida, Taro Makino, Chieko Tazuke, Takanori Nakagawa, Kosuke Nakago, David Ha

机构 * Sakana AI Kyoto University(京都大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 EDINET-Bench通过日本财务报表评估大语言模型在复杂财务任务中的表现,揭示其在会计欺诈检测、盈利预测等任务中仍面临挑战,需更真实的模拟和推理支持。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19255 2026-03-06 cs.LG cs.AI 73%

VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use

VTool-R1: 通过在多模态工具使用上的强化学习使VLMs学会通过图像思考

Mingyuan Wu, Jingcheng Yang, Jize Jiang, Meitang Li, Kaizhuo Yan, Hanchao Yu, Minjia Zhang, Chengxiang Zhai, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VTool-R1通过强化学习训练视觉语言模型生成多模态思考链,提升其通过图像进行推理的能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11190 2026-03-06 cs.AI cs.CL 73%

Enhancing multimodal analogical reasoning with Logic Augmented Generation

通过逻辑增强生成增强多模态类比推理

Anna Sofia Lippolis, Andrea Giovanni Nuzzolese, Aldo Gangemi

机构 * University of Bologna(博洛尼亚大学) ISTC-CNR(意大利国家研究 council 信息与系统技术研究中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出逻辑增强生成框架,通过结合语义知识图谱和提示启发法,提升多模态类比推理能力,在隐喻检测和理解任务中优于基线和人类表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04406 2026-03-06 cs.CL cs.AI 73%

CTRL-RAG: Contrastive Likelihood Reward Based Reinforcement Learning for Context-Faithful RAG Models

CTRL-RAG:基于对比似然奖励的强化学习用于上下文忠实的RAG模型

Zhehao Tan, Yihan Jiao, Dan Yang, Junjie Wang, Duolin Sun, Jie Feng, Xidong Wang, Lei Liu, Yue Shen, Jian Wang, Jinjie Gu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CTRL-RAG通过对比似然奖励机制提升RAG模型的上下文忠实性,结合内部与外部奖励框架,在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05400 2026-03-06 cs.CL 70%

An Exploration-Analysis-Disambiguation Reasoning Framework for Word Sense Disambiguation with Low-Parameter LLMs

基于低参数LLM的探索-分析-消歧推理框架用于词义消歧

Deshan Sumanathilaka, Nicholas Micallef, Julian Hough

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出基于低参数LLM的探索-分析-消歧推理框架,通过推理驱动的微调策略,在零样本设置中实现与GPT-4-Turbo相当的词义消歧性能,并展示了对未见词义的稳健泛化能力。

Comments Accepted at LREC 2026, 15 pages, 11 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05357 2026-03-06 cs.CL 70%

DiSCTT: Consensus-Guided Self-Curriculum for Efficient Test-Time Adaptation in Reasoning

DiSCTT: 基于共识的自我课程学习用于推理中的高效测试时适应

Mohammad Mahdi Moradi, Sudhir Mudur

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DiSCTT通过动态分配测试时优化策略,提升推理模型在异质问题上的适应效率与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏