arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-20 至 2026-04-20 共收录 273 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 26 篇

2604.16037 2026-04-20 cs.CL 70%

Stochasticity in Tokenisation Improves Robustness

分词中的随机性提升了鲁棒性

Sophie Steger, Rui Li, Sofiane Ennadir, Anya Sims, Arno Solin, Franz Pernkopf, Martin Trapp

机构 * Institute of Signal Processing Speech Communication, Graz University of Technology, Graz, Austria ELLIS Institute Finland \& Aalto University, Espoo, Finland King AI Labs, Microsoft Gaming University of Oxford, Oxford, United Kingdom KTH Royal Institute of Technology, Stockholm, Sweden

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了随机分词对对抗攻击和随机扰动鲁棒性的影响,发现预训练和微调时使用均匀采样随机分词可提升模型鲁棒性,且不增加推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14518 2026-04-20 cs.AI 70%

Mind DeepResearch Technical Report

Mind DeepResearch 技术报告

MindDR Team, Li Auto Inc

机构 * MindDR Team(MindDR团队) Li Auto Inc(Li Auto公司)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 MindDR通过高效多智能体深度研究框架,在仅30B参数模型下实现领先性能,采用精心设计的数据合成和多阶段训练流程,其核心创新为三智能体架构及四阶段智能体专用训练流程,展现竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16135 2026-04-20 cs.CV 67%

Motion-Adapter: A Diffusion Model Adapter for Text-to-Motion Generation of Compound Actions

Motion-Adapter:一种用于复合动作文本到运动生成的扩散模型适配器

Yue Jiang, Mingyu Yang, Liuyuxin Yang, Yang Xu, Bingxin Yun, Yuhe Zhang

机构 * School of Computer Science, Northwest University(西北大学计算机学院)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出Motion-Adapter,通过计算解耦的交叉注意力图,解决文本到运动扩散模型中的时间信息处理和注意力崩溃问题,提升复合动作生成的准确性和连贯性。

Comments 12 pages, 12 figures, Under review for publication in IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16067 2026-04-20 cs.LG cs.CV 57%

AEGIS: Anchor-Enforced Gradient Isolation for Knowledge-Preserving Vision-Language-Action Fine-Tuning

AEGIS:锚定强化梯度隔离用于知识保留的视觉-语言-动作微调

Guransh Singh

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文提出AEGIS方法,通过层间梯度投影保留预训练的视觉问答能力,避免因梯度不对称导致的性能下降,无需额外数据或缓冲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12193 2026-04-20 cs.CV 50%

VeRVE: Versatile Retrieval for Videos via Unified Embeddings

VeRVE:通过统一嵌入实现视频的多功能检索

Shaunak Halbe, Bhagyashree Puranik, Jayakrishnan Unnikrishnan, Kushan Thakkar, Vimal Bhat, Toufiq Parag

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊) Keystone AI

专题命中 指令微调 :LLM(abstract)

AI总结 本文提出VeRVE框架,结合语义和时刻级检索能力,支持复杂多模态查询,通过对比对齐视觉和文本嵌入实现高效检索,优于其他多模态大语言模型方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15936 2026-04-20 cs.NI 50%

Federated Parameter-Efficient Adaptation for Interference Mitigation at the Wireless Edge

联邦参数高效适应用于无线边缘的干扰抑制

Evar Jones, Daniel J. Jakubisin, Sanmay Das

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出在无线边缘使用联邦学习与参数高效微调技术,通过在时序卷积神经网络中部署低秩适配器,实现干扰抑制。实验表明,Fed-LoRA在数据稀缺节点上表现优于本地适应,同时避免了全模型联邦学习下的灾难性退化。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 10 篇

2509.25300 2026-04-20 cs.LG cs.AI 93%

Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning

LLM强化学习后训练的扩展行为:数学推理中的实证研究

Zelin Tan, Hejia Geng, Xiaohang Yu, Mulei Zhang, Guancheng Wan, Yifan Zhou, Qiang He, Xiangyuan Xue, Heng Zhou, Yutao Fan, Zhongzhi Li, Zaibin Zhang, Guibin Zhang, Chen Zhang, Zhenfei Yin, Philip Torr, Lei Bai

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) University of Georgia(佐治亚大学) The Chinese University of Hong Kong(香港中文大学) Chinese Academy of Sciences(中国科学院) Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过实证研究探讨了LLM后训练强化学习中的扩展行为,重点分析了模型规模、数据量和计算预算对数学推理性能的影响,揭示了学习效率的饱和趋势及高质量数据重复利用的有效性。

Comments V4 version:This Paper has been accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16279 2026-04-20 cs.LG physics.chem-ph 91%

Evaluating the Progression of Large Language Model Capabilities for Small-Molecule Drug Design

评估大型语言模型在小分子药物设计中的进展

Shriram Chennakesavalu, Kirill Shmilovich, Hayley Weir, Colin Grambow, John Bradshaw, Patricia Suriana, Chen Cheng, Kangway Chuang

机构 * Prescient Design Genentech(基因泰克) South San Francisco, CA, USA(旧金山南区,加利福尼亚州,美国)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);post-training(abstract)

AI总结 本文通过设计化学基础任务评估LLM在药物设计中的能力,发现前沿模型在化学任务中表现提升,但实验场景下仍有改进空间,RL后训练显著提升性能,小型模型经训练后可与前沿模型竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15789 2026-04-20 cs.CL 91%

A Systematic Study of Training-Free Methods for Trustworthy Large Language Models

对可信大语言模型无训练方法的系统研究

Wai Man Si, Mingjie Li, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 本文系统评估了无训练方法在不同可信设置下的有效性,分析了其对效用、鲁棒性和计算开销的影响,并提出平衡可信性、效用和鲁棒性的实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19104 2026-04-20 cs.LG stat.ML 91%

Online Distributionally Robust LLM Alignment via Regression to Relative Reward

通过回归相对奖励实现在线分布鲁棒LLM对齐

Sharan Sahu, Martin T. Wells

机构 * Department of Statistics and Data Science(统计与数据科学系) Cornell University(康奈尔大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出DRO-REBEL方法,通过类型-p Wasserstein、KL和χ²模糊集实现分布鲁棒优化,证明了在偏好转移下的参数误差界,并在多个基准测试中优于现有基线。

Comments 70 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15602 2026-04-20 cs.CL 85%

GroupDPO: Memory efficient Group-wise Direct Preference Optimization

GroupDPO:内存高效的组级直接偏好优化

Jixuan Leng, Si Si, Hsiang-Fu Yu, Vinod Raman, Inderjit S. Dhillon

机构 * CMU(卡内基梅隆大学) Google Deepmind(谷歌DeepMind) Google(谷歌)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出GroupDPO,通过解耦样本和保留梯度实现高效的组级偏好优化,减少内存使用,提升大规模训练效果,且在离线和在线对齐中均优于单对训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16027 2026-04-20 cs.CL cs.AI cs.LG 85%

Where does output diversity collapse in post-training?

在微调后输出多样性为何会崩溃?

Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

机构 * School of Computer Science University of Sheffield(计算机科学学院 伦敦大学谢菲尔德分校)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了微调后输出多样性的崩溃原因,发现数据组成和训练方法共同影响多样性,揭示多样性崩溃发生在训练阶段而非推理阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02261 2026-04-20 cs.IR cs.LG 84%

What Makes LLMs Effective Sequential Recommenders? A Study on Preference Intensity and Temporal Context

是什么让大语言模型(LLMs)成为有效的序列推荐者?对偏好强度和时间上下文的研究

Zhongyu Ouyang, Qianlong Wen, Chunhui Zhang, Yanfang Ye, Soroush Vosoughi

机构 * Department of Computer Science, Dartmouth College(达特茅斯大学计算机科学系) ByteDance, US(字节跳动(美国)) Department of Computer Science and Engineering, University of Notre Dame(诺丁汉大学计算机科学与工程系)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文研究了LLMs在序列推荐中有效性的关键因素,提出RecPO框架通过整合显式和隐式反馈,提升推荐性能,强调偏好强度和时间上下文的重要性。

Comments Accepted The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14646 2026-04-20 cs.AI 81%

Targeted Exploration via Unified Entropy Control for Reinforcement Learning

通过统一熵控制实现定向探索的强化学习

Chen Wang, Lai Wei, Yanzhi Zhang, Chenyang Shao, Zedong Dan, Weiran Huang, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Sun Yat-sen Univeristy(中山大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出UEC-RL框架,通过定向探索机制和稳定器解决强化学习中的熵崩溃问题,提升大模型推理性能。

Comments Accepted for publication in Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05858 2026-04-20 cs.CL cs.AI cs.LG 80%

CLewR: Curriculum Learning with Restarts for Machine Translation Preference Learning

CLewR:基于重置的课程学习用于机器翻译偏好学习

Alexandra Dragomir, Florin Brad, Radu Tudor Ionescu

机构 * Bitdefender Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CLewR方法,通过课程学习与重置策略提升机器翻译性能,验证了在多种模型和优化技术中的有效性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14967 2026-04-20 cs.CV cs.AI 57%

UniDoc-RL: Coarse-to-Fine Visual RAG with Hierarchical Actions and Dense Rewards

UniDoc-RL: 基于分层动作和密集奖励的粗到细视觉RAG

Jun Wang, Shuo Tan, Zelong Sun, Tiancheng Gu, Yongle Zhao, Ziyong Feng, Kaicheng Yang, Zhiwu Lu

机构 * DeepGlint-AI

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 UniDoc-RL通过分层动作空间和密集奖励方案,提升视觉RAG系统的细粒度视觉语义处理能力,实现端到端训练,实验显示优于现有方法。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 8 篇

2406.15809 2026-04-20 cs.CL cs.LG 91%

LaMSUM: Amplifying Voices Against Harassment through LLM Guided Extractive Summarization of User Incident Reports

LaMSUM: 通过LLM引导的提取式摘要提升反骚扰声音

Garima Chhikara, Anurag Sharma, V. Gurucharan, Kripabandhu Ghosh, Abhijnan Chakraborty

机构 * Indian Institute of Technology Delhi, India(印度理工学院德里分校) Delhi Technological University, India(德里技术大学) Indian Institute of Technology Kharagpur, India(印度理工学院哈里科特分校) Collaborative Dynamics, Texas, USA(协同动力公司) Indian Institute of Science Education and Research Kolkata, India(印度科学教育与研究学院科希拉分校)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LaMSUM框架,结合多级投票方法利用LLM生成用户事件报告的提取式摘要,有效应对多语言数据处理挑战,优于现有方法。

Comments Accepted at ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15485 2026-04-20 cs.SE 91%

LLM4C2Rust: Large Language Models for Automated Memory-Safe Code Transpilation

LLM4C2Rust: 利用大型语言模型实现自动内存安全代码转译

Sarah Bedell, Nazanin Siavash, Armin Moin

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

AI总结 本文提出基于检索增强生成的框架,利用大型语言模型与小型语言模型结合,实现C/C++到Rust的转译,提升内存安全性。实验表明该方法能有效提高代码正确性和安全性,减少原始指针解引用和不安全类型转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15505 2026-04-20 cs.CL cs.AI 90%

PolicyBank: Evolving Policy Understanding for LLM Agents

PolicyBank: 为LLM代理演化政策理解

Jihye Choi, Jinsung Yoon, Long T. Le, Somesh Jha, Tomas Pfister

机构 * Google Cloud(谷歌云) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究通过交互与反馈让LLM代理自主优化政策解读,提出PolicyBank机制以结构化存储政策洞察并迭代完善,有效填补规范缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17052 2026-04-20 cs.LG 81%

Dynamic Tool Dependency Retrieval for Lightweight Function Calling

轻量级函数调用的动态工具依赖检索

Bhrij Patel, Davide Belli, Amir Jalalirad, Maximilian Arnold, Aleksandr Ermolov, Bence Major

机构 * Qualcomm AI Research(高通人工智能研究) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出动态工具依赖检索方法,通过结合初始查询和逐步展开的工具调用计划,提升函数调用的准确性和效率,实验表明其在多个数据集和模型上均优于现有静态检索方法。

Comments 24 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01566 2026-04-20 cs.CL 81%

FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents

FS-Researcher:基于文件系统的长周期研究任务测试时扩展

Chiwei Zhu, Benfeng Xu, Mingxuan Du, Shaohan Wang, Xiaorui Wang, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(MetaStone技术公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出FS-Researcher框架,通过持久化工作空间实现长周期研究任务的测试时扩展,采用双代理结构提升研究质量与扩展性。

Comments 22 pages, 6 figures; Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21623 2026-04-20 cs.CL cs.AI cs.LG 75%

OjaKV: Context-Aware Online Low-Rank KV Cache Compression

OjaKV: 基于上下文的在线低秩KV缓存压缩

Yuxuan Zhu, David H. Yang, Mohammad Mohammadi Amiri, Keerthiram Murugesan, Tejaswini Pedapati, Pin-Yu Chen

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OjaKV通过结合战略混合存储策略与在线子空间适应,实现KV缓存压缩,提升长上下文推理效率,无需微调模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15623 2026-04-20 cs.AR 67%

Overmind NSA: A Unified Neuro-Symbolic Computing Architecture with Approximate Nonlinear Activations and Preemptive Memory Bypass

Overmind NSA:一种具有近似非线性激活和抢先记忆绕过功能的统一神经符号计算架构

Weilun Wang, Zirui Wang, Wantong Li

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出Overmind架构,通过Padé近似、抢先记忆绕过和软件栈优化,解决神经符号计算中的计算瓶颈,实现高能效和吞吐量。

Comments Accepted to DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15356 2026-04-20 cs.LG cs.AI cs.IT cs.NE math.IT 62%

Sequential KV Cache Compression via Probabilistic Language Tries: Beyond the Per-Vector Shannon Limit

基于概率语言tries的序列KV缓存压缩:超越每向量香农极限

Gregory Magarshak

机构 * faculty.ienyc.edu(伊恩耶克大学教员)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出序列KV压缩方法,通过概率前缀去重和预测delta编码,实现超越每向量香农极限的压缩,理论压缩比达914000倍。

Comments 22 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 57 篇

2604.12390 2026-04-20 cs.AI 93%

Heuristic Classification of Thoughts Prompting (HCoT): Integrating Expert System Heuristics for Structured Reasoning into Large Language Models

思维提示的启发式分类(HCoT):将专家系统启发式方法整合到大型语言模型中的结构化推理

Lei Lin, Jizhao Zhu, Yong Liu, Donghong Sun, Hongbo He, Yihua Du

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Shenyang Aerospace University(沈阳航空航天大学) ZGC LAB, Beijing,China(北京ZGC实验室) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出HCoT方法,通过启发式分类模型整合专家系统启发式方法,提升大型语言模型在复杂问题中的推理能力,实现更高效的决策和更稳定的推理链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15344 2026-04-20 cs.HC cs.AI cs.IR cs.LG 92%

To LLM, or Not to LLM: How Designers and Developers Navigate LLMs as Tools or Teammates

对LLM而言,是使用还是不使用:设计师和开发者如何将LLM视为工具或队友

Varad Vishwarupe, Ivan Flechais, Nigel Shadbolt, Marina Jirotka

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了设计师和开发者在系统设计过程中如何将LLM视为工具或队友,分析了角色框架对决策权、问责制、监督策略和组织接受度的影响。

Comments 6 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08125 2026-04-20 cs.LG cs.CL 92%

Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning

并非所有标记都重要:通过强化学习中的标记重要性实现高效的LLM推理

Hanbing Liu, Lang Cao, Yuanyi Ren, Mengyu Zhou, Haoyu Dong, Xiaojun Ma, Shi Han, Dongmei Zhang

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学) Qwen Large Model Application Team, Alibaba(阿里云文大模型应用团队) Microsoft(微软) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院 ubiquitous 数据赋能重点实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过标记重要性优化强化学习,减少冗余并提升LLM推理效率和准确性,实验显示响应长度显著缩短且正确性保持或提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10198 2026-04-20 cs.CL 92%

HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive Patterns

HumanLLM:通过人类认知模式基准测试和改进LLM拟人化

Xintao Wang, Jian Yang, Weiyuan Li, Rui Xie, Jen-tse Huang, Jun Gao, Shuai Huang, Yueping Kang, Yuanli Gou, Hongwei Feng, Yanghua Xiao

机构 * Fudan University(复旦大学) Hello Group(Hello集团) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 HumanLLM通过构建244种心理模式和11359种场景,评估LLM拟人化的有效性,发现认知建模比单纯模拟行为更重要,其8B模型在参数更少的情况下优于Qwen3-32B。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19563 2026-04-20 cs.AI cs.CL 91%

TabularMath: Understanding Math Reasoning over Tables with Large Language Models

TabularMath: 通过大规模语言模型理解表格上的数学推理

Shi-Yu Tian, Zhi Zhou, Wei Dong, Kun-Yang Yu, Ming Yang, Zi-Jian Cheng, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出TabularMath基准,通过神经符号框架将数学问题转化为可扩展的表格推理任务,揭示表格复杂度、质量及表征对推理性能的影响,发现低质量表格对当前LLM的可靠性构成严重风险。

Comments Accepted by ACL 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03332 2026-04-20 cs.CL cs.AI cs.LG 91%

Fragile Thoughts: How Large Language Models Handle Chain-of-Thought Perturbations

脆弱的思考:大型语言模型如何处理推理链扰动

Ashwath Vaithinathan Aravindan, Mayank Kejriwal

机构 * University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文研究了大型语言模型在推理链扰动下的鲁棒性,通过五种扰动类型评估13种模型,发现不同扰动对模型的影响各异,模型规模在某些扰动中起到保护作用。

详情

展开后加载摘要…

URL PDF HTML 收藏