arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-14 至 2026-04-14 共收录 112 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 112 篇

2604.11778 2026-04-14 cs.CL cs.AI 90%

General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks

General365:在多样化和具有挑战性的任务中评估大语言模型的通用推理能力

Junlin Liu, Shengnan An, Shuang Zhou, Dan Ma, Shixiong Luo, Ying Xie, Yuan Zhang, Wenling Yuan, Yifan Zhou, Xiaoyu Li, Ziwen Wang, Xuezhi Cao, Xunliang Cai

机构 * University of Chinese Academy of Sciences(中国科学院大学) Meituan(美团)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出General365基准,通过限制背景知识至K-12水平,评估大语言模型在通用推理任务中的表现,揭示当前模型在非专业领域推理能力的不足。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13621 2026-04-14 cs.CL cs.CV cs.LG 90%

LaMI: Augmenting Large Language Models via Late Multi-Image Fusion

LaMI:通过晚期多图像融合增强大型语言模型

Guy Yariv, Idan Schwartz, Yossi Adi, Sagie Benaim

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Bar-Ilan University(巴伊兰大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 LaMI通过在测试时融合多个图像提升视觉常识推理能力,同时保持文本推理性能,适用于视觉和NLP任务。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14800 2026-04-14 eess.SY cs.AI cs.SY 89%

Large Language Model as An Operator: An Experience-Driven Solution for Distribution Network Voltage Control

大语言模型作为算子:一种经验驱动的配电网电压控制解决方案

Xu Yang, Chenhui Lin, Licheng Sha, Liping Yang, Shuzhou Wu, Xichen Tian, Haotian Liu, Wenchuan Wu

机构 * State Key Laboratory of Power Systems(电力系统国家重点实验室) State Grid Beijing Electric Power Company(国网北京市电力公司) Department of Electrical Engineering, Tsinghua University(清华大学电机工程与应用电子技术系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的经验驱动日提前电压/无功调度方案,通过多模块协作实现调度策略的自进化,实验验证了该方法在信息不完整情况下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09866 2026-04-14 cs.SE cs.AI 89%

Automating Structural Analysis Across Multiple Software Platforms Using Large Language Models

利用大型语言模型在多个软件平台间自动化结构分析

Ziheng Geng, Jiachen Liu, Ian Franklin, Ran Cao, Dan M. Frangopol, Minghui Cheng

机构 * University of Miami(迈阿密大学) HBC Engineering Company(HBC工程公司) Hunan University(湖南大学) Lehigh University(里海大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出一种多软件平台结构分析自动化方法,通过两阶段多智能体架构实现跨平台建模与分析,实验表明其在多个主流软件中均达到90%以上的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11008 2026-04-14 cs.CL 89%

CounterBench: Evaluating and Improving Counterfactual Reasoning in Large Language Models

CounterBench: 评估和改进大型语言模型中的反事实推理

Yuefei Chen, Vivek K. Singh, Jing Ma, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) Case Western Reserve University(凯斯西储大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出CounterBench基准数据集,评估大型语言模型在反事实推理中的表现,并提出CoIn方法提升其能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09791 2026-04-14 cs.AI cs.CL cs.LG cs.MA 89%

Pioneer Agent: Continual Improvement of Small Language Models in Production

先驱代理:生产环境中小语言模型的持续改进

Dhruv Atreja, Julia White, Nikhil Nayak, Kelton Zhang, Henrijs Princis, George Hurn-Maloney, Ash Lewis, Urchade Zaratiana

机构 * Fastino Labs

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Pioneer Agent,通过闭环系统自动化小语言模型的持续改进,通过冷启动和生产模式提升模型性能,发现有效训练策略。

Comments 43 pages, 10 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10031 2026-04-14 cs.CL cs.AI 88%

CoSToM:Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language Models

CoSToM: 为大语言模型内在理论思维对齐的因果导向引导

Mengfan Li, Xuanhua Shi, Yang Deng

机构 * National Engineering Research Center for Big Data Technology and System, Services Computing Technology and System Lab, Cluster and Grid Computing Lab, Huazhong University of Science and Technology(华中科技大学国家大数据技术与系统工程技术研究中心、服务计算技术与系统实验室、集群与网格计算实验室) Singapore Management University(新加坡管理大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoSToM框架,通过因果追踪和激活引导提升大语言模型的社会推理能力与对话质量。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09712 2026-04-14 cs.CV cs.AI 88%

LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models

LAST:利用工具作为提示以增强多模态大语言模型的空间推理能力

Shi-Yu Tian, Zhi Zhou, Kun-Yang Yu, Ming Yang, Yang Chen, Ziqiao Shang, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 LAST通过整合专用视觉模型,解决多模态大语言模型在复杂几何布局解析中的幻觉和不精确问题,提出统一框架提升空间推理能力。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07148 2026-04-14 eess.IV 88%

Q-Agent: Quality-Driven Chain-of-Thought Image Restoration Agent through Robust Multimodal Large Language Model

Q-Agent:通过鲁棒多模态大语言模型实现质量驱动的推理图像修复代理

Yingjie Zhou, Jiezhang Cao, Farong Wen, Zicheng Zhang, Yu Zhou, Yue Shi, Xiaohong Liu, Radu Timofte, Luc Van Gool, Guangtao Zhai

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出Q-Agent,通过Chain-of-Thought方法提升图像修复性能,结合鲁棒多模态大语言模型和客观图像质量评估,实现更高效的多退化处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22403 2026-04-14 cs.LG 87%

MoveFM-R: Advancing Mobility Foundation Models via Language-driven Semantic Reasoning

MoveFM-R: 通过语言驱动的语义推理推进移动基础模型

Fanjin Meng, Yuan Yuan, Jingtao Ding, Jie Feng, Chonghua Han, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系,BNRist) New York University (NYU)(纽约大学)

专题命中 推理与问题求解 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MoveFM-R通过语言驱动的语义推理解决移动基础模型中地理坐标与语言 token 的词汇不匹配及潜在向量与语义世界之间的表示差距问题,实现更全面、可解释的人类移动建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10701 2026-04-14 cs.LG cs.AI cs.CL 87%

Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning

带回价值模型:生成式批评者在大语言模型强化学习中的价值建模

Zikang Shan, Han Zhong, Liwei Wang, Li Zhao

机构 * Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出生成式批评者GenAC,通过链式推理改进价值建模,提升RL性能。

Comments 16 pages including appendix, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11791 2026-04-14 cs.LG cs.AI 86%

A Mechanistic Analysis of Looped Reasoning Language Models

循环推理语言模型的机理分析

Hugh Blayney, Álvaro Arroyo, Johan Obando-Ceron, Pablo Samuel Castro, Aaron Courville, Michael M. Bronstein, Xiaowen Dong

机构 * University of Oxford(牛津大学) Mila – Quebec AI Institute(魁北克AI研究所)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文分析了循环推理语言模型中潜在状态的机理,揭示了循环块在潜在空间中的稳定轨迹及注意力头行为的稳定特性。

Comments 39 pages, 63 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11209 2026-04-14 cs.CL cs.AI 86%

Exploring Knowledge Conflicts for Faithful LLM Reasoning: Benchmark and Method

探索知识冲突以实现忠实的LLM推理:基准与方法

Tianzhe Zhao, Jiaoyan Chen, Shuxiu Zhang, Haiping Zhu, Qika Lin, Jun Liu

机构 * School of Computer Science and Technology, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Hunan University(湖南大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出ConflictQA基准,揭示LLM在处理跨源知识冲突时的不足,并提出XoT框架以提升异构冲突证据推理的可靠性。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11041 2026-04-14 cs.AI 85%

From Topology to Trajectory: LLM-Driven World Models For Supply Chain Resilience

从拓扑到轨迹:LLM驱动的世界模型用于供应链韧性

Jia Luo

机构 * Huazhong University and Science and Technology(华中科技大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ReflectiChain框架,通过生成世界模型和回顾代理强化学习,提升供应链韧性,实验显示在极端场景下性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01544 2026-04-14 cs.AI 85%

Advancing Reasoning in Diffusion Language Models with Denoising Process Rewards

通过去噪过程奖励推进扩散语言模型的推理能力

Shaoan Xie, Lingjing Kong, Xiangchen Song, Xinshuai Dong, Guangyi Chen, Eric P. Xing, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出去噪过程奖励,通过优化去噪轨迹提升扩散语言模型的推理稳定性与可解释性,实验显示在推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28653 2026-04-14 cs.NE cs.SE 85%

BACE: LLM-based Code Generation through Bayesian Anchored Co-Evolution of Code and Test Populations

BACE:基于大语言模型的代码生成:通过贝叶斯锚定的代码与测试种群共演化

Kaushitha Silva, Srinath Perera

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 BACE通过贝叶斯锚定的共演化方法,改进代码生成中的测试反馈机制,提升代码与测试种群的协同进化性能。

Comments 10 Pages, 3 Figures. To appear in Proceedings of the 2026 Genetic and Evolutionary Computation Conference (GECCO '26), July 13-17, 2026, San Jose, Costa Rica

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10587 2026-04-14 cs.HC 85%

CogInstrument: Modeling Cognitive Processes for Bidirectional Human-LLM Alignment in Planning Tasks

CogInstrument: 为规划任务中的双向人-大语言模型对齐建模认知过程

Anqi Wang, Dongyijie Pan, Xin Tong, Pan Hui

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 CogInstrument通过认知动机建模实现人与大语言模型在规划任务中的双向对齐,通过可编辑的图形结构揭示隐含推理过程,提升用户对协作的控制力和信任度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26163 2026-04-14 cs.CY 85%

Exploring Dissatisfaction in Bus Route Reduction through LLM-Calibrated Agent-Based Modeling

通过LLM校准的Agent-Based建模探索公交路线削减中的不满

Qiumeng Li, Xinxi Yang, Suhong Zhou

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究通过LLM校准的ABM探讨公交路线削减对不同群体不满及网络韧性的影响,发现网络结构对系统稳定性影响大于容量因素,路线削减导致不满指数急剧上升,尤其影响残疾人士和老年人。

Comments The authors have withdrawn this preprint due to errors in figure presentation and labeling. A revised manuscript will be submitted once these issues are resolved

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00487 2026-04-14 cs.MA cs.GT cs.SY eess.SY 85%

Competition and Cooperation of LLM Agents in Games

博弈中的大语言模型代理竞争与合作

Jiayi Yao, Cong Chen, Baosen Zhang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型代理在资源分配和Cournot竞争博弈中的行为,发现多轮提示和非零和上下文促进合作,基于公平性推理提出分析框架。

Comments Submitted to CDC'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10690 2026-04-14 cs.AI 84%

Do LLMs Build Spatial World Models? Evidence from Grid-World Maze Tasks

大型语言模型构建空间世界模型了吗?基于网格世界迷宫任务的证据

Weijiang Li, Yilin Zhu, Rajarshi Das, Parijat Dube

机构 * University of Notre Dame(圣母大学) Columbia University(哥伦比亚大学) MQube Cognition(MQube认知实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文通过迷宫任务评估LLM的空间理解能力,发现其空间推理依赖于表示形式而非任务类型,表明LLM缺乏稳健的空间世界模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21380 2026-04-14 cs.CL 84%

Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models

挑战推理的边界:为大语言模型设计的奥林匹克级数学基准

Haoxiang Sun, Yingqian Min, Zhipeng Chen, Wayne Xin Zhao, Ji-Rong Wen

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL

AI总结 OlymMATH是一个包含350道题的奥林匹克级数学基准,通过自然语言和形式验证两种方式评估大语言模型,揭示语言间性能差异及模型推理不足问题。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10905 2026-04-14 cs.SD cs.AI cs.CL eess.AS 84%

Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music

音频Flamingo Next:下一代开放音频-语言模型用于语音、声音和音乐

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Zhifeng Kong, Siddharth Gururani, Sang-gil Lee, Jaehyeon Kim, Aya Aljafari, Chao-Han Huck Yang, Sungwon Kim, Ramani Duraiswami, Dinesh Manocha, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

机构 * NVIDIA, USA(英伟达,美国) University of Maryland, USA(马里兰大学,美国)

专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 AF-Next通过改进基础模型、扩展数据集和引入时序推理方法,提升了语音、环境声音和音乐的理解与推理能力,展示了更强的性能和实用性。

Comments Project website: https://afnext-umd-nvidia.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13755 2026-04-14 cs.LG cs.AI 84%

Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration

在RLVR中深度与广度的协同作用:通过自适应探索解锁LLM推理增益

Zhicheng Yang, Zhijiang Guo, Yinya Huang, Yongxin Wang, Dongchun Xie, Hanhui Li, Yiwei Wang, Xiaodan Liang, Jing Tang

机构 * Sun Yat-Sen University(中山大学) ETH AI Center, ETH Zurich(苏黎世联邦理工学院ETH人工智能中心) University of California, Merced(加州大学默塞德分校)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DARS方法,通过自适应探索提升LLM推理能力,发现扩大批量大小能显著提升Pass@1指标,同时结合DARS-Breadth方法实现深度与广度的协同增益。

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10917 2026-04-14 cs.CL 83%

HTAA: Enhancing LLM Planning via Hybrid Toolset Agentization & Adaptation

HTAA:通过混合工具集代理化与适应增强大语言模型规划

Chengrui Huang, Junshuo Zhang, Zhiyuan Ma, Xikun Wang, Ximeng Wang, Menghua Jiang, Gang Zeng, Zhaobing Han, Shen Gao, Shuo Shang

机构 * University of Electronic Science and Technology of China(电子科技大学) DiDi Global Inc.(滴滴全球股份有限公司)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出HTAA框架,通过混合工具集代理化与适应方法,提升大语言模型在复杂任务中的规划效率与可靠性,实验表明其在任务成功率、工具调用轨迹长度及上下文开销方面均优于基线模型。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10739 2026-04-14 cs.AI 83%

When More Thinking Hurts: Overthinking in LLM Test-Time Compute Scaling

更多思考反而有害:在LLM测试时间计算扩展中的过度思考

Shu Zhou, Rui Ling, Junan Chen, Xin Wang, Tao Fan, Hao Wang

机构 * Nanjing University(南京大学) Baidu(百度) Nanjing University of Finance & Economics(南京财经大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了在LLM测试时间计算扩展中,增加推理token的边际效用随计算预算增加而下降的现象,发现模型存在过度思考问题,且最优思考长度因问题难度而异。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04038 2026-04-14 cs.CL cs.CV 83%

ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents

ZARA:通过证据驱动的LLM代理实现无训练的运动时间序列推理

Zechen Li, Baiyu Chen, Hao Xue, Flora D. Salim

机构 * University of New South Wales, Sydney(新南威尔士大学悉尼校区) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ZARA通过证据驱动的LLM代理实现无训练的运动时间序列推理,利用参考数据构建统计学基础的知识库,提升活动识别的泛化能力和跨领域适应性。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09580 2026-04-14 cs.AI cs.LG 82%

OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling

OOWM: 通过面向对象的程序化世界建模结构化具身推理与规划

Hongyu Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);prompting(abstract)

AI总结 OOWM通过软件工程形式化方法构建具身推理框架,利用UML类图和活动图实现环境状态与控制策略的显式建模,结合监督微调与分组相对策略优化提升规划效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27269 2026-04-14 cs.CL cs.AI cs.LG 82%

Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models?

为何多语言推理模型中会出现多语言推理差距?

Deokhyung Kang, Seonjeong Hwang, Daehui Kim, Hyounghun Kim, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence, POSTECH(浦项工业大学人工智能研究生院) Agentic AI Lab, KT(KT公司Agentic AI实验室) Department of Computer Science and Engineering, POSTECH(浦项工业大学计算机科学与工程系)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了多语言推理模型中存在多语言推理差距的原因,发现语言理解失败是主因,并提出Selective Translation策略有效缓解了这一问题。

Comments Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15593 2026-04-14 cs.CL cs.AI cs.LG 82%

Parallelism and Generation Order in Masked Diffusion Language Models: Limits Today, Potential Tomorrow

掩码扩散语言模型中的并行性与生成顺序:今日的限制,明日的潜力

Yangyang Zhong, Yanmei Gu, Zhengqing Zang, Xiaomeng Li, Yuqi Ding, Xibei Jia, Yuting Shen, Zhenzhong Lan, Liwang Zhu, Weiping Liu, Junlin Zhou, Haisheng Liu, Zhong Xin Yu, Pengxin Luo, Donglian Qi, Yunfeng Yan, Junbo Zhao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) University of Chinese Academy of Social Sciences(中国社会科学院大学) Westlake University(西湖大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究评估了八种主流MDLM在58个基准上的表现,发现其并行性和生成顺序受任务领域和正确性影响显著,且在需要逆向信息的任务中表现更优,提出生成后编辑范式以提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10504 2026-04-14 cs.AI 81%

CARO: Chain-of-Analogy Reasoning Optimization for Robust Content Moderation

CARO:用于鲁棒内容审核的类比推理优化

Bingzhe Wu, Haotian Lu, Yuchen Mou

机构 * National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Shenzhen University(深圳大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)

AI总结 CARO通过两阶段训练框架提升LLM的类比推理能力,有效缓解内容审核中的误导性决策短路问题,实验显示其在模糊审核基准上平均F1得分提升24.9%。

Comments Accepted to ACL 2026 findings; under official publication process

详情

展开后加载摘要…

URL PDF HTML 收藏