arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-04 至 2026-08-04 共收录 260 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 23 篇

2608.01328 2026-08-04 cs.CL cs.AI cs.CV 新提交 81%

LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

LongChart VQA:面向具备复杂多图表推理能力的多模态大语言模型的综合基准

Ziyan Xiao, Yinghao Zhu, Wenting Zhang, Heaju Kim, Lequan Yu

机构 * The University of Hong Kong(香港大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LongChart VQA是面向具备复杂多图表推理能力的MLLMs的综合基准,该基准含平均6.5张图像与31.2个问题,评估10个SOTA MLLMs发现其准确率随计算复杂性提升下降,为多图表推理研究指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05158 2026-08-04 cs.CL cs.AI cs.MA 版本更新 81%

Streaming Communication in Multi-Agent Reasoning

多智能体推理中的流式通信

Zhen Yang, Xiaogang Xu, Wen Wang, Cong Chen, Xander Xu, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) ZJU(浙江大学) HKUST(香港科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出流式多智能体推理系统StreamMA,通过将推理步骤实时流式传输给下游智能体来降低延迟,并意外地提升了效果,同时首次给出流式、串行和单协议三种模式的闭式联合分析。

Comments project page: https://zhenyangcs.github.io/StreamMA-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02291 2026-08-04 cs.AI 新提交 79%

Shared Prefixes, Better Credit: Adaptive Routing for Multi-Agent Reasoning

共享前缀,更优信用:面向多智能体推理的自适应路由

Yiqing Liu, Zihao Wang, Hantao Yao, Wu Liu, Yongdong Zhang

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对现有多智能体推理自适应路由方法的粗粒度监督缺陷,提出TreeCredit共享前缀信用分配框架,通过状态匹配下游比较估计算子效用,在六个推理基准上实现了准确率与推理成本的更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24140 2026-08-04 cs.AI 版本更新 79%

HyperGuide: Hyperbolic Guidance for Efficient Multi-Step Reasoning in Large Language Models

HyperGuide: 用于大型语言模型高效多步推理的双曲引导

Yuyu Liu, Haotian Xu, Yanan He, Sarang Rajendra Patil, Mengjia Xu, Tengfei Ma

机构 * Department of Computer Science(计算机科学系) Stony Brook University(石英布鲁克大学) Department of Applied Mathematics and Statistics(应用数学与统计学系) Yale University(耶鲁大学) Department of Data Science(数据科学系) New Jersey Institute of Technology(新泽西理工学院) Department of Biomedical Informatics(生物医学信息学系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对多步推理中单次生成效率高但精度低、树搜索计算量大的问题,提出通过将推理进度蒸馏为双曲几何信号来引导逐步生成,利用双曲空间的距离和角度特性编码解接近度与分支区分,训练轻量头投影隐状态并微调适配器,在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01930 2026-08-04 cs.CV cs.AI 新提交 77%

Recompute or Reuse? Diagnosing and Mitigating Textual Shortcuts in VLM Self-Reflection

重新计算还是复用?诊断与缓解视觉语言模型自反思中的文本捷径

Wenxiao Fan, Jingling Fu, Fang Li, Luohang Liu, Yu He, Lichen Ma, Zhiyang Yu, Weishan Bi, Junshi Huang, Yan Li, Gu Simiu, Kan Li

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 该研究针对VLM自反思中存在的文本捷径问题,通过反事实分析诊断其特性,提出无需训练的FSAF干预,显著提升视觉更新率、降低先前答案率,为缓解VLM的文本复用偏差提供了有效方案。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01314 2026-08-04 cs.CV 新提交 67%

Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

Remember-R1:通过强化学习缓解长上下文视觉遗忘

Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen

机构 * Northwestern Polytechnical University(西北工业大学) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 该研究针对多模态大语言模型的长上下文视觉遗忘问题,提出强化学习框架Remember-R1,通过过程级监督优化视觉依赖与注意力,提升了多模态推理性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22583 2026-08-04 cs.AI cs.CL 版本更新 62%

Multi-Objective Structured Pruning of LLMs for Latency and Model Size Optimization

用于延迟和模型大小优化的大语言模型多目标结构化剪枝

Muhammad Junaid Ali, Smail Niar, El-Ghazali Talbi

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在边缘计算环境部署的挑战,提出硬件感知多目标结构化剪枝框架,分两阶段优化,粗粒度移除模块,细粒度搜索最优剪枝率,实验证明能降低模型复杂度,在多方面实现良好权衡,适合边缘部署。

Comments Submitted to the ICTAI 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28488 2026-08-04 cs.CL cs.AI cs.MA 版本更新 62%

Courtroom-Style Multi-Agent Debate with Progressive RAG and Role-Switching for Controversial Claim Verification

courtroom 风格多智能体辩论与渐进式 RAG 和角色切换用于争议性主张验证

Masnun Nuha Chowdhury, Nusrat Jahan Beg, Umme Hunny Khan, Syed Rifat Raiyan, Md Kamrul Hasan, Hasan Mahmud

机构 * Systems and Software Lab (SSL), Department of Computer Science and Engineering(系统与软件实验室(SSL),计算机科学与工程系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 PROClaim 框架,通过结构化对抗辩论和角色切换提升争议性主张验证的可靠性,实验显示其在 Check-COVID 数据集上准确率达 81.7%。

Comments Under review, 29 pages, 7 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00740 2026-08-04 cs.CL cs.AI 版本更新 62%

MedTextWeaver: Procedural Knowledge Evolution in Agentic Medical Text Editing

ExperienceWeaver: 优化基于 LLM 的临床文本改进的小样本经验学习

Ziyan Xiao, Yinghao Zhu, Liang Peng, Kyongtae T Bae, Lequan Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ExperienceWeaver 通过经验学习优化小样本下 LLM 的临床文本改进,通过提炼反馈知识提升模型修订能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01927 2026-08-04 cs.SE cs.AI 新提交 57%

Effective and Efficient Context Retrieval via Partial Dependency Graph for Repository-Level Code Generation

基于部分依赖图的高效上下文检索用于仓库级代码生成

Zhongxin Liu, Zhonghao Jiang, Zhifan Ye, Haoye Wang, Jiakun Liu, Xiaoxue Ren

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对仓库级代码生成中RAG方法的不足,提出基于部分依赖图的DyRetriever,构建DyCoder并在CoderEval、DevEval上取得显著性能提升且效率更高。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01881 2026-08-04 cs.MM cs.AI 新提交 57%

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

聆听、调用与理解:面向大型音频语言模型的技能调用多模态智能体

Yuwen Wang, Tian-Hao Zhang, Minghao Cai, Yilin Ren, Ziyang Jiang, Xin Wang, Zhichao Wang, Pan Zhou, Kun Zhan, Xinyuan Qian

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对工具交互型音频推理问题,开发了SpeechAgent-R智能体,构建了HIU-Corpus与HIU-Bench,经实验验证其在分布内外任务上均较基础模型有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01175 2026-08-04 cs.AI 新提交 57%

The Graph Language: How Knowledge Graphs Speak to Large Language Models

图语言:知识图谱如何与大语言模型对话

Giuseppe Pirrò

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究针对知识图谱与大语言模型融合的挑战,提出GRALAN模型,通过关系令牌实现KG在LLM语义空间的适配,在问答任务中显著优于现有方法,为KG-LLM融合提供新范式。

Comments Accepted to ISWC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00658 2026-08-04 cs.CL 新提交 57%

Select-And-Extract: A Lightweight Plugin for Retrieval-Augmented Generation

Select-And-Extract:一种用于检索增强生成的轻量级插件

Chenming Tang, Jiawei Han

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对RAG的检索与阅读两类失效模式,提出轻量级插件SANE,通过语义检索+LM选候选、蓝图引导证据提取实现稳定性能提升,且开销适度。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28978 2026-08-04 cs.AI cs.CE 版本更新 57%

VFEAgent: A Multimodal Agent Framework for End-to-End Automated Finite Element Analysis

VFEAgent: 面向端到端自动化有限元分析的多模态智能体框架

Jiachen Zhang, Junyi Lao, Chenghao Liu, Siyuan Liu, Shixin Wu, Linsen Zhang, Boyu Wang, Songfang Huang

机构 * Peking University(北京大学) China Agricultural University(中国农业大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出VFEAgent多智能体系统,通过多模态视觉-语言流水线和验证优先的代码合成框架,实现从输入图像和问题描述到有限元建模与仿真的端到端自动化。

Comments 9 pages, 3 figures, 2 tables. Equal contribution: Jiachen Zhang and Junyi Lao. Corresponding author: Songfang Huang. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05220 2026-08-04 cs.CL cs.SD 版本更新 57%

Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions

Bagpiper: 通过丰富描述解决开放式音频任务

Jinchuan Tian, Haoran Wang, Bo-Hao Su, Chien-yu Huang, Qingzheng Wang, Jiatong Shi, William Chen, Xun Gong, Siddhant Arora, Chin-Jou Li, Masao Someki, Takashi Maekaku, Keita Goto, Yusuke Shinohara, Jin Sakuma, Chao-Han Huck Yang, Shinji Watanabe

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) LY Corporation(LY公司) NVIDIA Research(NVIDIA研究)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出Bagpiper,一个8B参数音频基础模型,通过丰富描述(自然语言描述)实现音频理解和生成的统一,在MMAU和AIRBench上超越Qwen-2.5-Omni,生成质量优于CosyVoice3和TangoFlux。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05698 2026-08-04 cs.AI 版本更新 57%

AIC-VDS: Attention-Based In-Context Learning for Joint Velocity Control and Data Collection Scheduling in Multi-UAV-Assisted Pipeline Monitoring

AIC-VDS:面向多无人机辅助管道监测的联合速度控制与数据采集调度的基于注意力的上下文学习

Yousef Emami, Miguel Gutierrez Gaitan, Atefeh Hajijamali Arani, Jingjing Zheng, Hao Zhou

机构 * IEEE

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对多无人机辅助管道监测中丢包率高的问题,提出AIC-VDS框架,通过注意力模块压缩输入后利用LLM生成调度与速度决策,可将平均提示长度降50%并稳定丢包率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01535 2026-08-04 cs.CV cs.RO 新提交 50%

STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision

STAR-VLM:基于汽车雷达监督的时空视觉语言模型,用于运动与速度估计

Pou-Chun Kung, Aryaman Rao, Utkrisht Sahai, Hemanth Murali, Yi Liu, Rui-Yu Lin, Katherine A. Skinner

机构 * University of Michigan(密歇根大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究提出STAR-VLM框架,利用汽车雷达监督提升时空视觉语言模型的运动推理与度量速度估计能力,在驾驶场景相关任务上实现了优于特定任务方法的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00202 2026-08-04 cs.CR 新提交 50%

From Monoliths to Swarms: A Study of Attack Surface Evolution in the Transition to Multi-Agent Web Systems

从单体到群体:多智能体Web系统转型中的攻击面演化研究

Yashaswi Malla, Sandra Siby

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文针对从单智能体到多智能体Web系统转型的安全问题,提出MAS攻击向量分类法,构建WebMASLab测试平台,发现新型电话环路攻击对多数前沿多智能体模型威胁显著,提示防御通用性有限,揭示多智能体架构的新型安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05637 2026-08-04 cs.SE 版本更新 50%

Real Faults in Model Context Protocol (MCP) Software: a Comprehensive Taxonomy

模型上下文协议(MCP)软件中的真实故障:一种全面的分类

Mina Taraghi, Mohammad Mehdi Morovati, Foutse Khomh

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文首次提出MCP服务器故障的分类,通过实证研究识别出五个高层故障类别,揭示MCP特定故障与非MCP故障的区别,为提升AI软件系统的可靠性提供依据。

Comments Revised version following peer review. Expanded methodological details, practitioner-survey validation, statistical analyses, and discussion; main conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04630 2026-08-04 cs.CY 版本更新 50%

Reflection-Satisfaction Tradeoff: Investigating Impact of Reflection on Student Engagement with AI-Generated Programming Hints

反思与满足度的权衡:探讨反思对学生成就AI生成编程提示的影响

Heeryung Choi, Tung Phung, Mengyan Wu, Adish Singla, Christopher Brooks

专题命中 复杂问题求解 :planning(abstract)

AI总结 本研究探讨了反思提示对学生成就AI生成编程提示的影响,发现反思质量与提示满意度呈负相关,强调需重新考虑AI在教育中的训练和评估方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 56 篇

2608.00014 2026-08-04 cs.AI 新提交 92%

CoT-Core: Accelerating LLM Evaluation via CoT-Aware Coreset Selection

CoT-Core:通过感知思维链的核心集选择加速大语言模型评估

Qihua Pan, Zhenheng Tang, Peijie Dong, Xiang Liu, Huacan Wang, Bo Li, Xiaowen Chu

机构 * Nanjing University(南京大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 CoT-Core是无训练的核心问题选择框架,通过感知大语言模型的思维链推理轨迹聚类问题,可大幅降低LLMs评估成本,且在GSM8K等多数据集上维持高保真度分数估计。

Comments 23 pages, 3 figures, 10 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01783 2026-08-04 cs.SD cs.HC stat.AP 新提交 86%

Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses: Single-Pass Deployment, Repeatability, and Strategy-Specific Bias

GPT-4o-mini与教师平均评分在音乐分析回答自动评分中的比较验证:单次部署、可重复性及策略特异性偏差

Baicheng Lin, Lingxi Jin, Kyung-Seok Min

机构 * Sejong University(世宗大学) Ewha Womans University(梨花女子大学)

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 本研究以教师平均评分为基准,评估GPT-4o-mini对音乐分析回答的自动评分能力,发现Fs+CoT策略与教师评分一致性最强,不同策略评分特征不同,实际应用需针对性校准与人工监督。

Comments Proceedings of the International Meeting of the Psychometric Society: The 91st Annual Meeting, Seoul, Republic of Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00200 2026-08-04 cs.AI cs.CL cs.ET cs.LG 新提交 82%

TRACE-TS: Attribution-Grounded and Traceable Sensor-Language Reasoning for Human Activity Understanding

TRACE-TS:面向人类活动理解的归因基础且可追踪的传感器-语言推理

Sparsh Rastogi, Tanmay Kumar, Baiyu Chen, Jatin Bedi, Zechen Li, Flora D. Salim

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有传感器-语言推理与信号关联弱、解释不可靠的问题,提出TRACE-TS框架,通过专家归因识别关键传感器区域并构建可追踪推理轨迹,在7个可穿戴基准上实现最优性能。

Comments 24 pages, 9 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09786 2026-08-04 cs.AI cs.CL cs.LG 版本更新 82%

Length Penalties Make Chain-of-Thought Less Monitorable

长度惩罚使思维链更难被监测

Bryce Little

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现长度惩罚强化学习会缩短思维链推理,隐藏驱动模型答案的因素。通过训练不同目标链长度的Qwen3模型并评估,表明压缩虽能减少推理令牌、保留准确率,但降低了可监测性,揭示了压缩与可监测性的前沿关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00685 2026-08-04 cs.AI 新提交 81%

When Does LLM Orchestration Pay Off? A Controlled Evaluation of Accuracy, Cost, and Task Difficulty

LLM编排何时划算?关于准确率、成本与任务难度的对照评估

Nicolas Leins, Nico Pelleriti, Jana Gonnermann-Müller, Sebastian Pokutta

机构 * Zuse Institute Berlin(柏林Zuse研究所) TU Berlin(柏林工业大学) Weizenbaum Institute Berlin(柏林魏茨曼研究所)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 该研究对照评估了Self-Refine等三种LLM编排方法与基线方法在5种骨干模型、3个领域的表现,发现编排收益依赖模型,需权衡准确率提升与额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02442 2026-08-04 cs.AI cs.CL 新提交 81%

Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks

正确答案,错误方法:捷径作弊误导前沿科学基准上的大语言模型推理评估

Xuan Ren, Weiqi Zhai, Tianle Pu, Yihua Zhu, Yihua Zhu, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究指出前沿LLM在科学推理基准中存在解题作弊问题,仅答案评估会高估其推理能力,开发的反作弊策略可抑制该问题。

Comments working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01875 2026-08-04 cs.AI cs.LG 新提交 81%

ReasonCast: Towards Explainable Time Series Forecasting with Reasoning

ReasonCast:面向可解释时间序列预测的推理方法

Seunghan Lee, Jun Seo, Jaehoon Lee, Junhyeok Kang, Sangjun Han, Sungdong Yoo, Minjae Kim, Tae Yoon Lim, Dongwan Kang, Hwanil Choi, Soonyoung Lee, Wonbin Ahn

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出任务融合模型ReasonCast,通过微调LLM实现时间序列预测与可解释文本推理的联合生成,在预测准确性上优于LLM和TS模型,还构建了联合评估基准ReasonTS-Bench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01575 2026-08-04 cs.LG cs.AI 新提交 81%

Measuring in-context algorithmic reasoning in language models against an exact Bayes-optimal standard

基于精确贝叶斯最优标准测量语言模型的上下文内算法推理能力

Hector Zenil, Luan Ozelim

机构 * Oxford Immune Algorithmics(牛津免疫算法学公司) Oxford University Innovation(牛津大学创新公司) London Institute for Healthcare Engineering(伦敦医疗工程研究所) King’s College London(伦敦国王学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出F-ICL基准,以精确贝叶斯最优标准测量语言模型的上下文内算法推理能力,发现多数模型分布与最优标准存在差距,该差距与准确率无关且不受模型规模缩小,基准已开放。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22536 2026-08-04 cs.CL cs.AI 版本更新 81%

A Comprehensive FP8 Training Recipe for Reasoning-Enhanced Language Models

用于推理增强型语言模型的综合FP8训练方案

Wenjun Wang, Shuo Cai, Congkai Xie, Mingfa Feng, Yiming Zhang, Zhen Li, Kejing Yang, Ming Li, Jiannong Cao, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出整合持续预训练与监督微调的端到端FP8训练方案,通过混合粒度量化实现高效无损失训练,效率较BF16提升显著,将发布代码推动大规模模型训练普及。

Comments This paper has been withdrawn by the authors due to a significant bug discovered in our data processing pipeline. This bug affects the validity of the experimental results, and we can no longer stand by the conclusions presented

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01292 2026-08-04 cs.CL 新提交 79%

CrossLex: A Source-Grounded Benchmark for Cross-Jurisdictional Legal Reasoning in Large Language Models

CrossLex:面向大语言模型跨司法辖区法律推理的、基于法律来源的基准测试集

Xiaocui Yang, Xican Tan, Shoujie Chen, Shihan Xiao, Keke Tong, Xinyu Zhou

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出基于中、加州、德三国法律来源的CrossLex基准测试集,定义三项任务并提出联合评估指标,发现大语言模型在跨司法辖区法律推理上存在不足,旨在推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏