arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2505.21605 2026-04-07 cs.LG cs.AI cs.CR 62%

SoSBench: Benchmarking Safety Alignment on Six Scientific Domains

SoSBench:在六个科学领域中对安全对齐进行基准测试

Fengqing Jiang, Fengbo Ma, Zhangchen Xu, Yuetai Li, Zixin Rao, Bhaskar Ramasubramanian, Luyao Niu, Bo Li, Xianyan Chen, Zhen Xiang, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Georgia(佐治亚大学) WWU(西华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SoSBench针对高风险科学领域设计,通过3000个基于真实法规的提示评估大模型的安全性,揭示了先进模型在处理危险场景时存在严重的安全对齐缺陷。

Comments Project Page: https://sosbench.github.io/; ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01504 2026-04-03 cs.CL cs.AI cs.CY 62%

Magic, Madness, Heaven, Sin: LLM Output Diversity is Everything, Everywhere, All at Once

魔术、疯狂、天堂、罪恶:LLM输出多样性无处不在

Harnoor Dhingra

机构 * Microsoft(微软)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Magic, Madness, Heaven, Sin框架,从四个规范性场景分析LLM输出多样性,揭示任务目标对输出多样性的影响,强调需基于任务目标进行多样性评估。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14377 2026-04-02 cs.CL cs.IR cs.LG 62%

PluriHopRAG: Exhaustive, Recall-Sensitive QA Through Corpus-Specific Document Structure Learning

PluriHopRAG: 通过语料库特定文档结构学习实现全面、召回敏感的问答

Mykolas Sveistrys, Richard Kunert

机构 * Turbit Systems GmbH

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出PluriHopRAG,通过学习语料库特定文档结构分解查询,改进多跳问答任务的召回敏感性和全面性,在PluriHopWIND和Loong基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00025 2026-04-02 cs.CL cs.AI 62%

Brevity Constraints Reverse Performance Hierarchies in Language Models

简洁性约束在语言模型中逆转性能层级

MD Azizul Hakim

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,对大语言模型施加简洁性约束可逆转其在数学推理和科学知识上的性能层级,提升准确率并降低性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00002 2026-04-02 cs.CL cs.AI 62%

Benchmark for Assessing Olfactory Perception of Large Language Models

嗅觉感知基准测试

Eftychia Makri, Nikolaos Nakis, Laura Sisson, Gigi Minsky, Leandros Tassiulas, Vahid Satarifard, Nicholas A. Christakis

机构 * Patina(Patina公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出嗅觉感知基准测试,评估大语言模型对气味的推理能力,发现化合物名称提示优于SMILES表示,揭示LLM主要通过词汇关联而非结构分子推理获取嗅觉知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13129 2026-04-02 cs.CV cs.AI cs.LG 62%

Science-T2I: Addressing Scientific Illusions in Image Synthesis

Science-T2I: 解决图像合成中的科学幻觉

Jialuo Li, Wenhao Chai, Xingyu Fu, Haiyang Xu, Saining Xie

机构 * New York University(纽约大学) University of Washington(华盛顿大学) University of Pennsylvania(宾夕法尼亚大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ScienceT2I数据集,评估18种图像生成模型,发现科学提示能显著提升生成效果,提出SciScore奖励模型和两阶段对齐框架提升科学推理能力。

Comments Accepted to CVPR 2025. Code, docs, weight, benchmark and training data are all avaliable at https://jialuo-li.github.io/Science-T2I-Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29893 2026-04-01 cs.HC cs.AI cs.CL cs.MA 62%

Perfecting Human-AI Interaction at Clinical Scale. Turning Production Signals into Safer, More Human Conversations

在临床规模上完善人机交互。将生产信号转化为更安全、更人性化的对话

Subhabrata Mukherjee, Markel Sanz Ausin, Kriti Aggarwal, Debajyoti Datta, Shanil Puri, Woojeong Jin, Tanmay Laud, Neha Manjunath, Jiayuan Ding, Bibek Paudel, Jan Schellenberger, Zepeng Frazier Huo, Walter Shen, Nima Shirazian, Nate Potter, Sathvik Perkari, Darya Filippova, Anton Morozov, Austin Mease, Vivek Muppalla, Ghada Shakir, Alex Miller, Juliana Ghukasyan, Mariska Raglow-Defranco, Maggie Taylor, Herprit Mahal, Jonathan Agnew

机构 * Hippocratic AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于真实患者与AI交互数据的框架,通过分析实时信号提升医疗AI的安全性和可靠性,减少ASR错误,提高患者体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29038 2026-04-01 cs.CR cs.AI cs.CL 62%

Trojan-Speak: Bypassing Constitutional Classifiers with No Jailbreak Tax via Adversarial Finetuning

Trojan-Speak:通过对抗微调规避宪法分类器无需牢笼突破

Bilgehan Sel, Xuanli He, Alwin Peng, Ming Jin, Jerry Wei

机构 * University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Trojan-Speak方法,通过结合课程学习和GRPO混合强化学习,利用对抗微调规避Anthropic的宪法分类器,实现99%以上的分类器规避,同时保持低的推理能力下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09082 2026-04-01 cs.CV cs.AI cs.LG 62%

AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models

AVA-Bench:用于视觉基础模型的原子视觉能力基准

Zheda Mai, Arpita Chowdhury, Zihe Wang, Sooyoung Jeon, Lemeng Wang, Jiacheng Hou, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院) Boston University(波士顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AVA-Bench通过解耦14种原子视觉能力,揭示视觉基础模型的性能差异,提升模型选择的科学性与效率。

Comments Accepted by CVPR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01331 2026-03-31 cs.CY cs.CL cs.LG 62%

AppellateGen: A Benchmark for Appellate Legal Judgment Generation

AppellateGen:上诉法律判决生成的基准测试

Hongkun Yang, Lionel Z. Wang, Wei Fan, Yiran Hu, Lixu Wang, Chenyu Liu, Yu Zeng, Shenghong Fu, Lei Gong, Zhengxin Zhang, Haoyang Li, Jiexin Zheng, Xin Xu

机构 * Nanyang Technological University(南洋理工大学) Ocean University of China(中国海洋大学) The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AppellateGen基准测试,包含7351个案例对,用于生成上诉阶段的法律判决,通过模拟司法流程验证模型在上诉推理中的逻辑一致性与挑战。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26728 2026-03-31 cs.DB cs.AI cs.CL 62%

SEAR: Schema-Based Evaluation and Routing for LLM Gateways

SEAR:基于模式的LLM网关评估与路由

Zecheng Zhang, Han Zheng, Yue Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SEAR通过定义可扩展的关系模式,统一LLM评估与路由,实现细粒度质量信号和操作决策,支持大规模生产会话中的高效路由决策。

Comments 10 pages, 6 pages appendix, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25293 2026-03-27 cs.AI cs.CL 62%

DAGverse: Building Document-Grounded Semantic DAGs from Scientific Papers

DAGverse: 从科学论文构建文档导向的语义DAG

Shu Wan, Saketh Vishnubhatla, Iskander Kushbay, Tom Heffernan, Aaron Belikoff, Raha Moraffah, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DAGverse框架,通过科学论文中的显式DAG图和文本上下文,自动构建文档导向的语义DAG,提升DAG分类和标注的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11687 2026-03-27 cs.CL cs.AI 62%

SemBench: A Universal Semantic Framework for LLM Evaluation

SemBench:一种通用的语义框架用于LLM评估

Mikel Zubillaga, Naiara Perez, Oscar Sainz, German Rigau

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SemBench通过字典词义定义和句子编码器自动生成合成基准,评估LLM的语义能力,无需人工 curated 例句,实现跨语言、多资源的高效评估。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15281 2026-03-27 cs.RO cs.AI cs.CL cs.HC 62%

LLM4AD: Large Language Models for Autonomous Driving -- Concept, Review, Benchmark, Experiments, and Future Trends

LLM4AD:大型语言模型在自动驾驶中的应用——概念、综述、基准测试、实验与未来趋势

Can Cui, Yunsheng Ma, Sung-Yeon Park, Zichong Yang, Yupeng Zhou, Peiran Liu, Juanwu Lu, Juntong Peng, Jiaru Zhang, Ruqi Zhang, Lingxi Li, Yaobin Chen, Jitesh H. Panchal, Amr Abdelraouf, Rohit Gupta, Kyungtae Han, Ziran Wang

机构 * Purdue University(普渡大学) Institute for Physical Artificial Intelligence (IPAI), Purdue University(普渡大学物理人工智能研究所) Department of Computer Science, Purdue University(普渡大学计算机科学系) InfoTech Labs, Toyota Motor North America(丰田北美信息技术实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了将大型语言模型应用于自动驾驶的潜力,提出LLM4AD概念,构建了评估框架,并通过实验和未来趋势分析揭示了挑战与发展方向。

Comments The paper was accepted by the Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24943 2026-03-27 cs.AI cs.CL 62%

FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol

FinMCP-Bench:基于模型上下文协议的LLM代理在真实金融工具使用中的基准测试

Jie Zhu, Yimin Tian, Boyang Li, Kehao Wu, Zhongzhi Liang, Junhui Li, Xianyin Zhang, Lifan Guo, Feng Chen, Yong Liu, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(阿里云云计算千问点睛团队) YINGMI Wealth Management(盈米财富管理) Soochow University(苏州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FinMCP-Bench,用于评估LLM在解决真实金融问题时通过调用金融模型上下文协议的能力,包含613个样本,涵盖10种主要场景和33种子场景,提供真实和合成查询,评估不同任务复杂度下的模型表现。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24389 2026-03-26 cs.CL cs.AI cs.CY 62%

When AI Meets Early Childhood Education: Large Language Models as Assessment Teammates in Chinese Preschools

当人工智能遇见早期教育:大型语言模型作为中国幼儿园的评估伙伴

Xingming Li, Runke Huang, Yanan Bao, Yuye Jin, Yuru Jiao, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨AI如何通过提取结构化质量指标,提升中国幼儿园教师与儿童互动评估的可扩展性,提出TEPE-TCI-370h数据集和Interaction2Eval框架,实现88%的评估一致性,并验证AI在提升评估效率和促进教育公平中的潜力。

Comments Accepted to AIED 2026, Project page: https://qingyonghu.github.io/Interaction2Eval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23937 2026-03-26 cs.CL cs.LG 62%

Dialogue to Question Generation for Evidence-based Medical Guideline Agent Development

对话到问题生成用于基于证据的医疗指南代理开发

Zongliang Ji, Ziyang Zhang, Xincheng Tan, Matthew Thompson, Anna Goldenberg, Carl Yang, Rahul G. Krishnan, Fan Zhang

机构 * Google Research(谷歌研究) University of Toronto(多伦多大学) Vector Institute Canada(加拿大向量研究所) Emory University(埃默里大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨利用大语言模型生成基于证据的问题,以辅助医生在短时间内进行诊疗决策,通过两种提示策略评估模型效果,结果显示LLM能生成具有临床意义的问题,有助于减轻医生认知负担。

Comments 9 pages. To appear in Proceedings of Machine Learning Research (PMLR), Machine Learning for Health (ML4H) Symposium 2025

Journal ref Proceedings of Machine Learning Research 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23646 2026-03-26 cs.CL cs.AI 62%

Swiss-Bench SBP-002: A Frontier Model Comparison on Swiss Legal and Regulatory Tasks

Swiss-Bench SBP-002:瑞士法律与监管任务上的前沿模型比较

Fatih Uenal

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Swiss-Bench SBP-002,一个包含395个专家定制任务的三语基准,评估十种前沿模型在瑞士监管任务中的表现,揭示了不同任务类型的难度差异及模型性能分布。

Comments 21 pages, 5 figures, 7 tables. Code and data: https://github.com/FUenal/swiss-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23521 2026-03-26 cs.CL cs.AI cs.CV 62%

Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages

Chitrakshara:一种用于印度语言的大型多语言多模态数据集

Shaharukh Khan, Ali Faraz, Abhinav Ravi, Mohd Nauman, Mohd Sarfraz, Akshat Patidar, Raja Kolla, Chandra Khatri, Shubham Agarwal

机构 * Krutrim AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Chitrakshara数据集,涵盖11种印度语言,旨在提升多模态模型对印度语言的表示能力,通过大规模预训练和图像文本对的构建,促进更文化包容的视觉语言模型发展。

Comments Accepted at "CVPR 2025: Workshop Vision Language Models For All"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23511 2026-03-26 cs.CL cs.AI cs.CV 62%

DISCO: Document Intelligence Suite for COmparative Evaluation

DISCO:用于比较评估的文档智能套件

Kenza Benkirane, Dan Goldwater, Martin Asenov, Aneiss Ghodsi

机构 * Parexel AI Labs(Parexel人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DISCO通过评估OCR流水线和视觉语言模型在不同文档类型上的表现,揭示了任务和文档特性对性能的影响,为选择文档处理策略提供依据。

Comments Accepted at the ICLR 2026 Workshop on Multimodal Intelligence (MMIntelligence). 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21910 2026-03-26 cs.CL cs.AI 62%

AutoSCORE: Enhancing Automated Scoring with Multi-Agent Large Language Models via Structured Component Recognition

AutoSCORE: 通过结构化组件识别提升多智能体大语言模型的自动评分

Yun Wang, Zhaojun Ding, Xuansheng Wu, Siyue Sun, Ninghao Liu, Xiaoming Zhai

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AutoSCORE通过多智能体大语言模型和结构化组件识别提升自动评分的准确性与可解释性,在多个基准数据集上表现出色,尤其在复杂评分标准下效果显著。

Comments 9 pages, 2 figures

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(48), 40898-40906, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23355 2026-03-25 cs.LG cs.CL 62%

Off-Policy Value-Based Reinforcement Learning for Large Language Models

为大语言模型设计的非策略价值基于强化学习

Peng-Yuan Wang, Ziniu Li, Tian Xu, Bohan Yang, Tian-Shuo Liu, ChenYang Wang, Xiong-Hui Chen, Yi-Chen Li, Tianyun Yang, Congliang Chen, Yang Yu

机构 * National Key Laboratory for Novel Software Technology & School of Artificial Intelligence, Nanjing University(新型软件技术国家重点实验室 & 智能科学与技术学院,南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(大数据研究院(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ReVal方法,通过结合步级信号和轨迹级信号提升大语言模型的训练效率,实验表明其在数学推理任务中优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04945 2026-03-25 cs.CL cs.AI cs.HC 62%

Collaborative Evaluation of Deepfake Text with Deliberation-Enhancing Dialogue Systems

协同评估深度伪造文本的深度伪造Deliberation对话系统

Jooyoung Lee, Xiaochen Zhu, Georgi Karadzhov, Tom Stafford, Andreas Vlachos, Dongwon Lee

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了DeepFakeDeLiBot在深度伪造文本检测中的协同评估效果,发现群体问题解决能提高机器生成文本的识别准确率,尽管与AI工具的交互未显著提升整体性能,但增强了群体互动和协作效率。

Comments 15; To appear in ICWSM 2026 (https://www.icwsm.org/2026/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22529 2026-03-25 cs.CV cs.AI cs.CL 62%

Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos

Ego2Web:一种基于第一人称视频的网络代理基准测试

Shoubin Yu, Lei Shu, Antoine Yang, Yao Fu, Srinivas Sunkara, Maria Wang, Jindong Chen, Mohit Bansal, Boqing Gong

机构 * Google DeepMind(谷歌DeepMind) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 Ego2Web通过结合真实世界第一人称视频与网络任务,解决网络代理在现实物理环境中的感知问题,提出LLM-as-a-Judge评估方法,揭示当前代理在视觉理解和任务规划上的不足。

Comments CVPR 2026. Project page: https://ego2web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22333 2026-03-25 cs.LG cs.AI 62%

Graph Signal Processing Meets Mamba2: Adaptive Filter Bank via Delta Modulation

图信号处理与Mamba2交汇:通过Delta调制实现自适应滤波器组

Yehjin Shin, Seojin Kim, Noseong Park

机构 * KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HADES框架,将Mamba2重新解释为线图上的自适应滤波器组,通过结构化偏置实现全局低通和局部高通滤波,提升效率和可解释性。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22321 2026-03-25 cs.CV cs.AI cs.CL 62%

From Instructions to Assistance: a Dataset Aligning Instruction Manuals with Assembly Videos for Evaluating Multimodal LLMs

从指令到协助:一个对齐指令手册与装配视频的数据集用于评估多模态大语言模型

Federico Toschi, Nicolò Brunello, Andrea Sassella, Vincenzo Scotti, Mark James Carman

机构 * DEIB, Politecnico di Milano(米兰理工大学DEIB学院) KASTEL, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院KASTEL研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出M2AD数据集,用于评估多模态大语言模型在技术任务中的协助能力,探讨其推理、步骤跟踪和指令引用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22305 2026-03-25 cs.LG cs.AI 62%

CN-Buzz2Portfolio: A Chinese-Market Dataset and Benchmark for LLM-Based Macro and Sector Asset Allocation from Daily Trending Financial News

CN-Buzz2Portfolio: 一个面向中国市场、基于LLM的宏观与行业资产配置基准数据集

Liyuan Chen, Shilong Li, Jiangpeng Yan, Shuoling Liu, Qiang Yang, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) E Fund Management Co., Ltd.(E基金管理有限公司) Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CN-Buzz2Portfolio数据集,用于评估LLM在动态金融决策中的表现,通过模拟真实市场关注流,测试模型在宏观叙事到资产配置的转换能力,揭示不同模型在资产分配上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23455 2026-03-24 cs.LG cs.AI cs.CY 62%

The Price of Progress: Price Performance and the Future of AI

进步的价格:价格性能与AI的未来

Hans Gundlach, Jayson Lynch, Matthias Mertens, Neil Thompson

机构 * MIT FutureTech, CSAIL, Cambridge, MA, USA(麻省理工学院未来科技、计算机科学与人工智能实验室,马萨诸塞州剑桥市) MIT FutureTech, Sloan, Cambridge, MA, USA(麻省理工学院未来科技、斯隆管理学院,马萨诸塞州剑桥市)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了AI模型在基准测试中的性能与成本关系,发现价格性能显著下降,但前沿模型运行成本因模型规模和推理需求增加而上升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21415 2026-03-24 cs.AI cs.CR cs.LG 62%

Silent Commitment Failure in Instruction-Tuned Language Models: Evidence of Governability Divergence Across Architectures

指令调优语言模型中的沉默承诺失败:跨架构可控性分歧的证据

Gregory M. Ruddell

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究发现指令遵循模型在冲突检测中存在沉默承诺失败,可控性差异显著,且基准准确度无法预测可控性,提示可控性在预训练阶段固定。

Comments 39 pages, 5 figures, 5 tables. Preprint. Submitted to NIST CAISI (Docket NIST-2025-0035, March 2026). Also available on Zenodo: https://doi.org/10.5281/zenodo.18971110

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20799 2026-03-24 cs.CL cs.LG 62%

RLVR Training of LLMs Does Not Improve Thinking Ability for General QA: Evaluation Method and a Simple Solution

基于可验证奖励的强化学习训练不会提升大语言模型的通用问答能力:评估方法和一个简单解决方案

Kaiyuan Li, Jing-Cheng Pang, Yang Yu

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文评估了基于可验证奖励的强化学习是否能提升大语言模型在通用问答任务中的推理能力,发现其效果不如可验证任务,并提出START方法提升问答质量和回答质量。

详情

展开后加载摘要…

URL PDF HTML 收藏