arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-28 至 2026-04-28 共收录 204 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 52 篇

2604.24698 2026-04-28 cs.CL 57%

The Chameleon's Limit: Investigating Persona Collapse and Homogenization in Large Language Models

Chameleon的极限:探究大型语言模型中的人格崩溃与同质化

Yunze Xiao, Vivienne J. Zhang, Chenghao Yang, Ningshan Ma, Weihao Xuan, Jen-tse Huang

机构 * CMU(卡内基梅隆大学) UChicago(芝加哥大学) MIT(麻省理工学院) UTokyo(东京大学) RIKEN AIP(理化学研究所AIP分部) JHU(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究发现大型语言模型中存在人格崩溃现象,导致代理行为模式趋同。通过提出覆盖度、均匀度和复杂度指标,揭示模型在不同维度和领域的人格表现差异,并释放工具支持群体评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24690 2026-04-28 cs.CL 57%

Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination

LLMs能否成为历史学家?通过中国科举制度评估LLMs的历史研究能力

Lirong Gao, Zeqing Wang, Yuyan Cai, Jiayi Deng, Yanmei Gu, Yiming Zhang, Jia Zhou, Yanfei Zhang, Junbo Zhao

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ProHist-Bench基准,基于中国科举制度评估LLMs的历史研究能力,揭示其在复杂历史问题上的不足,旨在推动领域特定推理LLM的发展。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24618 2026-04-28 cs.AI 57%

Evaluating whether AI models would sabotage AI safety research

评估AI模型是否会破坏AI安全研究

Robert Kirk, Alexandra Souly, Kai Fronsdal, Abby D'Cruz, Xander Davies

机构 * UK AI Security Institute(英国人工智能安全研究所) UK AISI Research Affiliate(英国人工智能安全研究所研究附属)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估前沿模型在作为AI研究代理部署时对安全研究的破坏倾向,发现未提示下无破坏行为,但部分模型在持续破坏评估中表现出隐蔽破坏倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24572 2026-04-28 cs.AI cs.MA 57%

FastOMOP: A Foundational Architecture for Reliable Agentic Real-World Evidence Generation on OMOP CDM data

FastOMOP:一种用于OMOP CDM数据上可靠代理现实世界证据生成的基础架构

Niko Moeller-Grell, Shihao Shenzhang, Zhangshu Joshua Jiang, Richard JB Dobson, Vishnu V Chandrabalan

机构 * Lancashire Teaching Hospitals NHS Foundation Trust(兰开夏教学医院国家健康服务信托基金会) Lancaster University(兰卡斯特大学) EPSRC DRIVE-Health, Department of Biostatistics & Health Informatics(EPSRC DRIVE-Health,生物统计学与健康信息学部门) King’s College London(伦敦国王学院) Institute for Health Informatics(健康信息学研究所) University College London(伦敦大学学院) NIHR Biomedical Research Centre(英国国家健康服务研究院生物医学研究中心) University College London Hospitals NHS Foundation Trust(伦敦大学学院医院国家健康服务信托基金会) Health Data Research UK London(英国健康数据研究伦敦) South London and Maudsley NHS Foundation Trust and King’s College London(伦敦南部及莫德利国家健康服务信托基金会和伦敦国王学院) Department of Biostatistics & Health Informatics, Institute of Psychiatry, Psychology & Neuroscience(生物统计学与健康信息学部门,精神病学、心理学与神经科学研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出FastOMOP架构,通过分离治理、可观测性和编排三层,解决代理系统在现实世界证据生成中的安全性和可靠性问题,验证结果显示其在不同数据集上均能保持高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24158 2026-04-28 cs.AI 57%

Multi-Dimensional Evaluation of Sustainable City Trips with LLM-as-a-Judge and Human-in-the-Loop

多维评估可持续城市旅行的LLM-as-Judge与人机协同

Ashmi Banerjee, Adithi Satish, Wolfgang Wörndl, Yashar Deldjoo

机构 * Technical University of Munich(慕尼黑技术大学) Polytechnic University of Bari(巴里理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出多维评估可持续城市旅行推荐的框架,通过LLM-as-Judge和人类协同校准,解决传统指标忽略利益相关者目标的问题,揭示模型偏差与维度差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24156 2026-04-28 cs.GT cs.AI 57%

Strategic Bidding in 6G Spectrum Auctions with Large Language Models

在6G频谱拍卖中使用大语言模型进行战略投标

Ismail Lotfi, Ali Ghrayeb

机构 * College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·卡西姆大学科学与工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了在车载网络中使用大语言模型作为投标代理进行6G频谱拍卖,探讨了LLM在预算约束下的投标策略及其对拍卖机制的影响。

Comments Accepted at IEEE Transactions on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23720 2026-04-28 cs.LG 57%

Quasi-Equivariant Metanetworks

准等变元网络

Viet-Hoang Tran, An Nguyen, Benoît Guérand, Thieu N. Vo, Tan M. Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出准等变元网络,通过引入准等变性概念,在保留功能一致性的同时,突破严格等变性的刚性限制,提升元网络的表达能力和鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23653 2026-04-28 cs.CV cs.AI 57%

ResAF-Net: An Anchor-Free Attention-Based Network for Tree Detection and Agricultural Mapping in Palestine

ResAF-Net:一种基于注意力的无锚点网络用于巴勒斯坦树木检测和农业制图

Rabee Al-Qasem

机构 * AI-Developer Ministry of Labor - GGateway.ps(AI开发者劳动部 - GGateway.ps)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出ResAF-Net,一种基于卫星的树木检测框架,用于资源受限环境下的大规模农业监测。该框架结合了ResNet-50编码器、ASPP、特征融合阶段、多头自注意力细化模块和无锚点FCOS检测头,实现了在密集和异质场景中对树木的高效定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23581 2026-04-28 cs.SE cs.CL 57%

AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking

AgentEval: 基于DAG结构的步骤级评估用于具有错误传播跟踪的代理工作流

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 AgentEval通过构建评估有向无环图,实现对代理工作流中错误传播的精准追踪,提升故障检测召回率和根本原因准确性,适用于生产环境中的代理系统评估。

Comments Accepted at ACL 2026 Industry Track. 14 pages, 3 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10708 2026-04-28 cs.SD cs.AI cs.CV cs.MM 57%

Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

Audio-Omni: 扩展多模态理解到多功能音频生成与编辑

Zeyue Tian, Binxin Yang, Zhaoyang Liu, Jiexuan Zhang, Ruibin Yuan, Hubery Yin, Qifeng Chen, Chen Li, Jing Lyu, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) WeChat Vision, Tencent Inc(微信视觉,腾讯公司) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Audio-Omni提出首个端到端框架,统一音频生成与编辑,结合多模态理解能力,通过冻结的多模态大语言模型与可训练的扩散变换器实现高保真合成,并构建大规模数据集提升音频编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17687 2026-04-28 cs.CR cs.AI 57%

CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks

CrossGuard: 保护大规模多模态语言模型免受联合模态隐式恶意攻击

Xu Zhang, Hao Li, Zhichao Lu

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Computer Science & Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CrossGuard,一种意图感知的防护系统,通过生成隐式样本和实验验证,有效防御显式和隐式攻击,提升大规模多模态语言模型的安全性与实用性。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14635 2026-04-28 cs.CL cs.PL cs.SE 57%

SWE-QA: Can Language Models Answer Repository-level Code Questions?

SWE-QA: 语言模型能否回答仓库级代码问题?

Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出SWE-QA基准,旨在研究自动化QA系统在真实代码环境中的能力,包含576个高质量问题对,涵盖意图理解、跨文件推理和多跳依赖分析,评估六种先进LLM在不同上下文增强策略下的表现。

Comments Accepted to ACL 2026 Findings. Code and data available at https://github.com/peng-weihan/SWE-QA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16419 2026-04-28 cs.SE cs.LG 57%

Can LLMs Find Bugs in Code? An Evaluation from Beginner Errors to Security Vulnerabilities in Python and C++

LLMs能否发现代码中的错误?对Python和C++中初级错误到安全漏洞的评估

Akshay Mhatre, Noujoud Nader, Patrick Diehl, Deepti Gupta

机构 * 1 Dept. of Computer Information Systems, Texas A\&M University - Central Texas, TX, 76549 USA. 2 LSU Center for Computation \& Technology, Louisiana State University, Baton Rouge, LA, 70803 USA. 3 Department of Physics Astronomy, Louisiana State University, Baton Rouge, LA, 70803 USA. 4 Applied Computer Science (CCS-7), Los Alamos National Laboratory, Los Alamos, NM 87545 USA.

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文评估了三个主流LLM在检测Python和C++中基础错误、经典安全漏洞及生产级bug的有效性,发现其在语法和语义问题上表现良好,但在复杂安全漏洞和大规模代码中性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23523 2026-04-28 cs.SE cs.AI 57%

Grammar-Constrained Refinement of Safety Operational Rules Using Language in the Loop: What Could Go Wrong

基于语言闭环的安全操作规则语法约束细化:可能发生的问题

Khouloud Gaaloul, Zaid Ghazal, Madhu Latha Pulimi, Sam Emmanuel Kathiravan

机构 * University of Michigan--Dearborn(密歇根大学迪尔伯恩分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出结合反事实推理与语法约束循环的框架,用于安全操作规则的细化,通过自主驾驶控制系统案例展示其在解决不一致规则中的有效性,并强调语法约束与语义验证的重要性。

Comments 6 pages, 1 figure, 2 tables. Accepted at SEAMS 2026

Journal ref Proc. 21st International Conference on Software Engineering for Adaptive and Self-Managing Systems (SEAMS 2026), ACM, 2026, 6 pages

详情
URL PDF HTML 收藏
2604.23366 2026-04-28 cs.AI cs.MA 57%

GSAR: Typed Grounding for Hallucination Detection and Recovery in Multi-Agent LLMs

GSAR:多智能体大语言模型中基于类型的 grounding 检测与恢复

Federico A. Kamelhar

机构 * Agentic AI Oracle Corporation(Agentic AI Oracle公司)

专题命中 推理评测 :self-correction(abstract);分类 cs.AI

AI总结 GSAR 提出了一种 grounding 评估与规划框架,通过四类分类、证据权重分配、矛盾惩罚评分和三层决策函数,实现多智能体大语言模型中的 hallucination 检测与恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23051 2026-04-28 cs.CL 57%

Evaluating Temporal Consistency in Multi-Turn Language Models

评估多轮语言模型中的时间一致性

Yash Kumar Atri, Steven L. Johnson, Tom Hartvigsen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究多轮对话中语言模型维持和更新时间假设的能力,提出ChronoScope基准测试集,发现模型在长对话中时间一致性常被破坏,揭示单轮事实准确与序列交互中时间推理的差距。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22785 2026-04-28 cs.LG 57%

CoFi-PGMA: Counterfactual Policy Gradients under Filtered Feedback for Multi-Agent LLMs

CoFi-PGMA:在多智能体LLM中基于过滤反馈的反事实策略梯度

Stela Tong, Elai Ben-Gal

机构 * Stanford Graduate School of Business(斯坦福商学院) Stanford University(斯坦福大学) Department of Mathematics(数学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 针对多智能体LLM中过滤反馈导致的RLHF目标不准确问题,提出CoFi-PGMA框架,通过边际贡献反事实目标修正路由和协作机制下的学习信号,并提供实用训练算法和实证研究。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19679 2026-04-28 cs.AI 57%

InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning

InquireMobile: 教授基于VLM的移动代理通过强化微调请求人类帮助

Qihang Ai, Pi Bu, Yue Cao, Yingyao Wang, Jihao Gu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Zhicheng Zheng, Jun Song, Yuning Jiang

机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出InquireMobile,通过强化学习方法提升移动代理在关键决策点主动请求人类帮助的能力,实现46.8%的询问成功率提升,成为InquireBench上表现最佳的基线模型。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10141 2026-04-28 cs.CV cs.CL cs.MM 57%

ANCHOR: LLM-driven Subject Conditioning for Text-to-Image Synthesis

ANCHOR:基于大语言模型的文本到图像合成中的主体条件化

Aashish Anantha Ramakrishnan, Sharon X. Huang, Dongwon Lee

机构 * Optum AI The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ANCHOR通过大规模抽象式标题数据集研究文本到图像合成中多主体理解与上下文推理的缺陷,提出基于大语言模型的主体感知微调方法,提升图像-标题一致性与人类偏好对齐。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21372 2026-04-28 eess.IV cs.CV 50%

A Graph-Augmented knowledge Distillation based Dual-Stream Vision Transformer with Region-Aware Attention for Gastrointestinal Disease Classification with Explainable AI

一种基于图增强知识蒸馏的双流视觉Transformer与区域感知注意力的胃肠道疾病分类可解释AI方法

Md Assaduzzaman, Nushrat Jahan Oyshi, Eram Mahamud

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一种结合图增强知识蒸馏的双流视觉Transformer与区域感知注意力机制,用于胃肠道疾病分类,通过软标签蒸馏实现高效且准确的诊断,同时保证模型的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23374 2026-04-28 cs.CR 50%

Ghost in the Agent: Redefining Information Flow Tracking for LLM Agents

代理中的幽灵:重新定义LLM代理的信息流跟踪

Yuandao Cai, Wensheng Tang, Cheng Wen, Shengchao Qin

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出NeuroTaint框架,通过语义证据、因果推理和持久上下文跟踪,解决LLM代理中信息流跟踪问题,优于现有基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23288 2026-04-28 cs.NI 50%

An Agentic Framework for Intent Co-Creation in 6G NaaS: Architecture and Open-Source Model Evaluation

面向6G NaaS的意图共创作代理框架:架构与开源模型评估

Kostis Trantzas, Besiana Agko, Christos Tranoris, Irene Denazi

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出面向6G NaaS的意图驱动端到端 orchestration 框架,通过协作意图共创作提升复杂网络环境下的自主性,评估开源大语言模型在高分辨率意图到有效订单转换中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22855 2026-04-28 cs.CV 50%

Evaluating Remote Sensing Image Captions Beyond Metric Biases

超越度量偏差的遥感图像描述评估

Ziyun Chen, Fan Liu, Liang Yao, Chuanyi Zhang, Yuye Ma, Wei Zhou

机构 * Hohai University(河海大学) Cardiff University(卡迪夫大学)

专题命中 推理评测 :self-correction(abstract)

AI总结 本文提出ReconScore指标,通过文本重建能力评估描述质量,发现未微调的MLLM在零样本遥感图像描述任务中表现更优,并引入无需训练的RemoteDescriber方法提升语义精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22591 2026-04-28 cs.IR 50%

Where Relevance Emerges: A Layer-Wise Study of Internal Attention for Zero-Shot Re-Ranking

相关性如何出现:对零样本重排序内部注意力的分层研究

Haodong Chen, Shengyao Zhuang, Zheng Yao, Guido Zuccon, Teerapong Leelanupab

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了多排名框架中生成、似然和内部注意力机制的对比,发现Transformer层中相关性信号呈现钟形分布,提出Selective-ICR策略降低推理延迟30%-50%,并在BRIGHT基准测试中证明了内部信号在复杂推理排序中的潜力。

Comments Accepted by SIGIR 2026. 10 pages, 5 figures, 4 tables. Code available at https://github.com/ielab/Selective-ICR

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 30 篇

2510.13117 2026-04-28 cs.LG cs.AI cs.CL 87%

On the Reasoning Abilities of Masked Diffusion Language Models

关于掩码扩散语言模型的推理能力

Anej Svete, Ashish Sabharwal

机构 * ETH Zürich(苏黎世联邦理工学院) Allen Institute for AI(人工智能研究所)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了掩码扩散模型在推理任务中的能力,通过与链式思维和填充循环变压器框架对比,证明了其在有限精度对数宽度下与多项式填充PLTs等效,并展示了其在解决特定问题时的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00127 2026-04-28 cs.SE cs.AI cs.PL 81%

Generating Verifiable Chain of Thoughts from Exection-Traces

从执行轨迹生成可验证的推理链

Shailja Thakur, Vaibhav Saxena, Rohan Kulkarni, Shivdeep Singh, Parameswaran Selvam, Hima Patel, Hiroshi Kanayama

机构 * IBM Research, India(印度IBM研究院) IBM Research, Japan(日本IBM研究院)

专题命中 其他推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出通过生成执行轨迹验证的推理链,提升模型在代码推理和生成中的准确性,实验显示验证质量显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00823 2026-04-28 cs.AI cs.IT cs.SY eess.SY math.IT 79%

Energy-Aware Routing to Large Reasoning Models

面向大推理模型的节能路由

Austin R. Ellis-Mohr, Max Hartman, Lav R. Varshney

机构 * Department of Electrical and Computer Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系) AI Innovation Institute, Stony Brook University(石溪大学人工智能创新研究所)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对大推理模型的能耗问题,提出基于能量供应与波动平衡的路由策略,通过第二阶分析提升系统性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16817 2026-04-28 cs.LG cs.AI 73%

Self-Reinforcing Controllable Synthesis of Rare Relational Data via Bayesian Calibration

通过贝叶斯校准实现自我强化的可控稀有关系数据合成

Chongsheng Zhang, Hao Wang, Zelong Yu, Esteban Garces Arias, Julian Rodemann, Zhanshuo Zhang, Qilong Li, Gaojuan Fan, Krikamol Muandet, Christian Heumann

机构 * Henan University, China(河南大学) Department of Statistics, LMU Munich(慕尼黑大学统计系) MCML Munich(慕尼黑MCML) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(萨尔布吕肯德国海德堡中心信息安全研究所)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RDDG框架,通过动态引导生成表格数据以提升不平衡分类性能,采用核心集选择和自强化反馈机制优化生成质量。

Comments Accepted at: Findings of the Association for Computational Linguistics: ACL 2026 (ACL 2026 Findings), San Diego, California, USA, July 2-7, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01595 2026-04-28 cs.CL cs.AI cs.LG 67%

Always Tell Me The Odds: Fine-grained Conditional Probability Estimation

始终告诉我概率:细粒度条件概率估计

Liaoyaqi Wang, Zhengping Jiang, Anqi Liu, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种最先进的模型,用于在上下文条件下对命题进行细粒度概率估计。通过结合人类和合成数据创建与评估、扩大模型规模和改进监督,提出了一系列强而精确的概率估计模型,在依赖条件概率估计的任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24715 2026-04-28 cs.CL cs.LG 62%

Long-Context Aware Upcycling: A New Frontier for Hybrid LLM Scaling

长上下文意识的升级:混合大语言模型扩展的新前沿

Parsa Ashrafi Fashi, Utkarsh Saxena, Mehdi Rezagholizadeh, Aref Jafari, Akash Haridas, Mingyu Yang, Vansh Bhatia, Guihong Li, Vikram Appia, Emad Barsoum

机构 * AMD

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出HyLo方法,通过架构适应与高效Transformer块结合,提升长上下文能力,实现上下文长度扩展32倍,内存消耗降低90%,在混合架构中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏