arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-13 至 2026-05-13 共收录 161 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 52 篇

2605.12156 2026-05-13 cs.CL cs.SI 57%

Latent Causal Void: Explicit Missing-Context Reconstruction for Misinformation Detection

潜在因果空洞:为虚假信息检测的显式缺失上下文重建

Hui Li, Zhongquan Jian, Jinsong Su, Junfeng Yao

机构 * School of Informatics, Xiamen University(厦门大学信息学院) School of Computer and Data Science, Minjiang University(闽江学院计算机与数据科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Latent Causal Void方法,通过显式重建缺失事实来提升虚假信息检测效果,实验表明在双语基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12105 2026-05-13 cs.AI 57%

Autonomy and Agency in Agentic AI: Architectural Tactics for Regulated Contexts

自主性与代理性在代理AI中的作用:受监管环境中的架构策略

Damir Safin, Dian Balta

机构 * fortiss GmbH(fortiss公司) Research Institute of the Free State of Bavaria for software-intensive systems(巴伐利亚自由州软件密集系统研究机构)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一个二维设计空间,通过六个架构策略和五个部署参数,为受监管环境中的代理AI设计提供原则性指导,强调责任、可审计性和可逆性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12022 2026-05-13 cs.CL 57%

SAGE: Scalable Automated Robustness Augmentation for LLM Knowledge Evaluation

SAGE:可扩展的自动鲁棒性增强用于LLM知识评估

Xiaoyuan Li, Yuzhe Wang, Moxin Li, Keqin Bao, Rui Men, Yichang Zhang, Dayiheng Liu, Wenjie Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 SAGE通过细调小型模型构建大规模鲁棒性增强的知识评估基准,成本显著低于人工标注的HellaSwag-Pro,且细调模型可泛化至MMLU。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08151 2026-05-13 cs.DC cs.AI 57%

SPECTRE: Hybrid Ordinary-Parallel Speculative Serving for Resource-Efficient LLM Inference

SPECTRE:混合普通-并行推测服务用于资源高效的LLM推理

Jincheng Xie, Yawen Ling, Qi Xiao, Feiyu Zhang, Zhongyi Huang, Wen Hu, Yu Zheng

机构 * Tsinghua University(清华大学) AI Infra Team at JDT(AI基础设施团队) JD iCity, JD Technology, JD Intelligent Cities Research(京东i城、京东科技、京东智能城市研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SPECTRE通过利用未充分利用的尾部模型服务作为远程草稿生成器,提升大型模型推理效率,采用混合策略、推测优先调度和草稿压缩技术,实现并行处理,提升吞吐量并减少干扰。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13841 2026-05-13 cs.CL 57%

The Challenge and Reward of Fair Play in Narrative: A Computational Approach

叙事中的公平游戏挑战与回报:一种计算方法

Eitan Wagner, Renana Keydar, Omri Abend

机构 * Department of Computer Science Hebrew University of Jerusalem(计算机科学系 Hebrew University of Jerusalem) Department of Law and Digital Humanities Hebrew University of Jerusalem(法律与数字人文系 Hebrew University of Jerusalem)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过信息论框架分析叙事中的意外与连贯性,提出公平游戏平衡机制,利用大语言模型验证理论,发现惊喜与连贯性不正相关,且文学作品中克里斯蒂的叙事更符合公平游戏标准。

Comments 47 pages, 11 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11813 2026-05-13 cs.AI 57%

Automated Reformulation of Robust Optimization via Memory-Augmented Large Language Models

通过记忆增强的大语言模型实现鲁棒优化的自动化重述

Jinbiao Chen, Shuang Jin, Guoyun Zhang, Junyu Zhang, Guanyi Wang, Hanzhang Qin

机构 * Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) Institute of Operations Research and Analytics, National University of Singapore(新加坡国立大学运筹与分析研究所) Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AutoREM框架,通过记忆增强提升鲁棒优化重述的准确性和效率,无需领域知识或参数更新,适用于不同基础大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11663 2026-05-13 cs.CL 57%

Human-Grounded Multimodal Benchmark with 900K-Scale Aggregated Student Response Distributions from Japan's National Assessment of Academic Ability

具有90万规模日本全国学业能力评估学生响应分布的多模态基准

Kyosuke Takami, Yuka Tateisi, Satoshi Sekine, Yusuke Miyao

机构 * Osaka Kyoiku University(大阪教养大学) University of Tokyo(东京大学) NII LLMC(日本国家信息与通信技术研究所大语言模型中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一个基于日本全国学业能力评估的多模态数据集,包含真实考试布局、图表和教育文本,用于评估多模态大语言模型的性能,通过精确匹配准确率和字符级F1分数分析不同学科间的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11269 2026-05-13 gr-qc astro-ph.HE astro-ph.IM cs.AI 57%

gwBenchmarks: Stress-Testing LLM Agents on High-Precision Gravitational Wave Astronomy

gwBenchmarks: 对高精度引力波天文学中LLM代理的应力测试

Tousif Islam, Digvijay Wadekar, Zihan Zhou

机构 * Kavli Institute for Theoretical Physics, University of California Santa Barbara, Kohn Hall, Lagoon Rd, Santa Barbara, CA 93106(加州大学圣芭芭拉分校凯弗利理论物理研究所) Center for Gravitational Physics, University of Texas at Austin, Austin, TX 78712, USA(德克萨斯大学奥斯汀分校引力物理中心) Department of Physics, Princeton University, Princeton, NJ 08540, USA(普林斯顿大学物理系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了最先进的LLM编码代理能否完成端到端的科学建模任务,通过八个任务测试其精度和物理系统推理能力,发现代理在复杂任务上表现不佳,无法达到领域要求。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11255 2026-05-13 cs.CL 57%

HEBATRON: A Hebrew-Specialized Open-Weight Mixture-of-Experts Language Model

HEBATRON:一种 Hebrew 专用的开放权重混合专家语言模型

Noam Kayzer, Dan Revital, Ori Bar Joseph, Smadar Arvatz, Or Levi, Tal Geva, Shaltiel Shmidman, Amir DN Cohen, Noam Ordan, Omer Baruch, Kate Zinkovskaia, Zevi Apini, Sarel Weinberger

机构 * PwC(普华永道)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 HEBATRON基于NVIDIA Nemotron-3架构,通过三阶段课程学习提升性能,实现Hebrew推理准确率73.8%,并在长上下文支持下达到9倍推理吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11224 2026-05-13 cs.CV cs.AI 57%

ABRA: Agent Benchmark for Radiology Applications

ABRA:放射学应用代理基准测试

Bulat Maksudov, Vladislav Kurenkov, Kathleen M. Curran, Alessandra Mileo

机构 * School of Computing(计算学院) Dublin City University(都柏林城市大学) School of Medicine(医学院) University College Dublin(都柏林大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 ABRA是一个放射学代理基准测试,通过21个功能调用工具操作OHIF查看器和Orthanc DICOM服务器,包含655个生成任务,评估代理在规划、执行和结果方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11188 2026-05-13 cs.CR cs.AI cs.ET 57%

Adversarial SQL Injection Generation with LLM-Based Architectures

基于LLM架构的对抗性SQL注入生成

Ali Karakoc, H. Birkan Yilmaz

机构 * Department of Computer Engineering, NETLAB(计算机工程系,NETLAB)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出RADAGAS和RefleXQLi两种LLM-based系统,评估其在10个WAF和MySQL验证器上的对抗性SQL注入生成性能,发现RADAGAS-GPT4o在绕过WAFs方面表现优异。

Comments 32 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10865 2026-05-13 cs.AI cs.CV cs.SE 57%

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD

BenchCAD: 一个全面的、行业标准的程序化CAD基准测试

Haozhe Zhang, Kaichen Liu, Miaomiao Chen, Lei Li, Shaojie Yang, Cheng Peng, Hanjie Chen

机构 * University of Virginia(弗吉尼亚大学) University of California, San Diego(加州大学圣地亚哥分校) Rice University(莱斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 BenchCAD通过视觉问答、代码问答、图像到代码生成和指令引导的代码编辑评估模型,发现当前系统在生成精确参数化CAD程序方面存在不足,需进一步改进工业应用能力。

Comments 9 page 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10357 2026-05-13 cs.MM cs.AI 57%

RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild

RW-Post: 实时可审计的多模态事实核查证据基础

Danni Xu, Shaojing Fan, Harry Cheng, Mohan Kankanhalli

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RW-Post提出一个可审计的多模态事实核查基准,通过人机协同提取和审计流程,链接社交媒体帖子与推理轨迹及证据项,评估不同场景下的视觉 grounding 和证据利用能力。

Comments This submission was made in error. It was intended to replace the existing submission arXiv:2512.22933 rather than create a new submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05752 2026-05-13 cs.CL cs.SE 57%

AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor

AutoMonitor-Bench:评估基于LLM的误行监控可靠性

Shu Yang, Jingyu Hu, Tong Li, Hanqi Yan, Wenxuan Wang, Di Wang

机构 * King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 科学与技术大学) University of Bristol(布里斯托大学) Washington University in St. Louis(圣路易斯华盛顿大学) King’s College London(伦敦国王学院) Renmin University of China(中国人民大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出AutoMonitor-Bench,首个系统评估LLM误行监控可靠性的基准,包含3010个标注样本,通过MR和FAR指标评估12个模型,揭示监控性能的差异及安全与效用的权衡。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12252 2026-05-13 cs.CV 50%

H3D-MarNet: Wavelet-Guided Dual-Path Learning for Metal Artifact Suppression and CT Modality Transformation for Radiotherapy Workflows

H3D-MarNet:基于小波引导的双路径学习用于金属伪影抑制和CT模态转换用于放疗工作流程

Mubashara Rehman, Niki Martinel, Michele Avanzo, Riccardo Spizzo, Christian Micheloni

机构 * Machine Learning and Perception Lab, Università degli Studi di Udine(机器学习与感知实验室,乌迪内大学) Centro di Riferimento Oncologico di Aviano IRCCS(阿维亚诺肿瘤参考中心)

专题命中 推理评测 :planning(abstract)

AI总结 H3D-MarNet通过小波引导的双路径学习有效抑制金属伪影并实现CT模态转换,提升放疗图像质量与诊断准确性。

Comments Accepted for publication at the 28th International Conference on Pattern Recognition, Lyon, France August, 17-22, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12237 2026-05-13 cs.CV 50%

UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs

UHR-Micro: 诊断和缓解地球观测VLMs中的分辨率错觉

Shuo Ni, Tong Wang, Jing Zhang, He Chen, Haonan Guo, Ning Zhang, Bo Du

机构 * National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing(国家空间智能信息处理科技重点实验室) Beijing Institute of Technology(北京理工大学) School of Computer Science(计算机学院) Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(测绘遥感信息工程国家重点实验室) Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 UHR-Micro通过11253条指令和1212张超高清图像,评估VLM在高分辨率地球观测图像中的空间极限表现,揭示高分辨率输入下空间定位和证据解析的失败,并提出MAP代理以证据为中心提升微尺度感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11960 2026-05-13 cs.CV 50%

Chronicles-OCR: A Cross-Temporal Perception Benchmark for the Evolutionary Trajectory of Chinese Characters

Chronicles-OCR: 中国文字演变轨迹的跨时代感知基准

Gengluo Li, Shangpin Peng, Xingyu Wan, Chengquan Zhang, Hao Feng, Xin Xu, Pian Wu, Bang Li, Zengmao Ding, Yongge Liu, Yipei Ye, Yang Yang, Zhan Shu, Guojun Yan, Zhe Li, Can Ma, Weiping Wang, Yu Zhou, Han Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) Tencent(腾讯) Anyang Normal University(安阳师范学院) The Palace Museum(故宫博物院) Nankai University(南开大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 Chronicles-OCR通过跨时代视觉感知任务评估VLLMs在汉字演变中的鲁棒性,包含2800张平衡图像和四个量化任务,推动历史文本感知研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04056 2026-05-13 cs.CR 50%

QuiLL: An LLM-Based Vulnerability Assessment Framework for the Wild

QuiLL:一种基于LLM的漏洞评估框架

Rijha Safdar, Danyail Mateen, Syed Taha Ali, Wajahat Hussain

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出QuiLL,首个针对真实世界漏洞检测的综合评估框架,通过端到端流程结合先进LLM优化技术,提供动态上下文学习和新颖评分指标,用于系统评估不同LLM的漏洞检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11680 2026-05-13 cs.CV 50%

ShapeCodeBench: A Renewable Benchmark for Perception-to-Program Reconstruction of Synthetic Shape Scenes

ShapeCodeBench:一种可再生的基准,用于合成形状场景的感知到程序重建

Shivam Kumar

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract)

AI总结 ShapeCodeBench是一个合成基准,用于测试从渲染图像生成可执行程序的能力。该基准包含不同难度层级的样本,评估了多种模型在精确匹配、像素精度和执行成功率上的表现。

Comments 14 pages, 5 figures, 2 tables. Code, data, and artifacts: https://github.com/shivamk3r/shape-code-bench ; archival release: https://doi.org/10.5281/zenodo.20132286

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11268 2026-05-13 cs.CR 50%

Context-Aware Spear Phishing: Generative AI-Enabled Attacks Against Individuals via Public Social Media Data

具有上下文意识的钓鱼攻击:通过公共社交媒体数据利用生成式AI对个人进行攻击

Elham Pourabbas Vafa, Sayak Saha Roy, Shirin Nilizadeh

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本文研究了如何利用公开社交媒体数据和生成式AI自动化并扩大针对个人的个性化、上下文感知的钓鱼攻击。通过模块化框架结合多模态信号提取、沟通风格分析和攻击类型实例化,展示了七种攻击策略,并通过大规模多模型评估验证了生成式AI邮件在个性化、上下文相关性和说服力方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09904 2026-05-13 cs.CV 50%

TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models

TOC-Bench:一个用于视频大语言模型的时序物体一致性基准

Junzhe Chen, Siyuan Meng, Yuxi Chen, Man Zhao, Wenyao Gui, Xiaojie Guo

机构 * Tianjin University(天津大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 TOC-Bench旨在评估视频大语言模型的时序物体一致性,通过设计三层时序必要性过滤协议,筛选出17900个时间依赖项,构建了包含2323个高质量问答对的基准,揭示了模型在事件计数、事件排序等任务上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 20 篇

2502.01941 2026-05-13 cs.CL cs.AI 88%

Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression

语义完整性至关重要:在KV缓存压缩中基准测试与保持高密度推理

Xiang Liu, Zhenheng Tang, Hong Chen, Peijie Dong, Zeyu Li, Xiuze Zhou, Bo Li, Xuming Hu, Xiaowen Chu

机构 * The Hong Kong University of Science(香港科学与技术大学) Guangzhou HKUST Fok Ying Tung Research Institute(广州HKUST傅种群研究院)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KVFundaBench基准测试,揭示了在高密度推理中压缩导致的严重任务依赖性退化问题,并提出ShotKV方法,通过分离prefill和解码阶段以优先保持语义完整性,提升了长上下文生成任务的准确率并降低了延迟。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05922 2026-05-13 cs.CV 87%

Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling

思考,然后评分:视频奖励建模中的解耦推理与评分

Yuan Wang, Ouxiang Li, Yulong Xu, Borui Liao, Jiajun Liang, Jinghan Li, Meng Wang, Xintao Wang, Pengfei Wan, Kuien Liu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出DeScore模型,通过解耦推理与评分机制提升视频奖励建模的泛化能力,结合冷启动和强化学习优化,实现更稳定的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12466 2026-05-13 cs.LG cs.AI cs.CL cs.NE 82%

Solve the Loop: Attractor Models for Language and Reasoning

循环求解:语言和推理的吸引子模型

Jacob Fein-Ashley, Paria Rashidinejad

机构 * University of Southern California(南加州大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出吸引子模型,通过固定点求解实现循环优化,提升语言模型和推理性能,在大规模预训练和小模型推理中均优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02408 2026-05-13 cs.CV cs.AI 79%

ReasonEdit: Editing Vision-Language Models using Human Reasoning

ReasonEdit:通过人类推理编辑视觉语言模型

Jiaxing Qiu, Kaihua Hou, Roxana Daneshjou, Ahmed Alaa, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ReasonEdit通过引入人类推理机制,改进视觉语言模型的编辑能力,提升编辑泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11931 2026-05-13 cs.CV 78%

Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training

学会思考:通过视觉感知的自我改进训练提升多模态推理

Qihuang Zhong, Liang Ding, Wenjie Xuan, Juhua Liu, Bo Du, Dacheng Tao

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence(计算机学院、多媒体软件国家工程研究中心、人工智能研究院) Hubei Key Laboratory of Multimedia(湖北多媒体重点实验室) Network Communication Engineering, Wuhan University, China(网络通信工程、武汉大学,中国) The University of Sydney, Australia(悉尼大学,澳大利亚) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出VISTA框架,通过视觉感知的自我改进训练提升多模态推理能力,解决数据不平衡和语言先验偏差问题,实验显示在多种训练场景下提升性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11522 2026-05-13 cs.DC 78%

State Twins: An Off-Chain Substrate for Agentic Reasoning over Decentralized Finance Protocols

状态双生:一种链下子层,用于在去中心化金融协议上进行代理推理

Ian C. Moore

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出State Twin,一种链下子层,用于在去中心化金融协议上进行代理推理。通过将AMM池建模为离散时间受控动态系统,提供精确数学模型和操作扩展能力,实现快速回放和反事实模拟。

Comments 14 pages, 1 table, 7 listings; reference implementation at https://github.com/defipy-devs/defipy

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09769 2026-05-13 cs.AI 74%

UTS at PsyDefDetect: Multi-Agent Councils and Absence-Based Reasoning for Defense Mechanism Classification

在PsyDefDetect上使用UTS:多智能体委员会与基于缺席的推理用于防御机制分类

Dima Galat, Marian-Andrei Rizoiu

机构 * University of Technology Sydney(技术大学悉尼)

专题命中 其他推理 :reasoning(title);分类 cs.AI

AI总结 本文提出利用DMRS对情感支持对话中的防御机制进行分类,通过多阶段 deliberative 委员会架构,采用特定类别的倡导者评估证据强度,实现F1 0.382的高精度,同时通过针对性的重写集提升F1至0.410。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12460 2026-05-13 cs.LG cs.CL 62%

Multi-Stream LLMs: Unblocking Language Models with Parallel Streams of Thoughts, Inputs and Outputs

多流语言模型:通过并行思维、输入和输出流解除语言模型瓶颈

Guinan Su, Yanwu Yang, Xueyan Li, Jonas Geiping

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心) ETH Zurich(苏黎世联邦理工学院) University Hospital Tübingen(图宾根大学医院) University of Tübingen(图宾根大学) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过并行计算流替代顺序消息格式,提升语言模型的效率、安全性和可监控性,解决单流计算的局限性。

Comments Preprint, 37 pages. Code at https://github.com/seal-rg/streaming/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12419 2026-05-13 cs.CL cs.IR cs.LG 62%

ORBIT: Preserving Foundational Language Capabilities in GenRetrieval via Origin-Regulated Merging

ORBIT:通过起源调节合并在生成检索中保留基础语言能力

Neha Verma, Nikhil Mehta, Shao-Chuan Wang, Naijing Zhang, Alicia Tsai, Li Wei, Lukasz Heldt, Lichan Hong, Ed Chi, Xinyang Yi

机构 * Johns Hopkins University(约翰霍普金斯大学) Google DeepMind(谷歌DeepMind) Google(谷歌)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 ORBIT通过跟踪模型权重距离并使用加权平均策略,在生成检索微调中减少模型漂移,有效保留语言基础能力。

详情

展开后加载摘要…

URL PDF HTML 收藏