arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-26 至 2026-05-26 共收录 267 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 23 篇

2603.08011 2026-05-26 cs.CV 78%

It's Time to Get It Right: Improving Analog Clock Reading and Clock-Hand Spatial Reasoning in Vision-Language Models

是时候正确了:提升视觉语言模型中的模拟时钟读取和指针空间推理能力

Jaeha Choi, Jin Won Lee, Siwoo You, Jangho Lee

机构 * Incheon National University(延世国立大学) McGill University(麦吉尔大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对视觉语言模型在真实环境中读取模拟时钟的挑战,提出TickTockVQA数据集和Swap-DPO微调框架,显著提升时钟读取准确性和鲁棒性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21740 2026-05-26 cs.AI 77%

SMDD-Bench: Can LLMs Solve Real-World Small Molecule Drug Design Tasks?

SMDD-Bench: 大语言模型能否解决真实世界的小分子药物设计任务?

Kevin Han, Renfei Zhang, Kathy Wei, Hamed Mahdavi, Niloofar Mireshghallah, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学) Stealth Pennsylvania State University(隐形宾夕法尼亚州立大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出SMDD-Bench基准,通过502个多轮长时任务实例评估LLM在真实小分子药物设计中的表现,发现最优模型GPT5.4仅解决40.2%任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18746 2026-05-26 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop

ESI-Bench: 迈向闭环感知-动作的具身空间智能

Yining Hong, Jiageng Liu, Han Yin, Manling Li, Leonidas Guibas, Li Fei-Fei, Jiajun Wu, Yejin Choi

机构 * Stanford University(斯坦福大学) UCLA(加州大学洛杉矶分校) Northwestern University(西北大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ESI-BENCH基准,通过主动探索(感知、移动、操作)在OmniGibson环境中评估具身空间智能,发现主动探索显著优于被动方法,失败主因是动作盲视而非感知弱,且模型存在元认知差距。

Comments https://esi-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03191 2026-05-26 cs.CV cs.AI cs.LG 62%

AnatomiX, an Anatomy-Aware Grounded Multimodal Large Language Model for Chest X-Ray Interpretation

AnatomiX:一种解剖学感知的胸部X光解读多模态大语言模型

Anees Ur Rehman Hashmi, Numan Saeed, Christoph Lippert

机构 * Hasso Plattner Institute(霍普夫纳研究所) MBZUAI(穆萨大学人工智能研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出AnatomiX,一种两阶段解剖学感知多模态大语言模型,通过先识别解剖结构再执行下游任务,在解剖定位、短语定位、定位诊断和定位描述任务上相比现有方法提升超过25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25447 2026-05-26 cs.CL 57%

GeoSVG-RL: Geometry-Aware Reinforcement Learning for Layout-Constrained Text-to-SVG Diagram Generation

GeoSVG-RL:面向布局约束的文本到SVG图表生成的几何感知强化学习

Sifan Li, Yujun Cai, Hongkai Chen, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) The University of Queensland(昆士兰大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

专题命中 视觉空间推理 :verifier(abstract);分类 cs.CL

AI总结 提出GeoSVG-RL框架,通过强化学习优化策略,利用几何反馈奖励(渲染有效性、画布适配、锚点放置、文本包含、图一致性和代码整洁性)解决文本到SVG图表生成中的结构脆弱性问题,显著提升箭头锚点精度和文本框内率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23764 2026-05-26 cs.CV cs.CL 57%

MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence

MMSI-Bench:多图像空间智能基准

Sihan Yang, Runsen Xu, Yiman Xie, Sizhe Yang, Mo Li, Jingli Lin, Chenming Zhu, Xiaochen Chen, Haodong Duan, Xiangyu Yue, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Shanghai Jiaotong University(上海交通大学) University of Hong Kong(香港大学) Beijing Normal University(北京师范大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 提出MMSI-Bench基准,通过1000道精心设计的VQA问题评估多图像空间推理能力,发现现有模型准确率远低于人类。

Comments ICLR 2026 Camera ready. 38 pages. Project page: https://runsenxu.com/projects/MMSI_Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25784 2026-05-26 cs.CV cs.MM 50%

VertiCue-Bench: Diagnosing Whether MLLMs Use Height Cues to Resolve 2D Ambiguity in Remote Sensing Natural Scenes

VertiCue-Bench: 诊断多模态大语言模型是否利用高度线索解决遥感自然场景中的二维歧义

Jing Huang, Duanchu Wang, Junjie Yang, Zihang Cheng, Cheng Li, Lin Cui, Zhouyi Wu, Di Wang

机构 * Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出VertiCue-Bench基准,通过17个任务1534个实例诊断MLLMs是否真正利用冠层高度模型(CHM)的垂直线索解决遥感自然场景中的语义歧义,发现模型在感知高度线索与语义推理之间存在显著脱节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25423 2026-05-26 cs.RO 50%

OPAL: Omnidirectional Path-efficient Aerial 3D expLoration

OPAL: 全方位路径高效空中三维探索

Yoga Satwik Chappidi, Avideh Zakhor

机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系)

专题命中 视觉空间推理 :planning(abstract)

AI总结 提出OPAL框架,通过在歧义分支点进行360度偏航旋转替代计算密集的全局路径规划,实现计算简单、路径短且覆盖率高的自主探索。

Comments Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25326 2026-05-26 cs.CV 50%

Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation

感知-然后-规划:以布局为策略的单目3D场景布局估计

Junwei Zhou, Yu-Wing Tai

机构 * Department of Computer Science(计算机科学系) Dartmouth College(达特茅斯学院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 提出Perceive-then-Plan框架,通过视觉语言模型将单目3D布局估计转化为感知与迭代规划问题,以布局为策略(LaP)学习动作序列逐步优化场景假设,生成更物理一致且与观测对齐的3D布局。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24761 2026-05-26 cs.CV cs.RO 50%

Drift-Resistant Navigation World Model with Anchored Epipolar Guidance

抗漂移导航世界模型与锚定对极引导

Po-Chien Luan, Zimin Xia, Wuyang Li, Yang Gao, Alexandre Alahi

机构 * EPFL(瑞士联邦理工学院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 提出一种抗漂移导航世界模型,通过锚定引导滚动和双向对极几何约束,同时减轻感知漂移和几何漂移,提升长期视觉质量、几何一致性和多视图连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24287 2026-05-26 cs.SI 50%

Humans Cannot Detect AI-Generated Media But Communities May -- For Now: Collaborative AI Detection in r/RealOrAI on Reddit

人类无法检测AI生成的媒体,但社区可能可以——目前:Reddit上r/RealOrAI中的协作AI检测

Tuğrulcan Elmas

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 通过分析Reddit社区r/RealOrAI一年的活动,研究人类协作检测AI生成媒体的行为,发现社区检测准确率达72%但存在系统性假阳性偏差,且感知特征主导推理,而来源验证虽少但通过聚合被放大4.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02839 2026-05-26 cs.RO 50%

Language Movement Primitives: Grounding Language Models in Robot Motion

语言运动基元:将语言模型锚定在机器人运动中

Yinlong Dai, Benjamin A. Christie, Daniel J. Evans, Dylan P. Losey, Simon Stepputtis

机构 * Collab , Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, VA 24061(合作组,机械工程系,弗吉尼亚理工学院,黑斯堡,VA 24061) TEA Lab , Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, VA 24061(TEA实验室,机械工程系,弗吉尼亚理工学院,黑斯堡,VA 24061)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出语言运动基元(LMP)框架,通过将视觉语言模型(VLM)推理与动态运动基元(DMP)参数化结合,实现零样本机器人操作任务。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 15 篇

2510.26418 2026-05-26 cs.AI 85%

Chain-of-Thought Hijacking

思维链劫持

Jianli Zhao, Tingchen Fu, Rylan Schaeffer, Mrinank Sharma, Fazl Barez

机构 * Independent(独立) University of Oxford(牛津大学) Stanford University(斯坦福大学) Anthropic Martian Core

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 提出思维链劫持攻击,通过诱导大型推理模型进行长时间良性推理来削弱其拒绝有害请求的能力,实现高成功率越狱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12576 2026-05-26 cs.CL cs.AI 84%

Coupled Variational Reinforcement Learning for Language Model General Reasoning

耦合变分强化学习用于语言模型通用推理

Xueru Wen, Jie Lou, Yanjiang Liu, Hongyu Lin, Ben He, Xianpei Han, Le Sun, Yaojie Lu, Debing Zhang

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出CoVRL方法,通过混合采样策略耦合先验和后验分布,将变分推理与强化学习结合,以解决无验证器强化学习中探索效率低和推理轨迹与答案不一致的问题,在数学和通用推理基准上提升性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25133 2026-05-26 cs.AI cs.CL 81%

Trust but Verify: Prover-Verifier Deliberation for Selective LLM Prediction

信任但验证:面向选择性LLM预测的证明者-验证者审议

João Sedoc, Baotong Zhang, Dean Foster

机构 * New York University(纽约大学)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL、cs.AI

AI总结 提出基于交互式证明理论的证明者-验证者审议协议,通过结构化置信度判定实现选择性预测,在GPQA Diamond上取得约30个百分点的高置信度精确率差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24989 2026-05-26 cs.LG cs.AI cs.IR 81%

Selective Test-Time Compute Scaling for Click-Through Rate Prediction via Uncertainty-Triggered Feature Path Exploration

基于不确定性触发的特征路径探索的点击率预测选择性测试时计算扩展

Moyu Zhang, Yun Chen, Yujun Jin, Jinxin Hu, Yu Zhang, Xiaoyi Zeng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.AI、cs.LG

AI总结 针对点击率预测中训练数据稀疏导致的不确定性,提出无需训练、模型无关的UTTSI框架,通过双信号估计器区分认知不确定性和偶然模糊性,对不确定实例进行自适应特征过滤和随机特征路径探索,在保持最坏延迟不变的情况下实现平均约2.8倍基础模型开销,实验和在线A/B测试均取得显著提升。

Comments 12 pages, 4 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24998 2026-05-26 cs.CL 79%

Better, Faster: Harnessing Self-Improvement in Large Reasoning Models

更好、更快:利用大型推理模型的自我改进

Qihuang Zhong, Liang Ding, Juhua Liu, Bo Du, Leszek Rutkowski, Dacheng Tao

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Alibaba Group, China(中国阿里巴巴集团) School of Computer Science, Wuhan University, China(武汉大学计算机学院) AGH University of Science and Technology, Poland(波兰AGH科学与技术大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 针对自我改进训练中数据不平衡和过度思考问题,提出HSIR方法,通过验证后退出采样和内在多样性评分提升推理性能与效率。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11657 2026-05-26 cs.CL 77%

Scaling Natural-Language Graph-Based Test Time Compute for Automated Theorem Proving

扩展基于自然语言图结构的测试时计算用于自动定理证明

Vincent Li, Tim Knappe, Yule Fu, Kevin Han, Kevin Zhu

机构 * Boston University Provadis School of International Management \& Technology Duke University Algoverse AI Research

专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);test-time compute(abstract);分类 cs.CL

AI总结 提出KG-prover框架,利用从权威数学文本挖掘的知识图谱增强通用大语言模型,通过扩展图结构的测试时计算显著提升自动定理证明性能。

Comments Accepted to ICML AI4Math Workshop 2025, NAACL SRW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24447 2026-05-26 cs.SE 67%

Beyond AI Delegation: A Prompt Pattern Framework for Productive Struggle and Evaluative Judgement in Secure Coding Education

超越AI委托:安全编码教育中生产性挣扎与评价性判断的提示模式框架

Philipp Haindl, Oliver Eigner, Peter Kieseberg

专题命中 测试时计算 :reasoning(abstract);verifier(abstract)

AI总结 本文通过设计科学研究,从计算机科学文献中综合并调整了九种提示工程模式,映射到生产性挣扎和评价性判断两个教学构念,为安全编码课程设计了一个框架,使教师能够精细控制学生与AI的互动,保留学生的推理角色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18797 2026-05-26 cs.LG cs.AI 62%

Simply Stabilizing the Loop via Fully Looped Transformer

通过全循环Transformer简单稳定循环

Rao Fu, Zixuan Yang, Jiankun Zhang, Jing Ma, Hechang Chen, Yu Li, Yi Chang

机构 * Hong Kong Baptist University(香港 Baptist 大学) Jilin University(吉林大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 针对循环Transformer在迭代次数增加时出现的训练不稳定性,提出全循环Transformer,通过全循环架构和注意力注入两种无参数修改,稳定训练至12次循环,下游任务性能提升最高13.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05688 2026-05-26 cs.LG cs.AI 62%

vAttention: Verified Sparse Attention

vAttention: 验证的稀疏注意力

Aditya Desai, Kumar Krishna Agrawal, Shuo Yang, Alejandro Cuadron, Luis Gaspar Schroeder, Matei Zaharia, Joseph E. Gonzalez, Ion Stoica

机构 * Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出vAttention,通过统一top-k和随机采样,实现首个具有用户指定(ε, δ)近似精度保证的实用稀疏注意力机制,显著提升质量-效率权衡。

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24564 2026-05-26 cs.AI cs.CE cs.LG 62%

Summoning the Oracle to Slay It: Mitigating Look-Ahead Bias in Financial Backtesting with Large Language Models

召唤神谕以屠之:利用大语言模型缓解金融回测中的前瞻偏差

Weixian Waylon Li, Mengyu Wang, Tiejun Ma

机构 * University of Edinburgh(爱丁堡大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出FinCAD方法,通过对抗性偏差发现和实体日期自适应规则,在不重新训练的情况下抑制大语言模型对历史结果的记忆,从而缓解金融回测中的参数化前瞻偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24517 2026-05-26 cs.LG cs.CL 62%

ECHO: Terminal Agents Learn World Models for Free

ECHO: 终端代理免费学习世界模型

Vaishnavi Shrivastava, Piero Kauffmann, Ahmed Awadallah, Dimitris Papailiopoulos

机构 * Microsoft Research(微软研究院)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 提出ECHO混合目标,通过预测环境观测令牌将终端反馈转化为密集监督信号,显著提升CLI代理在TerminalBench-2.0上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23954 2026-05-26 cs.CL cs.AI cs.SD 62%

EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs

EchoDistill:面向鲁棒音频大语言模型的噪声到干净自蒸馏对齐

Liang Lin, Chunxi Luo, Kaiwen Luo, Jie Zhang, Jin Wang, Yuanhe Zhang, Cai Yuchen, Qiankun Li, Gongli Xi, Zhenhong Zhou, Kun Wang, Junhao Dong

机构 * NTU(国立台湾大学) SHU(上海大学) ICT, CAS(中国科学院信息科技研究院) HDU(华中科技大学) BUPT(北京邮电大学) USTC(中国科学技术大学) SKL-NST, BUPT(北京邮电大学国家智能计算研究中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出EchoDistill框架,通过冻结的干净音频教师模型指导噪声学生模型进行组相对策略优化,实现噪声到干净的自蒸馏对齐,提升音频大语言模型在复杂噪声下的语义可靠性和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26106 2026-05-26 cs.LG 57%

Looped Diffusion Language Models

循环扩散语言模型

Sanghyun Lee, Chunsan Hong, Seungryong Kim, Jonghyun Lee, Jongho Park, Dongmin Park

机构 * KAIST(韩国科学技术院) KRAFTON(KRAFTON公司) University of California, Berkeley(加州大学伯克利分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 提出LoopMDM,通过选择性循环早期-中间Transformer层,在训练时实现深度缩放效果而不增加参数,在推理时通过调整循环次数灵活扩展计算量,从而提升掩码扩散模型的训练效率和性能。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25988 2026-05-26 cs.CL 57%

What Makes a Medical Checker Trainable? Diagnosing Signal Collapse and Reward Hacking in Checker-Guided RAG for Biomedical QA

什么使医学检查器可训练?诊断生物医学问答中检查器引导的RAG中的信号崩溃和奖励黑客

Yuelyu Ji, Min Gu Kwak, Hang Zhang, Xizhi Wu, Chenyu Li, Yanshan Wan

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 本文通过比较四种NLI检查器作为GRPO训练的医学RAG代理的过程奖励,诊断了信号崩溃和奖励黑客现象,发现检查器的输出分布而非保留准确率决定了其是否提供可训练梯度,并提出了验证器作为奖励系统的边界条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25244 2026-05-26 cs.CL 57%

Inference Time Optimization with Confidence Dynamics

基于置信度动态的推理时优化

Yu Wang, Minghao Liu, Jiayun Wang, Jinrui Huang, Ankit Shah, Wei Wei

机构 * Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文通过观察推理轨迹中置信度的动态变化,发现正确轨迹置信度上升而错误轨迹下降,据此提出置信度动态增益投票方法,显著提升大语言模型推理性能。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 24 篇

2605.25958 2026-05-26 cs.CL cs.CE 87%

PolyGnosis 2.0: Enhancing LLM Reasoning via Agentic Harness Engineering for Polymarket and OSINT Insight Extraction

PolyGnosis 2.0: 通过智能体工程增强LLM推理,用于Polymarket和OSINT洞察提取

Daren Wang, Hong Xu, Jiawen Xian

机构 * The Chinese University of Hong Kong(香港中文大学) Evolution AI Lab(进化人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出PolyGnosis 2.0多智能体架构,通过融合Polymarket异常信号与全球开源情报(GDELT)来提取预测情报,并量化“视角错配”作为高阿尔法交易信号,同时评估“工具工程”技术(如反射循环、工具调用、分治和思维链)在高噪声金融领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23395 2026-05-26 cs.LG 79%

Convex Compositional Reasoning Models

凸组合推理模型

Meir Roketlishvili, Semyon Semenov, Maksim Bobrin, Viktor Kovalchuk, Albert Baichorov, Abduragim Shtanchaev, Fakhri Karray, Dmitry V. Dylov, Martin Takáč, Arip Asadulaev

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Applied AI Institute(应用人工智能研究所) Computational Imaging Lab(计算成像实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 针对组合推理中能量景观的非凸几何瓶颈,提出凸组合能量最小化框架,通过输入凸神经网络参数化因子并优化紧凸松弛,实现确定性投影一阶优化,在小问题上训练后可零样本迁移到大实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24050 2026-05-26 cs.LG 79%

Bridging On-Device and Cloud LLMs for Collaborative Reasoning: A Unified Methodology for Local Routing and Post-Training

桥接设备端与云端大语言模型实现协作推理:本地路由与后训练的统一方法

Wenzhi Fang, Dong-Jun Han, Liangqi Yuan, Evan Chen, Christopher Brinton

机构 * Purdue University(普渡大学) Yonsei University(延世大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 提出通过强化学习后训练使设备端LLM内部决定是否调用云端,结合分层奖励和自适应提示过滤,显著缩小与纯云端LLM的性能差距。

Comments We propose a unified post-training framework that integrates routing optimization, enabling the on-device LLM to improve its problem-solving ability while learning routing strategies

详情

展开后加载摘要…

URL PDF HTML 收藏