arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-10 至 2026-06-10 共收录 126 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 31 篇

2606.10064 2026-06-10 cs.LG cs.AI 新提交 62%

Bittensor Agent Arenas as a Trajectory Primitive: Distilling a Shopping Agent from ShoppingBench Subnet Traces

Bittensor 智能体竞技场作为轨迹基元:从 ShoppingBench 子网轨迹中蒸馏购物智能体

Shardul Bansal, Seth Schilbe, Jarrod Barnes

机构 * ORO AI Dynamical Systems(动力系统)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对小模型后训练缺乏多轮轨迹数据的问题,利用 Bittensor 子网 SN15 的竞技机制生成激励对齐的轨迹,通过结构质量过滤提取智能体轨迹,后训练 Qwen3-4B 模型在 ShoppingBench 上达到 42.7% ASR,接近合成数据基线。

Comments 10 pages, 4 figures, Data and Models available at: https://huggingface.co/collections/oro-ai/shoppingbench-sn15-trajectory-primitive

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09919 2026-06-10 cs.LG cs.AI cs.MA cs.RO 新提交 62%

Co-GLANCE: Uncertainty-Aware Active Perception for Heterogeneous Robot Teaming

Co-GLANCE: 异构机器人团队的不确定性感知主动感知

Michal P. Podolinsky, Neel P. Bhatt, Pranay Samineni, Rohan Siva, Christian Ellis, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出Co-GLANCE系统,通过蒸馏视觉语言模型实现实时遮挡分割与机器人分配,结合共形预测与选择性弃权提供统计保证的不确定性量化,驱动主动感知,在真实场景中遮挡分割和分配准确率分别提升25%和36%,推理延迟降低350倍。

Comments Code, videos, and dataset available at https://co-glance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10381 2026-06-10 hep-ex cs.AI cs.CL cs.IR physics.ins-det 新提交 62%

Agentic Hybrid RAG for Evidence-Grounded Muon Collider Analysis

基于证据的缪子对撞机分析的智能混合RAG

Ruobing Jiang, Dawei Fu, Cheng Jiang, Tianyi Yang, Zijian Wang, Youpeng Wu, Yong Ban, Yajun Mao, Qiang Li

机构 * Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出智能混合RAG框架,结合稀疏与稠密检索及智能推理,用于缪子对撞机研究的证据检索与答案生成,构建首个基准并验证其有效性。

Comments 22 pages, 5 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27914 2026-06-10 cs.CL cs.AI 版本更新 62%

Does Capability Transfer to Subjective Behavior -- and Would Our Instruments Tell Us? A Self-Evolving, Trust-by-Construction Evaluation Paradigm

让结果说话:LLM行为基准测试的复制优先范式

Yuming, Huang, Yao Liu, Pengjie Ding, Lei Wang, Junchen Wan

机构 * Cylingo team(Cylingo团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出复制优先范式,通过可靠性、跨仪器复制、历史足迹校准和预注册预测四个正交属性验证LLM行为评估工具,并在情感陪伴任务中测试,发现聚合分数掩盖的模型退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10738 2026-06-10 eess.AS cs.AI 新提交 57%

Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding

Spatial-Omni:通过FOA编码在多模态大语言模型中实现空间音频理解

Zhiyuan Zhu, Yixuan Chen, Yiwen Shao, Wenxiang Guo, Changhao Pan, Yu Zhang, Yuxiang Wang, Wei Liu, Houhua Zhang, Chengkuan Zeng, Wenbo Cheng, Yunxi Liu, Rui Yang, Steve Yves, Liefeng Bo, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出Spatial-Omni,通过SO-Encoder将一阶Ambisonics空间音频注入现有全模态大语言模型,以轻量方式实现空间音频理解,并在构建的SO-Bench基准上超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11150 2026-06-10 cs.AI cs.CY 新提交 57%

ABC-Bench: An Agentic Bio-Capabilities Benchmark for Biosecurity

ABC-Bench:生物安全的主体生物能力基准

Andrew Bo Liu, Samira Nedungadi, Bryce Cai, Alex Kleinman, Harmon Bhasin, Seth Donoughe

机构 * Andrew Bo Liu(安德鲁·刘) Samira Nedungadi(萨米拉·纳杜加迪) Bryce Cai(布莱斯·凯) Alex Kleinman(亚历克斯·克莱因曼) Harmon Bhasin(哈蒙·巴辛) Seth Donoughe(塞斯·多诺赫)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出ABC-Bench基准,评估LLM主体在生物安全相关任务上的能力,包括液体处理机器人编程、DNA片段设计和合成筛选规避,所有测试主体均优于人类专家基线。

Comments 18 pages. To be published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10949 2026-06-10 cs.AI 新提交 57%

Recalling Too Well: Sycophancy Evaluation and Mitigation in Memory-Augmented Models

回忆过好:记忆增强模型中的谄媚评估与缓解

Shelly Bensal, Axel Magnuson, Aparna Balagopalan, Daniel M. Bikel

机构 * Writer, Inc.(Writer公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究首次系统评估记忆增强模型中的谄媚现象,提出MIST基准测试,发现记忆会放大谄媚行为(最高25倍),并提出两种轻量级缓解方法。

Comments Under submission; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10833 2026-06-10 cs.AI 新提交 57%

Do VLMs Reason Like Engineers? A Benchmark and a Stage-wise Evaluation

视觉语言模型像工程师一样推理吗?一个基准测试与分阶段评估

Syed Wasiq, Syed Mohamad Tawseeq, Yashwant Pravinrao Bangde, Debaditya Roy

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡哈拉格普尔分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出工程视觉问答基准EngVQA和8阶段自动评估框架,揭示当前视觉语言模型在工程推理中的显著局限,并验证了自动化评估与人工评分的高度一致性。

Comments 9 pages (main text), 4 figures, 2 tables; 50 pages total including appendix. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10747 2026-06-10 cs.AI 新提交 57%

The Arbiter Agent: Continually Monitoring Multi-Agent Conversations to Detect Emergent Misalignment

仲裁者代理:持续监控多智能体对话以检测涌现性失调

Filippo Tonini, Federico Torrielli, Anton Danholt Lautrup, Peter Schneider-Kamp, Mustafa Mert Çelikok, Lukas Galke Poech

机构 * University of Southern Denmark(南丹麦大学) University of Turin(都灵大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出仲裁者代理,在有限检查预算下实时监控多智能体对话,通过主动检查工具检测失调行为,实验表明能可靠提前发现失调,并分析不同失调类型的检测难度。

Comments AITC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10400 2026-06-10 cs.CL cs.CV 新提交 57%

Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark

视觉语言模型是看见还是猜测?通过措辞控制基准衡量和减少文本先验依赖

Pratham Singla, Shivank Garg, Vihan Singh, Paras Chopra

机构 * Lossfunk Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) Raeth AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文构建了540张图像的基准,通过为同一图像生成四种措辞变体,衡量视觉语言模型对文本先验的依赖,发现所有模型在最难变体上性能下降,开放模型下降最严重,并通过无图像消融等分析证实了真正的图像依赖。

Comments 17 pages, 7 figures, Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10285 2026-06-10 cs.CL 新提交 57%

OpenRTLSet: A Fully Open-Source Dataset for Large Language Model-based Verilog Module Design

OpenRTLSet: 基于大语言模型的Verilog模块设计的完全开源数据集

Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

机构 * UIUC-ChenLab(UIUC-陈实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出最大完全开源硬件设计数据集OpenRTLSet,包含13万+多样Verilog代码样本,结合GitHub代码、VHDL和C/C++翻译,利用DeepSeek-R1生成自然语言描述,支持多种语言模型微调,证明开源方法在硬件设计中的优越性。

Comments Accepted by ICLAD'25

Journal ref 2025 IEEE International Conference on LLM-Aided Design (ICLAD), Stanford, CA, USA, 2025, pp. 212-218

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10208 2026-06-10 cs.RO cs.AI 新提交 57%

Exploration of Foundation Model-Based Robots in Patient and Elderly Care

基于基础模型的机器人在患者和老年人护理中的探索

Zhiwen Qiu, Wei Liu, Yuexing Hao

机构 * Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了基于基础模型的护理机器人在设计特征、用户体验和护理效果方面的现状,指出当前系统多用于语音交互,多模态和物理自主性有限,并呼吁向护理特定评估标准和负责任自主性发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09956 2026-06-10 cs.SE cs.LG 新提交 57%

Multi-task LLMs for Bug Classification: Efficient Inference with Auxiliary Decoding Heads

多任务大语言模型用于缺陷分类:基于辅助解码头的高效推理

Nikolai Rozanov

机构 * Recurse Ltd. Department of Computing, Imperial College London(帝国理工学院计算机系)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出一种轻量级多任务大语言模型(MLC),通过令牌对齐算法和优化训练策略,实现全文件上下文下的行级缺陷定位,性能与代理方法相当但推理延迟降低数个数量级。

Comments 8 pages, 6 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09908 2026-06-10 cs.CR cs.AI 新提交 57%

IDP-Bench: Benchmarking ability of LLMs to protect personal information in interdependent privacy contexts

IDP-Bench:评估大语言模型在相互依赖隐私上下文中保护个人信息能力的基准

Ayana Hussain, Soumya Sharma, Golnoosh Farnadi, Nicholas Vincent, Héber Hwang Arcolezi, Ulrich Aïvodji

机构 * Simon Fraser University(西蒙弗雷泽大学) McGill University(麦吉尔大学) Mila(Mila研究所) ÉTS

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出IDP-Bench,首个基于情境完整性框架的LLM相互依赖隐私基准,评估8个开源模型在三个推理层次上的表现,发现模型在识别CI参数和IDP特定参数方面存在弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08982 2026-06-10 cs.AI 版本更新 57%

Baichuan-M4: A Clinical-Grade Medical Agent System for Continuous Care

Baichuan-M4:面向持续照护的临床级医疗智能体系统

Aiyuan Yang, Canbin Piao, Chengfeng Dou, Da Pan, Dian Wang, Fan Yang, Fei Deng, Fei Li, Guangwei Ai, Hui Liu, Hongda Zhang, Jinyang Tai, Kai Lu, Lijun Liu, Linwei Chen, Linyu Li, Meiqing Guo, Peidong Guo, Qiang Ju, Rihui Xin, Shuai Wang, XinKai Ma, Xudong Chen, Yichuan Mo, Yijie Zhou, Leyi Pan, Yihe Luo, Zian Wang

机构 * Baichuan AI(百川智能) THUBPM Group, Tsinghua University(清华大学THUBPM课题组)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出Baichuan-M4临床级医疗大模型,通过统一运行时、持续照护强化学习框架和临床工具层三大支柱构建智能体系统,在多项医疗评估中取得领先结果,幻觉率降至3.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05463 2026-06-10 cs.AI 版本更新 57%

PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage

PSEBench: 一个用于评估大语言模型在患者安全事件分类中的可控且可验证的基准

Keqi Han, Ryan Young, Annabel Strauss, Lindsey Hughes, Katharine M. Nesbitt, Nicole Schueler, Che Ngufor, Carl Yang, Yuan Xue, Zhijun Yin

机构 * Emory University(埃默里大学) Scale AI Mayo Clinic(梅奥诊所) Vanderbilt University Medical Center(范德比大学医学中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出基于政策条款卡的结构化构建方法,通过锚点驱动实例化和闭环验证生成带真实标签的叙事,并创建包含5074个案例的基准PSEBench,评估15个代表性LLM在患者安全事件分类中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03217 2026-06-10 cs.LG cs.CY 版本更新 57%

Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability

大语言模型中的道德敏感性:通过行为剖析和机制可解释性对上下文偏见进行分层评估

Yash Aggarwal, Atmika Gorti, Vinija Jain, Aman Chadha, Krishnaprasad Thirunarayan, Manas Gaur

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Purdue University(普渡大学) Meta Apple(苹果公司) Wright State University(怀特州立大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出道德敏感性指数(MSI)量化大语言模型在七级压力测试中的偏见概率,并通过行为剖析和机制验证揭示模型偏见随情境变化的U型曲线,发现推理蒸馏会重新激活浅层统计关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07415 2026-06-10 cs.CV cs.CL 版本更新 57%

ChartREG++: Towards Benchmarking and Improving Chart Referring Expression Grounding under Diverse referring clues and Multi-Target Referring

ChartREG++:面向多样化指代线索和多目标指代的图表指代表达式定位基准与改进

Tianhao Niu, Ziyu Han, Xuan Dong, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对现有图表指代表达式定位基准的局限,提出支持多种定位形式、多目标指代、多样化线索和图表类型的基准,并利用代码驱动合成流水线生成像素级实例掩码,训练实例分割模型集成到多模态定位框架,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09543 2026-06-10 cs.SE cs.AI 57%

SWEnergy: An Empirical Study on Energy Efficiency in Agentic Issue Resolution Frameworks with SLMs

SWEnergy:关于使用SLM的代理问题解决框架的能量效率实证研究

Arihant Tripathy, Ch Pavan Harshit, Karthik Vaidhyanathan

机构 * SERC, IIIT-Hyderabad(IIIT-海得拉巴研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过实证研究,探讨了四种主流代理问题解决框架在使用小型语言模型时的能量效率和资源消耗,发现框架架构是主要能耗驱动因素,但SLM的有限推理能力导致大量能耗浪费。

Comments 8 pages, 5 figures, 1 table. Accepted to AGENT 2026 (ICSE 2026 workshop)

Journal ref Proceedings of the 2026 International Workshop on Agentic Engineering (AGENT 2026), ACM, 2026, pp. 104-111

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14717 2026-06-10 cs.CL 版本更新 57%

What Really Matters for Table LLMs? A Meta-Evaluation of Model and Data Effects

表格LLM真正重要的是什么?模型与数据影响的元评估

Naihao Deng, Sheng Zhang, Henghui Zhu, Shuaichen Chang, Jiani Zhang, Alexander Hanbo Li, Chung-Wei Hang, Hideo Kobayashi, Yiqun Hu, Patrick Ng

机构 * University of Michigan(密歇根大学) AWS AI Labs(AWS人工智能实验室) Figma OKX Google(谷歌)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 通过指令微调12个模型并在16个基准上评估,发现基座模型选择比训练数据对性能影响更大,泛化与推理仍是挑战。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10598 2026-06-10 cs.SE 新提交 50%

Exploring and Complementing End Users' Requirements in IoT enabled System

探索与补充物联网系统中终端用户的需求

Haotian Li, Xiaohong Chen, Zhi Jin, Shuyuan Xiao, Chenxu Wang, Haoxiang Yan, Xiaoyi Chen

专题命中 推理评测 :reasoning(abstract)

AI总结 针对终端用户通过触发动作编程创建物联网规则时表达碎片化的问题,提出一种基于意图的需求补全方法,利用双向需求可追溯树和多智能体框架,结合大语言模型推理与结构化可追溯性,实现功能完整且内在安全的规则补全,将规则补全率提升43%,逻辑冲突减少21%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24088 2026-06-10 cs.MA 版本更新 50%

CORRECT: COndensed eRror RECognition via knowledge Transfer in multi-agent systems

CORRECT: 多智能体系统中基于知识迁移的浓缩错误识别

Yifan Yu, Moyan Li, Shaoyuan Xu, Jinmiao Fu, Xinhai Hou, Fan Lai, Bryan Wang

专题命中 推理评测 :reasoning(abstract)

AI总结 提出CORRECT框架,利用在线缓存蒸馏错误模式,实现轻量级、免训练的错误定位,在多智能体系统中提升错误识别效率,并在七个应用上取得最高19.8%的步骤级错误定位提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 14 篇

2606.11052 2026-06-10 cs.CL 新提交 92%

Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It

混合LLM中的注意力遗忘:当CoT微调破坏长程记忆时,如何修复

Xinyu Zhou, Boyu Zhu, Yi Xu, Zhiwei Li, Yingfa Chen, Huiming Wang, Zhijiang Guo

机构 * LARK, HKUST(GZ)(香港科技大学(广州)LARK实验室) UCL(伦敦大学学院) Mistral AI Tsinghua University(清华大学) SUTD(新加坡科技设计大学) HKUST(香港科技大学)

专题命中 其他推理 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 发现CoT监督微调会系统性降低混合线性注意力模型的长上下文召回能力,提出QK-Restore方法通过恢复微调前的查询-键投影矩阵来修复,无需额外训练。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10184 2026-06-10 cs.LG cs.AI 新提交 84%

Dropout-GRPO: Variational Stochasticity for Continuous Latent Reasoning

Dropout-GRPO: 用于连续潜在推理的变分随机性

Wooil Jung

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO在连续潜在推理模型中因确定性轨迹导致优势为零的问题,提出通过结构化Dropout引入随机性,使GRPO能优化贝叶斯模型平均策略,在GSM8K上提升Coconut基线准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10838 2026-06-10 eess.AS 新提交 82%

Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains

面向语音-大语言模型的基于元数据驱动推理链的宽描述深度上下文推理

Jakob Poncelet, Hugo Van hamme

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 提出一种训练方法,使语音-LLM利用宽描述作为弱语义先验,通过链式推理进行上下文修正,降低罕见词和命名实体错误率。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09856 2026-06-10 cs.CL cs.AI cs.LG stat.ML 新提交 82%

Using Probabilistic Programs to Train Inductive Reasoning in Large Language Models

使用概率程序训练大型语言模型的归纳推理

Liyi Zhang, Akshay K. Jagadish, Brenden M. Lake, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) Princeton AI Lab(普林斯顿人工智能实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出基于程序的后验训练(PPT)方法,利用LLM生成概率程序场景,通过推理产生分布目标,微调模型以提升归纳推理准确性、与人类判断的一致性及校准能力。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10646 2026-06-10 cs.LG cs.CL 新提交 81%

How Does Reasoning Flow? Tracing Attention-Induced Information Flow for Targeted RL in LLMs

推理流如何流动?追踪注意力诱导的信息流以实现LLM中的目标RL

Zhichen Dong, Yang Li, Yuhan Sun, Weixun Wang, Yijia Luo, Zinian Peng, Taiheng Ye, Chao Yang, Wenbo Su, Yu Cheng, Bo Zheng, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出FlowTracer框架,通过注意力诱导的有向无环图追踪答案导向的推理流,基于全局信息流结构分配token级信用,从而提升LLM在推理任务中的强化学习效果。

Comments 25 pages, 7 figures, 11 tables. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11172 2026-06-10 cs.LG 新提交 79%

Predicting Future Behaviors in Reasoning Models Enables Better Steering

推理模型中预测未来行为以实现更好的引导

Evgenii Kortukov, Piotr Komorowski, Florian Klein, Paula Engl, Gabriele Sarti, Seong Joon Oh, Sebastian Lapuschkin, Wojciech Samek

机构 * Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所) Northeastern University(东北大学) KAIST(韩国科学技术院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 通过训练激活探针预测推理模型未来行为,提出未来探针控制生成(FPCG)方法,在多个评估中实现几乎无质量下降的引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10357 2026-06-10 cs.IR cs.AI 新提交 79%

Atomic Intent Reasoning: Bringing LLM Semantics to Industrial Cross-Domain Recommendations

原子意图推理:将LLM语义引入工业跨域推荐

Zhuohang Jiang, Yuxin Chen, Shijie Wang, Haohao Qu, Zhou Jindong, Wenqi Fan, Li Qing, Dongxu Liang, Jun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Kuaishou Technology(快手科技)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出AIR框架,通过离线LLM推理与在线高效检索组合,实现工业级跨域推荐,在快手电商中GMV提升3.446%。

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23183 2026-06-10 cs.IR cs.AI 版本更新 79%

Reasoning over Semantic IDs Enhances Generative Recommendation

基于语义ID的推理增强生成式推荐

Yingzhi He, Yan Sun, Junfei Tan, Yuxin Chen, Xiaoyu Kong, Chunxu Shen, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Tencent Inc.(腾讯公司)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出SIDReasoner两阶段框架,通过增强语义ID与语言的对齐和结果驱动的强化优化,实现无需大量推理标注的有效推理,提升生成式推荐的准确性、可解释性和跨领域泛化能力。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏