arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 848 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 138 篇

2606.01934 2026-06-02 cs.LG cs.CL 73%

HMPO: Hybrid Median-length Policy Optimization for Chain-of-Thought Compression

HMPO: 用于思维链压缩的混合中位数长度策略优化

Minghui Zheng, Hongxu Chen, Huimin Ren, Hongsheng Xin, Xiaoyang Qu, Ze Wang, Shuling Yang, Ziyu Peng, Kaike Zhang, Pan Zhou, Kun Zhan

机构 * Li Auto Inc.(Li Auto公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出HMPO,一种单阶段强化学习框架,通过自适应中位数预算、余弦衰减令牌奖励和乘法奖励公式,在数学数据上训练后实现19%-46%的令牌压缩且精度损失极小,并泛化至多种任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01243 2026-06-02 cs.CL cs.LG 73%

Unlocking the Black Box of Latent Reasoning: An Interpretability-Guided Approach to Intervention

解锁潜在推理的黑箱:一种可解释性引导的干预方法

Shuochen Chang, Tong Bai, Xiaofeng Zhang, Qianli Ma, Qingyang Liu, Zhaohe Liao, Yibo Miao, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过结构、因果和几何探针分析潜在推理向量的可解释性,并基于此提出无需训练的解码时干预方法,提升大语言模型推理准确性。

Journal ref ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01020 2026-06-02 cs.AI cs.LG 73%

Tackling the Root of Misinformation by Teaching Laypeople about Logical Fallacies via Socratic Questioning and Critical Argumentation

通过苏格拉底式提问和批判性论证教授外行人逻辑谬误,以应对错误信息的根源

Minjing Shi, Junling Wang, Jingwei Ni, Sankalan Pal Chowdhury, Mrinmaya Sachan

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LFTutor智能辅导系统,利用大语言模型结合苏格拉底式提问和批判性论证原则,帮助外行人学习识别逻辑谬误,显著优于基线模型。

Comments This paper has been accepted to Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Long Paper), Main Conference

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00472 2026-06-02 cs.CV cs.AI cs.HC cs.LG 73%

CodeCytos: AI-assisted spatial molecular imaging analysis via code-augmented agent action space

CodeCytos: 通过代码增强的智能体动作空间实现AI辅助空间分子成像分析

Hung Q. Vo, Huy Q. Vo, Son T. Ly, Zhihao Wan, Anh-Vu Nguyen, Hong Zhao, Jianting Sheng, Stephen T. C. Wong, Hien V. Nguyen

机构 * University of Houston, Department of Electrical and Computer Engineering(德克萨斯大学休斯顿分校电子与计算机工程系) Houston Methodist Hospital, Department of Systems Medicine and Biomedical Engineering(休斯顿 Methodist 医院系统医学与生物医学工程系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出CodeCytos框架,通过代码驱动的推理智能体实现空间分子成像数据的动态可编程分析,提升自动化与定制化能力,并在多种组织类型数据集上验证其优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11374 2026-06-02 cs.LG cs.CL cs.IR 73%

Test-Time Compute for Frozen Embedding Models through Agentic Program Search

冻结嵌入模型在测试时通过智能体程序搜索的计算

Han Xiao

机构 * Jina AI by Elastic(Jina AI 由 Elastic 提供)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种智能体程序搜索方法,通过大语言模型编写程序操作冻结编码器API,在推理时提升小嵌入模型的检索质量,无需训练参数且跨任务迁移。

Comments 15 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03789 2026-06-02 cs.LG cs.AI 73%

Automated Conjecture Resolution with Formal Verification

自动猜想解决与形式化验证

Haocheng Ju, Guoxiong Gao, Jiedong Jiang, Bin Wu, Zeming Sun, Shurui Liu, Leheng Chen, Yutong Wang, Yuefeng Wang, Zichen Wang, Wanyi He, Peihao Wu, Liang Xiao, Ruochuan Liu, Bryan Dai, Bin Dong

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Westlake Institute for Advanced Study, Westlake University(西拉雅大学先进研究所) School of Mathematics, Tianjin University(天津大学数学学院) Research Institute for Mathematical Sciences, Kyoto University(京都大学数学研究所) Department of Mathematics, Stanford University(斯坦福大学数学系) IQuest Research(IQuest研究) New Cornerstone Science Laboratory, School of Mathematical Sciences, Peking University(北京大学数学科学学院新基石科学实验室) Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学国际数学研究所以及新基石科学实验室) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾大学先进研究所智能计算中心) Zhongguancun Academy(中关村学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一个集成非形式化推理与形式化验证的自动框架,通过两个组件Rethlas和Archon解决研究级数学问题,并成功解决交换代数中的开放问题并在Lean 4中形式化验证。

Comments Code and resources are available at: Rethlas (https://github.com/frenzymath/Rethlas), Rethlas Results (https://github.com/frenzymath/Rethlas_results), Archon (https://github.com/frenzymath/Archon), and the formalization results (https://github.com/frenzymath/Anderson-Conjecture)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08038 2026-06-02 cs.CL cs.AI 73%

AblationBench: Evaluating Automated Planning of Ablations in Empirical AI Research

AblationBench:评估实证AI研究中消融实验的自动规划

Talor Abramovich, Gal Chechik

机构 * Google Research(谷歌研究)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出AblationBench基准套件,包含作者消融和审稿人消融两个任务,用于评估语言模型在AI研究中规划消融实验的能力,实验表明当前最佳模型仅能识别45%的原始消融,低于人类水平。

Comments AI4Science Workshop, ICML 2026; Project page: https://ablation-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12551 2026-06-02 cs.LG cs.AI cs.OS cs.SE 73%

TuneAgent: Agentic Operating System Kernel Tuning with Reinforcement Learning

TuneAgent: 基于强化学习的智能操作系统内核调优

Hongyu Lin, Yuchen Li, Haoran Luo, Zhenghong Lin, Libo Zhang, Mingjie Xing, Yanjun Wu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出TuneAgent框架,利用基于规则的强化学习使大语言模型自主探索Linux内核空间,通过结构化奖励函数和两阶段训练策略解决稀疏反馈问题,实现高达5.6%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01861 2026-06-02 cs.LG 70%

A Theoretical Framework for Self-Play Theorem Proving Algorithms

自我对弈定理证明算法的理论框架

Thomas Chen, Zhiyuan Li

机构 * Thomas Chen(汤姆·陈) Zhiyuan Li(李志强)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一个理论框架,通过将定理集建模为图并引入可逆随机游走和多样性度量,分析自我对弈算法在定理证明中的自我改进能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01830 2026-06-02 cs.AI 70%

CAPF: Guiding Search-Agent Rollouts with Credit-Attenuated Privileged Feedback

CAPF:基于信用衰减特权反馈引导搜索智能体轨迹生成

Bin Chen, Xinye Liao, Yiming Liu, Xin Liao, Chonghan Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对结果奖励稀疏导致搜索智能体学习困难的问题,提出训练时利用验证器侧信息(CAPF)将零奖励轨迹修复为正奖励轨迹,并衰减相关信用以适配无特权反馈的部署场景,在七个开放域问答基准上将Qwen3-4B的平均精确匹配分数从44.7%提升至48.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00532 2026-06-02 cs.AI 70%

KACE: Knowledge-Adaptive Context Engineering for Mathematical Reasoning

KACE: 知识自适应上下文工程用于数学推理

Jayant Parashar, Suchendra M. Bhandarkar

机构 * School of Computing, University of Georgia(计算学院,佐治亚大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出KACE方法,通过难度和领域分层的知识库与分层自一致性,解决数学推理中上下文膨胀问题,在AIME 2025上达到62.2%准确率。

Comments 9 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00507 2026-06-02 cs.CL 70%

LaSR: Context-Aware Speech Recognition via Latent Reasoning

LaSR:通过潜在推理实现上下文感知的语音识别

Heyang Liu, Ziyang Cheng, Jiayi Huang, Wenyang Xiao, Ronghua Wu, Qunshan Gu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LaSR训练范式,利用潜在推理轨迹增强语音大语言模型的上下文感知能力,在学术术语识别上显著提升性能且不增加延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00451 2026-06-02 cs.CL 70%

ProtStructQA: A Denotation Threshold in Protein Structural Reasoning

ProtStructQA: 蛋白质结构推理中的指称阈值

Aravind Mandiga, Guoming Li, Jin Lu, Ismailcem Budak Arpinar, Khaled Rasheed, Samuel E. Aggrey

机构 * University of Georgia(佐治亚大学)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出可执行基准ProtStructQA,通过将自然语言问题编译为DSL程序并在AlphaFold结构上执行来评估蛋白质语言模型,发现模型在1.7B到4B参数之间存在指称阈值,低于该阈值时工具辅助推理占优,高于该阈值时思维链成为最强策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00240 2026-06-02 cs.AI cs.MA 70%

MindZero: Learning Online Mental Reasoning With Zero Annotations

MindZero:零标注的在线心智推理学习

Shunchi Zhang, Jin Lu, Chuanyang Jin, Yichao Zhou, Zhining Zhang, Tianmin Shu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MindZero框架,通过自监督强化学习训练多模态大语言模型,实现高效鲁棒的在线心智推理,无需显式心智状态标注。

Comments ICML 2026. Website: https://scai.cs.jhu.edu/MindZero

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00148 2026-06-02 cs.CV cs.AI 70%

StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning

StemBind: 当多模态大语言模型在抽象视觉推理中迷失于规则与实例之间

Xixiang He, Baiqi Wu, Xingming Li, Ao Cheng, Qiyao Sun, Xuanyu Ji, Qingyong Hu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 StemBind 诊断基准,通过共享主干的三对齐问题(感知、规则、完整)定位 MLLM 在抽象视觉推理中的失败环节,发现规则到实例的绑定是主要瓶颈。

Comments Project page: https://hexixiang.github.io/StemBind

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24828 2026-06-02 cs.AI 70%

Test-Time Deep Thinking to Explore Implicit Rules

测试时深度思考以探索隐式规则

Wentong Chen, Xin Cong, Zhong Zhang, Yaxi Lu, Siyuan Zhao, Yesai Wu, Qinyu Luo, Haotian Chen, Yankai Lin, Zhiyuan Liu, Maosong Sun

机构 * Renmin University of China(中国人民大学) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) School of Computer Science and Engineering, UESTC(UESTC计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Mathematical Sciences, Nankai University(南开大学数学科学学院) Whiting School, Johns Hopkins University(约翰斯·霍普金斯大学惠特林学院) School of Artificial Intelligence, Shanghai Jiaotong University(上海交通大学人工智能学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对智能体在隐式规则环境中失败的问题,提出TTExplore框架,通过训练专用模型Exp-Thinker进行测试时推理,平均提升基线性能14-19点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13136 2026-06-02 cs.CL 70%

GateKD: Confidence-Gated Closed-Loop Distillation for Robust Reasoning

GateKD: 基于置信度门控的闭环蒸馏用于鲁棒推理

Kasidit Sermsri, Teerapong Panboonyuen

机构 * Chulalongkorn University(朱拉隆梭大学) MARSAIL PBYAIL (Panboonyuen AI Lab)(Panboonyuen AI Lab)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出GateKD框架,通过置信度门控的闭环蒸馏(包括软监督、隐藏状态演化和注意力蒸馏)减少噪声传播,提升学生模型在常识、逻辑和符号推理上的鲁棒性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09907 2026-06-02 cs.AI cs.MA 70%

RADAR: Redundancy-Aware Diffusion for Multi-Agent Communication Structure Generation

RADAR:面向多智能体通信结构生成的冗余感知扩散方法

Zhen Zhang, Wanjing Zhou, Juncheng Li, Hao Fei, Jun Wen, Wei Ji

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种基于条件离散图扩散模型的冗余感知生成框架RADAR,通过逐步生成通信拓扑并利用图有效尺寸引导,在六项基准上实现更高准确率、更低令牌消耗和更强鲁棒性。

Comments Accepted by ICML 2026 (fix typos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09883 2026-06-02 cs.CV cs.AI 70%

The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space

笛卡尔捷径:在极坐标空间中重新评估视觉推理

Xia Hu, Zhenrui Yue, Brian Potetz, Howard Zhou, Leonidas Guibas, Chun-Ta Lu, Zhicheng Wang

机构 * Stanford University(斯坦福大学) Google Research(谷歌研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在视觉推理中利用笛卡尔坐标捷径的问题,提出Polaris-Bench基准,将任务转换至极坐标空间,揭示模型缺乏拓扑不变性视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06995 2026-06-02 cs.AI 70%

What's Missing in Screen-to-Action? Towards a UI-in-the-Loop Paradigm for Multimodal GUI Reasoning

屏幕到动作中缺失了什么?面向多模态GUI推理的UI-in-the-Loop范式

Songze Li, Xiaoke Guo, Tianqi Liu, Biao Yi, Zhaoyan Gong, Zhiqiang Liu, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) ZJU-Ant Group Joint Lab of Knowledge Graph(浙大蚂蚁集团知识图谱联合实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出UI-in-the-Loop (UILoop) 范式,通过循环的屏幕-UI元素-动作过程,让多模态大模型显式学习UI元素的定位、语义和用法,实现可解释推理,并在UI理解任务上达到最优。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14065 2026-06-02 cs.AI 70%

REAL: Resolving Knowledge Conflicts in Knowledge-Intensive Visual Question Answering via Reasoning-Pivot Alignment

REAL: 通过推理枢轴对齐解决知识密集型视觉问答中的知识冲突

Kai Ye, Xianwei Mao, Sheng Zhou, Zirui Shao, Ye Mo, Liangliang Liu, Haikuan Huang, Bin Li, Jiajun Bu

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 提出REAL框架,通过推理枢轴对齐和引导解码,解决知识密集型视觉问答中因开放域检索引起的知识冲突问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03719 2026-06-02 cs.CL 70%

BranPO: Scalable Contrastive Branch Sampling for Long-Horizon Agentic Reinforcement Learning

BranPO:面向长程智能体强化学习的可扩展对比分支采样

Yubao Zhao, Weiquan Huang, Sudong Wang, Ruochen Zhao, Chen Chen, Yao Shu, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对长程智能体强化学习中轨迹级奖励稀疏且信用分配困难的问题,提出一种无值函数方法BranPO,通过截断轨迹并重采样延续构建对比分支,实现局部对比监督,无需密集奖励。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02416 2026-06-02 cs.AI 70%

Structure Enables Effective Self-Localization of Errors in LLMs

结构使语言模型能够有效自我定位错误

Ankur Samanta, Akshayaa Magesh, Ayush Jain, Kavosh Asadi, Youliang Yu, Daniel Jiang, Boris Vidolov, Kaveh Hassani, Paul Sajda, Jalaj Bhandari, Yonathan Efroni

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超智能实验室) Tel Aviv University(特拉维夫大学)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出结构化推理方法,通过将推理分解为离散语义步骤,使语言模型能更可靠地定位错误,并基于此设计了迭代纠正采样框架Thought-ICS,实现20-40%的自我纠正提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01837 2026-06-02 cs.CR 67%

Benign Inputs, Harmful Outputs: Cross-Modal Jailbreaking via Distributed Semantic Recomposition

良性输入,有害输出:通过分布式语义重组的跨模态越狱

Yani Wang, Yilong Yang, Yang Liu, Zhuzhu Wang, Zuobin Ying, Zhuo Ma

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出分布式语义重组(DSR)框架,将有害意图分解为良性文本和视觉基元,利用多模态大模型的推理能力在跨模态推理阶段融合为有害输出,实现高攻击成功率且输入毒性极低。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01106 2026-06-02 cs.CV 67%

Temporal Evidence Routing with Structured Visual Evidence for TimeLogicQA

基于结构化视觉证据的时间证据路由用于TimeLogicQA

Yuyang Sun, Yongliang Wu, Xingyu Zhu, Yuxia Chen, Zhenxiang Jiang, Yangguang Ji, Wenbo Zhu, Yanxi Shi, Jay Wu, Shuo Wang, Xu Yang

机构 * Southeast University(东南大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究员) Opus AI Research(Opus AI研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出视觉证据路由流水线,分离感知与符号时间推理,通过结构化视觉证据和确定性时间规则在TimeLogicQA上达到81.8 AvgAcc。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00762 2026-06-02 cs.RO 67%

STEM: Semantic Target Search and Exploration using MAVs in Cluttered Environments

STEM: 杂乱环境中使用MAV的语义目标搜索与探索

Nikhil Sethi, Max Lodel, Laura Ferranti, Robert Babuška, Javier Alonso-Mora

机构 * Department of Cognitive Robotics(认知机器人学系) Delft University of Technology(代尔夫特理工大学) CIIRC(捷克技术大学布拉格分校智能信息研究中心)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 提出一种基于语义引导视点规划器的框架,利用MAV在非结构化3D环境中最小化目标搜索与探索时间,通过组合规划器和主动感知管道实现高效语义探索。

Comments Accepted to Autonomous Robots Journal. Nikhil Sethi and Max Lodel contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00519 2026-06-02 cs.RO 67%

DriveAnchor: Progressive Anchor-based Flow Learning for Autonomous Driving Planning

DriveAnchor: 用于自动驾驶规划的渐进式基于锚点的流学习

Limin Yan, Haoyun Tang, Yutao Qiu, Hongqing Liu, Haoyu Xu

机构 * Meituan Autonomous Driving(美团自动驾驶) Xi’an Jiaotong University(西安交通大学) Beijing Institute of Technology(北京理工大学)

专题命中 推理与问题求解 :pretraining(abstract);post-training(abstract)

AI总结 提出三阶段框架DriveAnchor,通过示范流预训练、引导流后训练和奖励精炼流微调,实现行为多样性、可控性和安全性,在200万场景中近距碰撞率降低89%,平均奖励提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24919 2026-06-02 cs.CV 67%

Agentic AI for Remote Sensing: Technical Challenges and Research Directions

Agentic AI 在遥感中的应用:技术挑战与研究方向

Muhammad Akhtar Munir, Muhammad Umer Sheikh, Akashah Shabbir, Muhammad Haris Khan, Fahad Khan, Xiao Xiang Zhu, Begüm Demir, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract)

AI总结 本文指出遥感中的多步分析工作流存在结构性的地理空间约束,提出面向地球观测的原生智能体设计原则,包括结构化地理空间状态、工具感知推理、验证器引导执行和有效性感知学习评估。

Comments 31 pages. Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25719 2026-06-02 eess.AS 67%

Step-Audio-R1.5 Technical Report

Step-Audio-R1.5 技术报告

Yuxin Zhang, Xiangyu Tony Zhang, Daijiao Liu, Fei Tian, Yayue Deng, Jun Chen, Qingjian Lin, Haoyang Zhang, Yuxin Li, Jinglan Gong, Yechang Huang, Liang Zhao, Chengyuan Yao, Hexin Liu, Eng Siong Chng, Xuerui Yang, Gang Yu, Xiangyu Zhang, Daxin Jiang

专题命中 推理与问题求解 :language model(abstract);RLHF(abstract)

AI总结 本文提出 Step-Audio-R1.5,通过从强化学习验证奖励转向基于人类反馈的强化学习,解决了音频大语言模型在客观基准上表现优异但牺牲真实对话自然度的问题,实现了分析推理与沉浸式交互体验的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02465 2026-06-02 cs.CL cs.AI 62%

Learning When to Translate for Multilingual Reasoning

学习何时翻译以实现多语言推理

Deokhyung Kang, Hyounghun Kim, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence(人工智能研究生院) Department of Computer Science & Engineering(计算机科学与工程系) POSTECH

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Luar框架,通过强化学习训练推理语言模型在直接理解不可靠时选择性调用翻译,从而缩小多语言推理差距。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏