arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-27 至 2026-05-27 共收录 437 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 75 篇

2505.18603 2026-05-27 cs.AI cs.CV 77%

Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning

Doc-CoB:通过视觉链式框推理增强文档理解

Ye Mo, Kai Ye, Xianwei Mao, Zirui Shao, Gang Huang, Bo Zhang, Hangdi Xing, Kehan Chen, Huan Zhou, Zixu Yan, Jiajun Bu, Sheng Zhou

机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可感知与智能系统重点实验室,浙江大学) Alibaba Group(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出Doc-CoB框架,通过粗到细的布局感知视觉推理,结合多模态大语言模型,逐步聚焦查询相关布局区域,提升文档理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24456 2026-05-27 cs.CV 75%

EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy

EgoProx: 在认知层级上评估多模态大语言模型的自我中心3D邻近推理能力

Jinzhao Li, Yinuo Chen, Dongxu Piao, Panwang Pan, Yifan Yu, Dong Wang, Honglei Yan, Liang Yue, Shaofei Wang, Yixin Chen, Siyuan Huang, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) ByteDance(字节跳动) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 提出EgoProx基准,通过认知链任务和基于智能体的数据引擎,评估多模态大语言模型在自我中心3D邻近推理中的表现,发现模型虽具备空间知识但难以有效利用。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08999 2026-05-27 cs.CL cs.AI cs.LG 75%

ASTRA: Adaptive Semantic Tree Reasoning Architecture for Complex Table Question Answering

ASTRA: 面向复杂表格问答的自适应语义树推理架构

Xiaoke Guo, Songze Li, Zhiqiang Liu, Zhaoyan Gong, Yuanxiang Liu, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ASTRA架构,通过AdaSTR将表格重构为逻辑语义树,并利用DuTR双模式推理框架结合树搜索文本导航与符号代码执行,在复杂表格问答中达到最优性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20505 2026-05-27 cs.AI cs.CL cs.LG 75%

LiPUP-MA: A Residential Experience-centric Multi-Agent Framework for Living-in-the-loop Participatory Urban Planning

LiPUP-MA:一种以居住体验为中心的循环参与式城市多智能体规划框架

Hang Ni, Yuzhi Wang, Yizhi Song, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LiPUP-MA多智能体框架,通过模拟居住生活与体验驱动的计划修订循环,利用基于图的经验库和空间约束技能增强规划器,解决参与式城市规划中经验落地与反馈空间化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17163 2026-05-27 cs.LG cs.AI cs.CL cs.CV 75%

OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning

OCR-Reasoning基准:揭示MLLMs在复杂文本丰富图像推理中的真实能力

Mingxin Huang, Yongxin Shi, Dezhi Peng, Songxuan Lai, Zecheng Xie, Lianwen Jin

机构 * South China University of Technology(华南理工大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OCR-Reasoning基准,包含1069个人工标注样本,覆盖6种核心推理能力和18个实际推理任务,通过双标注(最终答案和逐步推理过程)评估多模态大语言模型在文本丰富图像推理中的能力,发现最先进模型准确率均低于50%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27088 2026-05-27 cs.CL cs.LG 73%

LLMs Are Already Good Tutors: Training-Free Prompt Optimization for Pedagogical Math Tutoring

LLMs 已经是好导师:面向教学数学辅导的无训练提示优化

Unggi Lee, Minchul Shin, Yeil Jeong, Sookbun Lee, Jeongsu Moon, Kyungtae Joo, Eunjoo Lee, Hoilym Kwon

机构 * Korea University Sejong Campus(韩国大学世宗校区) Gyeonggi Institute of Education(京畿教育学院) Indiana University Bloomington(印第安纳大学布卢明顿分校) Opentutorials Chosun University(全州大学) Korea University Korean Studies Center(韩国大学韩学研究中心)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究探索通过API调用优化系统提示的无训练方法,提出5种教育专用方法,在2个OOD基准上评估12种方法,发现所有方法均超越最强RL训练基线,ParetoGrad在事后解决率、泄漏控制和有用性上达到最佳帕累托平衡。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26893 2026-05-27 cs.CL cs.AI 73%

GeoFaith: A Spatio-Temporal Dual View of Faithful Chain-of-Thought

GeoFaith: 时空双视角下的忠实思维链

Weijiang Lv, Wentong Zhao, Jiayu Wang, Yuhao Wu, Jiaheng Wei, Xiaobo Xia

机构 * Xidian University(西安电子科技大学) Xi’an Jiaotong University(西安交通大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对思维链推理中的事后合理化问题,提出基于潜在几何结构和熵动力学的时空框架GeoFaith,通过可扩展的引导流水线构建忠实性检测器并联合优化结果正确性、过程忠实性和轨迹一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21454 2026-05-27 cs.CL cs.AI 73%

Reasoning Primitives in Hybrid and Non-Hybrid LLMs: Do Architectural Differences Yield Advantages in State-Tracking and Recall?

混合与非混合大语言模型中的推理原语:架构差异在状态追踪和召回中是否带来优势?

Shivam Rawat, Lucie Flek, Florian Mai, Nicholas Kluge Corrêa

机构 * Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔机器学习与人工智能研究所) Rheinische Friedrich-Wilhelms-Universität Bonn(波恩莱茵河弗里德里希-威廉大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过五个受控任务族比较了Transformer和混合架构在状态召回任务上的表现,发现推理增强是主要优势因素,而混合架构的优势较窄且依赖于任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12833 2026-05-27 cs.LG cs.AI cs.MA 73%

Vital Trace: Protocol-Constrained Patient-State Reasoning for Longitudinal Clinical Trajectories

Vital Trace: 协议约束的患者状态推理用于纵向临床轨迹

Zhan Qu, Michael Färber

机构 * TU Dresden(德累斯顿理工大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出Vital Trace,一个协议约束的多智能体框架,通过紧凑的持久患者状态记忆和四个协调智能体(Router、Reasoner、Auditor、Steward)进行分阶段推理,以解决长期临床轨迹推理中的上下文漂移和不稳定问题,在MIMIC-IV和eICU数据集上预测未来血管加压药、呼吸、肾脏支持和恶化任务中优于自由形式多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27209 2026-05-27 cs.AI 70%

Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments

在噪声中学习行动:通过噪声环境增强智能体鲁棒性

Yuxin Chen, Xiaodong Cai, Junfeng Fang, Zhuowen Han, Yu Wang, Yaorui Shi, Yi Zhang, Qi Gu, Xunliang Cai, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) Meituan(美团) Tsinghua University(清华大学) Tianjin University(天津大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出NoisyAgent框架,通过在训练中引入用户噪声和工具噪声,提升智能体在真实世界噪声环境下的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27110 2026-05-27 cs.CR cs.CL 70%

BAIT: Boundary-Guided Disclosure Escalation via Self-Conditioned Reasoning

BAIT: 基于边界引导的自我条件推理披露升级

Xuan Luo, Yue Wang, Geng Tu, Jing Li, Ruifeng Xu

机构 * The Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学) Shenzhen University(深圳大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出BAIT三步越狱框架,通过识别保护边界、细化边界和请求详细示例,利用模型自身推理和一致性倾向实现恶意目标披露,实验表明在多个基准上攻击成功率显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26735 2026-05-27 cs.CL 70%

Rethinking the Multilingual Reasoning Gap with Layer Swap

通过层交换重新思考多语言推理差距

Maxence Lasbordes, Amélie Chatelain, Djamé Seddah

机构 * LightOn Inria(法国国家科学研究中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过构建多语言推理数据集并微调专家模型,发现本地推理与英语枢轴推理的性能差距远小于先前报道,并提出层交换方法将英语专家的推理中间层迁移到本地专家,以缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26680 2026-05-27 cs.CV cs.AI 70%

DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding

DynFrame: 自适应推理驱动的多模态框架与动态帧增强用于复杂视频理解

Peng Zhang, Guanghao Zhang, Wanggui He, Longxiang Zhang, Mushui Liu, Yan Xia, Zhenhao Peng, Weilong Dai, Jinlong Liu, Haobing Tang, Le Zhang, Hao Jiang, Pipei Huang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DynFrame框架,通过将时间窗口和采样密度作为原生token进行单步检索,并引入分段解耦GRPO优化,解决了视频多模态大模型中采样密度不可学习及检索与回答优化耦合的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26498 2026-05-27 cs.CL 70%

Verilog-Evolve: Feedback-Driven and Skill-Evolving Verilog Generation

Verilog-Evolve:反馈驱动与技能演进的Verilog生成

Zehua Pei, Hui-Ling Zhen, Yu Zhang, Sinno Jialin Pan, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Verilog-Evolve框架,通过反馈驱动(功能仿真、Yosys综合、ABC时序代理等)迭代优化Verilog代码,并利用跨会话技能演进提升生成质量,实验表明在VerilogEval和混合精度GEMM任务上提高了功能成功率和下游友好性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21576 2026-05-27 cs.AI 70%

Chain Of Thought Compression: A Theoretical Analysis

思维链压缩:理论分析

Juncai Li, Ru Li, Yuxiang Zhou, Boxiang Ma, Jeff Z. Pan

机构 * School of Computer and Information Technology, Shanxi University, Taiyuan, Shanxi, China(山西大学计算机与信息学院) Queen Mary, University of London, UK(伦敦大学女王学院) School of Informatics, University of Edinburgh, UK(爱丁堡大学信息学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过引入Order-r Interaction理论,证明了隐式思维链压缩中高阶逻辑依赖的学习信号指数衰减问题,并提出ALiCoT框架通过对齐潜在令牌分布与中间推理状态来克服信号衰减,实现54.4倍加速且性能与显式CoT相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27074 2026-05-27 cs.CV 67%

IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous Streams

IPIBench: 在连续流下评估多模态大模型的交互式主动智能

Jinzhao Li, Yinuo Chen, Wenxuan Song, Yijia Lei, Yichi Zhang, Honglei Yan, Panwang Pan, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) ByteDance(字节跳动)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出IPIBench基准,用于评估多模态大模型在流式视频场景中的交互式主动智能,并设计IPI-Agent框架以改善主动触发和交互协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26928 2026-05-27 eess.SP 67%

NF-TrackLLM: Joint Prediction of UAV Trajectory and Near-Field Beam for LAE XL-MIMO Systems

NF-TrackLLM:用于LAE XL-MIMO系统的无人机轨迹与近场波束联合预测

Qianfan Lu, Mengyuan Li, Jiachen Tian, Yu Han, Xiao Li, Shi Jin

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出NF-TrackLLM框架,通过多模态语义感知和GPT-2时空推理,联合预测近场XL-MIMO系统中无人机轨迹和波束,实现高精度跟踪与波束预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26232 2026-05-27 cs.CV 67%

Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

并非所有模态都平等:面向多模态视频的指令感知门控

Bonan Ding, Umair Nawaz, Ufaq Khan, Abdelrahman M. Shaker, Muhammad Haris Khan, Jiale Cao, Jin Xie, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) Tianjin University(天津大学) Chongqing University(重庆大学) Linköping University(林奈大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出UniMVU框架,通过内模态和模态级指令感知动态门控实现多模态视频理解,在六个基准上优于静态融合方法。

Comments 19 pages, 8 figures, 7 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26969 2026-05-27 cs.CL cs.AI 62%

Recon: Reconstruction-Guided Reasoning Synthesis for User Modeling

Recon:基于重建指导的推理合成用于用户建模

Alan Zhu, Mihran Miroyan, Carolyn Wang, Andrew Zhou, Lisa Dunlap, Narges Norouzi, Joseph E. Gonzalez

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Recon方法,通过动作重建分数评估推理轨迹的预测能力,以改进用户建模中的推理合成,在多个领域优于事后合理化基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26934 2026-05-27 cs.CL cs.AI 62%

Reasoning Depth and Environment Complexity: A Controlled Study of RLVR Data Allocation across Logical Reasoning Tasks

推理深度与环境复杂度:逻辑推理任务中RLVR数据分配的受控研究

Yihua Zhu, Qianying Liu, Fei Cheng, Jiaxin Wang, Akiko Aizawa, Sadao Kurohashi, Hidetoshi Shimodaira

机构 * Kyoto University(京都大学) University of Tokyo(东京大学) NII LLMC(日本信息处理学会LLMC) RIKEN(理化学研究所)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 通过将推理空间划分为深度和复杂度两个维度,并考虑四种推理形式,在合成知识图谱环境中进行受控实验,发现联合深度-复杂度覆盖优于单轴策略,不同推理家族对RLVR覆盖的反应非均匀,且均匀混合优于分阶段课程。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11651 2026-05-27 cs.CV cs.AI cs.CL 62%

Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation

Hide to See: 面向VLM蒸馏中视觉锚定思维的推理前缀掩码

Seonghoon Yu, Dongjun Nam, Byung-Kwan Lee, Jeany Son

机构 * KAIST(韩国科学技术院) NVIDIA(英伟达) POSTECH(POSTECH大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种推理前缀掩码蒸馏框架,通过掩码学生模型的显著推理前缀,迫使其在推理过程中更依赖视觉证据,从而缓解长推理轨迹中的视觉遗忘问题,提升多模态推理性能。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18987 2026-05-27 cs.CL cs.AI cs.PL 62%

LLMs versus the Halting Problem: Characterizing Program Termination Reasoning

LLMs 与停机问题:程序终止推理的特征化

Oren Sultan, Jordi Armengol-Estape, Pascal Kesseli, Julien Vanegue, Dafna Shahaf, Yossi Adi, Peter O'Hearn

机构 * FAIR Team, Meta AI(Meta AI FAIR 团队) The Hebrew University of Jerusalem, Israel(耶路撒冷希伯来大学) Bloomberg, New York, USA(彭博社,纽约,美国) Imperial College London, UK(伦敦帝国理工学院,英国) University College London, UK(伦敦大学学院,英国)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了前沿LLMs在程序终止推理上的能力,发现GPT-5和Claude Sonnet 4.5在C程序终止判断上达到顶级验证工具水平,但无法生成形式化证明,并引入分歧前置条件形式化描述非终止条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26789 2026-05-27 cs.AI 57%

Composition Collapse: Stable Factual Knowledge Does Not Imply Compositional Reasoning

组合崩溃:稳定的事实知识并不意味着组合推理

Zhe Yu, Wenpeng Xing, Yunzhao Wei, Jie Chen, Hongzhi Wang, Xuyang Teng, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) Hong Kong Baptist University(香港 Baptist大学) Harbin Institute of Technology(哈尔滨工业大学) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.AI

AI总结 本文提出组合崩溃现象,即模型在稳定掌握原子事实的情况下仍无法将其组合成链式推理,并通过双门控协议分解后训练增益,揭示聚合指标掩盖的组合能力变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26530 2026-05-27 cs.AI 57%

Which Changes Matter? Towards Trustworthy Legal AI via Relevance-Sensitive Evaluation and Solver-Grounded Reasoning

哪些变化重要?通过相关性敏感评估和求解器基础推理实现可信赖的法律AI

Chen Linze, Cai Yufan, Hou Zhe, Dong Jin Song

机构 * National University of Singapore(新加坡国立大学) Griffith University(格里菲斯大学)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI

AI总结 提出法律相关性敏感评估问题,引入统一评估套件,并设计基于形式推理的对抗多智能体框架LexGuard,以提高法律AI对法律相关变化的校准敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26520 2026-05-27 cs.CV cs.AI 57%

InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward

InterSketch: 一种具有自校正视觉草图和逐步奖励的交错推理模型

Zhiwei Ning, Wenwen Tong, Xiangli Kong, Shengnan Ma, Ziyi Shang, Jingcheng Ni, Tao Hu, Yong Xien Chng, Jixuan Ying, Zehuan Wu, Hanming Deng, Jie Yang, Yuanjie Zheng, Wei Liu, Lewei Lu

机构 * Shanghai Jiao Tong University(上海交通大学) SenseTime Research(商汤科技研究院) Shandong Normal University(山东师范大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对视觉-语言模型在长程视觉推理中文本中心范式局限性的问题,提出InterSketch模型,通过自校正和逐步奖励机制增强交错视觉-文本思维链能力,在视觉推理基准上超越Gemini-3-Pro等专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26172 2026-05-27 cs.LG 57%

ARBITER: Reasoning Trajectory Basins and Majority Vote Failures in Test-Time Sampling

ARBITER:测试时采样中的推理轨迹盆地与多数投票失败

Meng Cai, Lars Kulik, Farhana Choudhury

机构 * School of Computing and Information Systems(计算与信息系统学院) University of Melbourne(墨尔本大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 本文发现语言模型测试时采样的推理轨迹会聚集成少数“推理盆地”,导致多数投票选择最稳定而非最准确的盆地,并提出ARBITER方法通过保守加性证据修正共识,从样本池中恢复部分正确性。

Comments Preprint. 34 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13502 2026-05-27 cs.CL 57%

Using reasoning LLMs to extract SDOH events from clinical notes

使用推理型大语言模型从临床笔记中提取社会健康决定因素事件

Ertan Dogan, Kunyu Yu, Yifan Peng

机构 * Department of Population Health Sciences, Weill Cornell Medicine(流行病学与公共卫生系,韦尔·科恩医学中心)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL

AI总结 本研究提出一种基于推理型大语言模型的提示工程方法,通过四个模块(简洁提示、少样本学习、自一致性机制和后处理)从临床笔记中提取结构化SDOH事件,取得0.866的微平均F1分数,展示了简单实现与强性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28730 2026-05-27 cs.RO cs.CL cs.CV 57%

SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning

SOLE-R1:视频语言推理作为机器人强化学习的唯一奖励

Philip Schroeder, Thomas Weng, Karl Schmeckpeper, Eric Rosen, Stephen Hart, Ondrej Biza

机构 * MIT(麻省理工学院) RAI Institute(机器人智能研究所)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 提出SOLE-R1模型,通过视频语言时空推理生成密集任务进度估计作为唯一奖励信号,实现在无真实奖励、演示或任务特定调优下的零样本在线强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02360 2026-05-27 cs.CV cs.CL 57%

LaRe: Latent Refocusing for Multimodal Reasoning

LaRe: 用于多模态推理的潜在重聚焦

Jizheng Ma, Xiaofei Zhou, Geyuan Zhang, Yanlong Song, Han Yan

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 提出LaRe范式,在潜在空间内进行视觉重聚焦,结合语义增强训练,在提升推理准确率的同时大幅减少推理所需token数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21552 2026-05-27 cs.CV cs.CL 57%

Learning GUI Grounding with Spatial Reasoning from Visual Feedback

通过视觉反馈学习具有空间推理能力的 GUI 定位

Yu Zhao, Wei-Ning Chen, Huseyin Atahan Inan, Samuel Kessler, Lu Wang, Lukas Wutschitz, Fangkai Yang, Chaoyun Zhang, Pasquale Minervini, Saravan Rajmohan, Robert Sim

机构 * University of Edinburgh(爱丁堡大学) Microsoft(微软)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文提出将 GUI 定位重构为交互式搜索任务,利用多步在线强化学习训练 GUI-Cursor 模型,通过光标视觉反馈提升空间推理能力,在 GUI 定位和代理任务上超越强基线。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏