arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11496 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1648 篇

2607.18806 2026-07-22 cs.AI cs.CL cs.MA 新提交 88%

AI Tour Meeting: Group Travel Planning by LLM Agents

人工智能旅游会议:基于大语言模型代理的团体旅行规划

Daisuke Kikuta

机构 * NTT, Inc.(日本电报电话公司)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出基于大语言模型代理的团体旅行规划框架AI Tour Meeting,通过自然语言讨论找满足约束和偏好的行程,提供相关配置接口实现灵活编排,可作模拟工具,还展示了系统验证等结果以证明其效用。

Comments The code is available at https://github.com/ntt-dkiku/ai-tour-meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11207 2026-07-14 cs.CL cs.AI 新提交 88%

ProgramTab: Boosting Table Reasoning of LLMs via Programmatic Paradigm

ProgramTab:通过编程范式提升大语言模型的表格推理能力

Pei Guo, Enjie Liu, Yunzhi Tan, Mochi Gao, Jianxin Zhang, Ruichao Zhong, Juntao Li, Bo Hu, Zang Li

机构 * Big Data and AI Platform Department, Tencent(腾讯大数据与人工智能平台部) Institute of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的表格推理问题,提出ProgramTab框架,指导LLMs用Python代码预处理表格数据并进行关键内容提取,实验证明该框架能有效处理表格推理任务,性能优于基于LLM的基线。

Comments Large Language Models, Table Reasoning, In-context Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08778 2026-07-13 cs.LG cs.AI 新提交 88%

iLENS: Interpretable LLM-Guided Mixture-of-Experts for Neuroimaging Survival Analysis

iLENS:用于神经影像生存分析的可解释大语言模型引导的专家混合模型

Farica Zhuang, Seong Woo Han, Zixuan Wen, Shu Yang, Yize Zhao, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学) Yale University(耶鲁大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对阿尔茨海默病前驱期转化预测问题,提出iLENS框架,基于专家混合模型,利用大语言模型合成信息指导专家路由,具备竞争力的预测性能,能为决策提供透明且基于生物学的原理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06452 2026-07-08 cs.CL cs.AI 新提交 88%

From Voting to Agent Collaboration: Answer-Type-Aware LLM Pipelines for BioASQ 14b

从投票到智能体协作:用于BioASQ 14b的答案类型感知大语言模型管道

Taeyun Roh, Eunha Lee, Wonjune Jang, Sohyun Chung, Junha Jung, Jaewoo Kang

机构 * Korea University(韩国大学) Myongji University(明知大学) AIGEN Sciences(爱根科学公司)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究针对BioASQ 14b任务B提出特定问题类型的大语言模型框架,依据不同问题类型选择不同推理程序,如为是/否问题用片段洗牌等,经初步实验和官方评估,框架性能具竞争力,在第4批次事实性子任务中夺冠,证明相关方法结合的有效性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05458 2026-07-08 cs.LG cs.AI 新提交 88%

Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning

利用离线强化学习学习控制大语言模型智能体的执行框架

Haiwen Yi, Xinyuan Song

机构 * University of Toronto(多伦多大学) Emory University(埃默里大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究提出将大语言模型智能体的执行框架视为可学习控制层,通过有限 horizon 的框架马尔可夫决策过程,利用离线强化学习训练轻量级控制器,在多领域实验中改进验证行为、提高任务质量,证明框架控制可学习且离线支持有局限。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21724 2026-06-23 cs.CL cs.AI 新提交 88%

Denoising Iterative Self-Correction: Structured Verification Loops for Reliable LLM Reasoning

去噪迭代自校正:用于可靠LLM推理的结构化验证循环

Shen Yin, David Ken, Joel Stremmel

机构 * Thomson Reuters Labs(汤森路透实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出DISC方法,通过将验证输出视为噪声测量,在多次验证-判断-校正循环中逐步减少推理错误,并引入二元判断门控机制防止破坏正确答案,在三个基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18947 2026-06-18 cs.AI cs.CL cs.IR cs.MA 新提交 88%

Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents

将搜索与推理解耦:面向LLM Agent的供应商无关的接地架构

Emmanuel Aboah Boateng, Kyle MacDonald, Amardeep Kumar, Siddharth Kodwani, Sudeep Das

机构 * DoorDash, Inc.(DoorDash公司)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出解耦搜索接地(DSG)架构,将搜索接地从推理模型中分离,通过MCP兼容网关实现供应商路由、缓存等控制,在降低成本和延迟的同时保持或提升准确性。

Comments 15 pages, Figure 8

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16360 2026-06-16 cs.CL cs.AI 新提交 88%

Tyler: Typed Latent Reasoning for Language Models -- When to Think, What to Compute, and How Much to Allocate

Tyler: 语言模型的类型化潜在推理——何时思考、计算什么以及分配多少

Hanyu Lin, Min Cai, Jiawei Wen, Haodi Zhang

机构 * Shenzhen University(深圳大学) University of Alberta(阿尔伯塔大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);prompting(abstract)

AI总结 提出Tyler框架,通过类型化潜在推理模块和预算感知策略,在自回归解码中动态选择文本生成或潜在计算,显著提升推理准确率并降低遗忘。

Comments website: https://typed-latent-reasoning.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14672 2026-06-15 cs.AI cs.CL 新提交 88%

Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent Workflows

面向LLM-Agent工作流中并行分支的直接潜在空间合成

Shikun Liu, Mufei Li, Dongqi Fu, Haoyu Wang, Yinglong Xia, Hong Li, Hong Yan, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Parallel-Synthesis框架,通过直接利用并行工作代理的KV缓存进行合成,避免文本拼接冗余,在9个数据集上匹配或超越文本合成,并将首令牌延迟降低2.5-11倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07602 2026-06-09 cs.LG cs.AI 新提交 88%

Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

面向LEGO空间物理推理的样本高效后训练

Yuhuan Yuan, Zhouliang Yu, Minghao Liu, Weiyang Liu, Ge Lin Kan

机构 * HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZODA

专题命中 推理与问题求解 :LLM(summary_cn,abstract);post-training(title);分类 cs.AI、cs.LG

AI总结 针对LLM生成LEGO组装时出现的物理有效但几何语义错位问题,提出基于模型的数据选择方法和样本高效强化学习PVPO,结合体素空间几何奖励,提升结构、语义对齐和物理有效性。

Comments Technical Report V1, 15 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26977 2026-07-30 cs.CL 新提交 88%

TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning

TREK:面向复杂行程规划的大语言模型智能体旅行推理与评估工具包

Jinhu Qi, Wentao Zhang, Siu Man Ng, Feiyang Xu, Yanyu Chen, Yaoman Li, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Macao Polytechnic University(澳门理工大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究推出TREK旅行基准测试,解决现有行程规划智能体基准的不足,实验显示最强LLM智能体仅在不足五成任务生成可行计划,满足旅行者未明确需求是普遍瓶颈。

Comments Code, data, and evaluator: https://github.com/TonyQJH/TREK-A-Travel-Reasoning-and-Evaluation-Kit-for-LLM-Agents-in-Complex-Trip-Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12920 2026-08-14 cs.CV 新提交 88%

TennisVAR: A Stroke-Evidence-Grounded Multimodal Large Language Model for Tactical Reasoning in Tennis Videos

TennisVAR:一种基于击球证据的多模态大语言模型,用于网球视频中的战术推理

Yifan Mei, Qingling Shi, Changli Wu, Jiayuan Rao, Jiayi Ji, Liujuan Cao

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对网球视频理解的感知与理解差距,提出回合级战术推理任务,构建专家标注基准TRACE,开发基于证据的多模态大语言模型TennisVAR,实现网球视频的战术推理。

Comments Project Page: https://whynotgit2025.github.io/TennisVAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05822 2026-08-07 cs.SE 新提交 88%

Agent-Based Test Assertion Generation via Diverse Perspective Aggregation

基于智能体的多视角聚合测试断言生成

Dong Wang, Qiaoyu Han, Lin Yang, Jianyi Zhou, Guangtai Liang, Junjie Chen

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对现有LLM断言生成方法的局限,提出基于智能体的AssertMate框架,通过三个组件聚合多视角,在Defects4J和EvoSuite验证中性能显著优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03291 2026-08-05 cs.LG cs.AI cs.CL 新提交 88%

The Tell-Tale Trace: Detecting Reasoning Failures in LLMs Using Chain-of-Thought Dynamics

可察觉的轨迹:利用思维链动态检测大语言模型中的推理失败

Shashwat Sourav, Aishwarya Balwani

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究利用思维链动态特性,在不假设语言化CoT语义忠实性的情况下,检测大语言模型在布尔可满足性任务中的分布式推理失败,并通过针对性提示干预提升了Llama3-70B的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24957 2026-07-29 cs.CV 新提交 88%

PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models

感知基准:评估多模态大语言模型中的原子视觉感知

Zichao Lin, Yifeng Xie, Bowen Qu, Haiming Wang, Jia Li, Haoning Wu, Yuhao Dong, Zuhao Yang, Jinguo Zhu, Haoyu Lu, Zijia Zhao, Tongtian Yue, Zhangyang Qi, Junwei Yang, Mengfan Dong, Peizhou Cao, Chenzhuang Du, Zaida Zhou, Haotian Yao, Hao Yang, Hongcheng Gao, Lin Sui, Weihong Li, Xinxing Zu, Jia Chen, Yao Wang, Xiaoxue Wu, Yalin Wang, Y. Charles, Yiping Bao, Yangyang Liu, Zhiqi Huang, Xinyu Zhou

机构 * Moonshot AI(登月人工智能)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 介绍用于评估多模态大语言模型原子视觉感知能力的PerceptionBench基准,通过自下而上方法构建错误分类法及相关问题,测试16个前沿模型,发现原子感知待解决,该基准为衡量MLLM视觉感知边界提供标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21085 2026-07-24 cs.CV 新提交 88%

Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models

Geo3R:减轻多模态大语言模型中的空间推理幻觉

Mingyu Wang, Weilin Jin, Wenbo Li, Haoyang Huang, Tong Jia, Ying Li

机构 * Peking University(北京大学) Joy Future Academy(京东探索研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 多模态大语言模型推理空间关系易产生幻觉,现有方法效果有限。本文定义空间推理幻觉及常见场景,提出无训练的Geo3R框架,结合几何证据和结构化3D推理减轻幻觉,实验证明该框架显著减少幻觉,优于现有模型和方法。

Comments Accepted by ACM MM 2026. This is the arXiv preprint version, not the camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14497 2026-07-17 cs.CV 新提交 88%

Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

通过自我场景增强在多模态大语言模型中强化自我中心空间感知

Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu, Xu Zheng, Zidong Cao, Lutao Jiang, Zixin Zhang, Huiyu Zhou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 研究如何强化多模态大语言模型的自我中心空间感知,提出自我场景增强框架ESA,利用自我元素图作为中间表示,通过视觉基础模型增强空间感知,在EgoTextVQA基准上取得显著性能提升。

Comments 14 pages, 8 figures. Chi Kit Wong and Ye Pan contributed equally. Code: https://github.com/Chikit-WONG/spatialGraph

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13860 2026-07-16 cs.CV 新提交 88%

Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models

迈向增强医学多模态大语言模型中的 3D 空间推理

Zhuoyuan Fu, Zeshang Li, Yiqiong Zhang, Hangui Lin, Yan Shu, Yan Li, Binyang Li, Yaru Zhao

机构 * University of International Relations(国际关系学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 研究旨在增强医学多模态大语言模型的 3D 空间推理。通过新型逐片数据合成范式构建结构化推理数据集,用其对二维预训练模型进行指令微调,提升了模型在 3D 医学基准测试中的性能,缩小了与原生 3D 架构的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03184 2026-07-07 cs.CV 新提交 88%

BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception

BVS:用于细粒度感知的基于多模态大语言模型的贝叶斯视觉搜索

Geng Li, Yuxin Peng

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 针对多模态大语言模型在超高分辨率图像细粒度感知的难题,提出BVS框架,将感知设为连续空间尺度流形上的全局优化问题,通过先验引导与后验校正提升性能。

Comments Accepted by ICML 2026. Project page with code: https://github.com/PKU-ICST-MIPL/BVS_ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00427 2026-07-02 cs.SE 新提交 88%

BT-APE: A Computationally Light Backtracking Approach to Automatic Prompt Engineering for Requirements Classification

BT-APE: 一种用于需求分类的轻量级回溯自动提示工程方法

Mohammad Amin Zadenoori, Waad Alhoshan, Jacek Dąbrowski, Liping Zhao, Alessio Ferrari

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出轻量级回溯自动提示工程方法BT-APE,通过LLM生成候选、回溯搜索和动态示例选择迭代优化提示,在需求分类任务中以更低计算成本达到与资源密集型方法相当的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23717 2026-06-24 eess.IV 新提交 88%

SpaCE: Rethinking Spatial Capacity and Generalization in Multi-Frame Multimodal Large Language Models

SpaCE: 重新思考多帧多模态大语言模型中的空间容量与泛化能力

Mariana Costa, Camila Ferreira, Alberlucia Rafael Soarez, Alejandro Torres

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 提出SpaCE理论框架,证明多帧空间推理的信息论上界、样本复杂度界、PAC-Bayes泛化界,并刻画显式3D表示与隐式推理的偏差-方差权衡,在多个基准上验证了理论紧致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08688 2026-06-09 cs.RO cs.CV 新提交 88%

PhysAgent: Automating Physics-Based 4D Synthesis via Trajectory-Grounded Multi-Agent Feedback

PhysAgent: 通过轨迹驱动的多智能体反馈实现基于物理的4D合成自动化

Chunji Lv, Jiaxi Ye, Yuchen Jiang, Rexar Lin, Changsheng Li

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出PhysAgent,首个模拟器在环的多智能体框架,通过解耦材料与外力、利用视觉基础模型提取轨迹并借助LLM常识推理,实现自动化、物理可信的4D运动合成,显著提升生成多样性与物理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16637 2026-08-18 cs.AI 新提交 87%

PDDLCoder: Agentic PDDL Generation for LLM-Assisted Symbolic Planning

PDDLCoder:用于LLM辅助符号规划的智能体式PDDL生成工具

Veit Laule, Jiangtao Shuai, Manfred Hauswirth, Sonja Schimmler

机构 * Technical University of Berlin(柏林工业大学) Fraunhofer FOKUS(弗劳恩霍夫FOKUS研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究提出智能体式PDDL生成框架PDDLCoder,引入含711个问题的NL-pddlgym基准,其在测试集上可生成89.6%可执行规划,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13612 2026-08-17 cs.AI cs.SE 新提交 87%

SemPlan: Benchmarking Structured Semantic Planning for LLM-Based Queries over Enterprise Data

SemPlan:面向企业数据的基于大语言模型(LLM)查询的结构化语义规划基准测试

Bruno Santos Teixeira

机构 * Universidade Federal de Ouro Preto (UFOP)(欧鲁普雷图联邦大学(UFOP))

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究构建了SemPlan基准测试,对比四种架构在企业数据LLM查询语义规划中的表现,发现结构化语义规划架构(A3)正确率最高,不同架构在正确率、策略合规性、成本等方面存在权衡。

Comments 11 pages, 3 figures, 9 tables. Submitted to Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13221 2026-08-14 cs.AI 新提交 87%

TsuGO: Probing Search Efficiency in LLM Reasoning via Go Life-and-Death Problems

TsuGO:通过围棋死活问题探究大语言模型推理中的搜索效率

Shunwen Bai, Ziping Ma, Chaoyang Zhang, Yarong Wang, Jiale Liu, Zhen Qin, Qingpei Guo

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究提出围棋死活问题基准TsuGO,发现现有LLM的推理搜索组织能力远逊于神经引导的KataGo,指出搜索组织是LLM推理评估的缺失维度。

Comments 23 pages, 12 figures, 20 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12273 2026-08-13 cs.CR cs.AI 新提交 87%

Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

收敛式绕路劫持:基于技能的大语言模型智能体中的任务保留型资源放大

Junliang Liu, Ruoyu Li, Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Jingheng Xu, Laizhong Cui

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究提出收敛式绕路劫持攻击,耦合LLM智能体技能选择与规划阶段,可放大任务资源消耗,在DeepSeek-V4-Pro上80.02%的任务会被选中攻击者控制的协调器,任务完成率不变但成本显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12197 2026-08-13 eess.SY cs.AI cs.SY 新提交 87%

NetlistBench: Evaluating LLM Reliability in SPICE Netlist Recognition and Manipulation

NetlistBench:评估大型语言模型在SPICE网表识别与操作中的可靠性

Jiarui Ma, Jianghan Wang, Yuheng Ma, Ziyi Zhuang, Xiaoguang Liu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对LLMs在SPICE网表识别与操作中的可靠性,构建含2342个案例的NetlistBench基准,发现其性能随结构复杂度变化,为电路设计自动化提供关键瓶颈参考。

Comments accepted by MLCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10843 2026-08-12 cs.AI 新提交 87%

Hypothesis Frontier: Verifier Guided LLM and Symbolic Search for First-Order Induction

假设前沿:验证器引导的大语言模型与符号搜索用于一阶归纳

Serafim Batzoglou

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究提出Hypothesis Frontier框架,结合LLM与符号搜索,在匹配条件下比重复原始提示生成解决更多一阶归纳问题,还可简化所得公式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10483 2026-08-12 cs.AI cond-mat.mtrl-sci 新提交 87%

Predicting Space Groups of Double Perovskites by LLM with Dynamic Few-Shot Learning

基于动态少样本学习的大语言模型预测双钙钛矿的空间群

Jongwon Park, Inhyo Lee, Junhyeong Lee, Seunghwa Ryu

专题命中 推理与问题求解 :LLM(title,summary_cn);prompting(abstract);分类 cs.AI

AI总结 该研究提出基于LLM智能体的DyRIS框架,通过动态少样本检索与规则引导推理,在不平衡双钙钛矿数据集上提升了空间群预测的整体及少数类性能,验证了领域知识与LLM结合的有效性。

Comments 46 pages, 6 figures, Supplementary Information included(24 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09857 2026-08-11 cs.RO cs.AI 新提交 87%

Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy

智能体 harness:面向机器人自主的大语言模型驱动验证层

Rohan Bhagra, Mahantesh Halapannavar, Uddhav Bhattarai

机构 * Carnegie Mellon University(卡内基梅隆大学) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对机器人规划模型的安全与伦理风险,提出LLM驱动的验证层作为中间件管控计划,实现近85%的类别准确率、97%的对抗性攻击遏制率,为机器人自主提供可靠保障。

Comments 7 pages. Not yet finalized for conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏