arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-30 至 2026-06-30 共收录 88 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 88 篇

2605.08330 2026-06-30 cs.RO 93%

Hierarchical Prompting with Dual LLM Modules for Robotic Task and Motion Planning

具有双LLM模块的分层提示用于机器人任务和运动规划

Karolina Źróbek, Tessa Pulli, Paweł Gajewski, Antonio Galiza Cerdeira Gonzalez, Bipin Indurkhya

机构 * IBM, Krakow, Poland(IBM公司,波兰克拉科夫) Jagiellonian University, Krakow, Poland(雅盖隆大学,波兰克拉科夫) AGH University, Krakow, Poland(AGH大学,波兰克拉科夫)

专题命中 推理与问题求解 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一个分层语言驱动框架,通过双LLM模块提升服务和协助场景中人机交互的自然性和直观性,结合目标检测与运动执行实现高成功率的任务规划。

Journal ref Proc. IEEE International Conference on Advanced Robotics and its Social Impacts (ARSO), 2026, pp. 245-250

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02176 2026-06-30 cs.CL 92%

Adam's Law: Textual Frequency Law on Large Language Models

Adam的定律:大型语言模型中的文本频率定律

Hongyuan Adam Lu, Z. L., Victor Wei, Zefan Zhang, Zhao Hong, Qiqi Xiang, Bowen Cao, Wai Lam

机构 * FaceMind Corporation(FaceMind公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)

AI总结 本文提出文本频率定律,通过优化文本频率提升LLM的提示和微调效果,并通过文本频率蒸馏和课程训练方法验证了其有效性。

Comments ACL 2026 Main Conference; The latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02734 2026-06-30 cs.AI cs.CL 92%

CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents

CostBench:评估LLM工具使用代理在动态环境中的多轮成本最优规划与适应

Jiayu Liu, Cheng Qian, Zhaochen Su, Qing Zong, Shijue Huang, Bingxiang He, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CostBench,一个以成本为中心的可扩展基准,用于评估LLM代理在动态环境中的经济推理和重新规划能力,揭示现有模型在成本感知规划方面的显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30247 2026-06-30 cs.CL 92%

Grounding LLM Reasoning under Incomplete Graph Evidence

在不完全图证据下 grounding LLM 推理

Jiaqi Li, Fanghui Song

机构 * Tianjin Normal University, College of Computer and Information Engineering(天津师范大学计算机与信息工程学院) Harbin Institute of Technology, School of Mathematics(哈尔滨工业大学数学学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出在不完全知识图谱证据下,通过KL正则化变形LLM先验实现软grounding,并给出稳定性界限,适用于GraphRAG、KGQA等场景。

Comments A theoretical perspective about Grounding LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30587 2026-06-30 cs.CR cs.AI 92%

Words Speak Louder Than Code: Investigating Cognitive Heuristics in LLM-Based Code Vulnerability Detection

言语胜于代码:探究基于LLM的代码漏洞检测中的认知启发式

Asif Shahriar, Hongyu Cai, Hadjer Benkraouda, Gang Wang, Z. Berkay Celik

机构 * BRAC University(布拉德大学) Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次系统探究认知启发式对LLM代码漏洞检测的影响,提出控制框架,发现所有评估模型均易受光环、框架和锚定效应影响,且语义推理型漏洞更易受影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28363 2026-06-30 cs.IR cs.AI cs.DL 92%

meta-pipe: An LLM-agent pipeline for end-to-end automated systematic review and meta-analysis

meta-pipe:面向端到端自动化系统评价与元分析的LLM智能体流水线

Hsieh-Ting Lin, Jiunn-Tyng Yeh

机构 * MD, PhD(医学博士,哲学博士)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出meta-pipe,一个集成文献检索、筛选、数据提取、统计分析、手稿生成和质量保证的10阶段模块化LLM智能体流水线,在关键决策点强制人工监督,并具备自动手稿生成、半自动GRADE评估、过度声明检测和双范式网络元分析等独特能力。

Comments 13 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30119 2026-06-30 cs.CR 91%

On the Internet, Nobody Knows You're an LLM Bot: Unmasking Web Agents with Multi-Layer Fingerprinting

在互联网上,没人知道你是一个LLM机器人:使用多层指纹识别揭露网络代理

Iliana Fayolle, Sihem Bouhenniche, Samuel Pélissier, Pierre Laperdrix, Clémentine Maurice, Walter Rudametkin

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文部署蜜罐站点,结合网络、HTTP和浏览器层指纹识别技术,评估六种基于LLM的网络代理绕过反机器人机制的能力,发现多层指纹可区分代理与人类及代理之间,且隐身机制反而增加可检测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28392 2026-06-30 cs.CV cs.AI cs.LG 91%

RADIANT-PET: Reasoning-Augmented PET/CT Lesion Segmentation with Large Language Models and Reinforcement Learning

RADIANT-PET:结合大语言模型和强化学习的推理增强型PET/CT病灶分割

Jiasheng Wang, Tanun Jitwatcharakomol, Piyawadee Jongpradubgiat, Simeng Zhu

机构 * Division of Hematology, The Ohio State University Comprehensive Cancer Center(血液科,俄亥俄州立大学综合癌症中心) Department of Radiology, Mahidol University(医学放射科,玛希多大学) Department of Radiology, Mettapracharak Hospital(医学放射科,Mettapracharak医院) Department of Radiation Oncology, The Ohio State University Comprehensive Cancer Center(放射肿瘤科,俄亥俄州立大学综合癌症中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出RADIANT-PET框架,通过大语言模型和强化学习对候选摄取区域进行推理分类,抑制生理性假阳性,提升PET/CT病灶分割准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29399 2026-06-30 cs.AI 90%

LLM-Guided Planning for Multi-hop Reasoning over Multimodal Nuclear Regulatory Documents

LLM引导的规划:多模态核监管文档的多跳推理

Mingyu Jeon, Bokyeong Kim, Suwan Cho, Jae Young Suh, Yonggyun Yu

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出LLM引导的规划方法,通过动态知识图谱状态和文档树工具,在多跳推理任务中实现81.5%准确率,显著优于无状态规划方法。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond @ ICML 2026. 8 pages (main), 3 figures, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29067 2026-06-30 cs.CL 90%

ThinkProbe: Beyond Accuracy -- Structural Profiling of Open-Ended LLM Reasoning Traces via Non-Generative Thought Graphs

ThinkProbe:超越准确性——通过非生成式思维图对开放式LLM推理轨迹进行结构分析

Mohamed Amine Kerkouri, Simon D. Hernandez, Marouane Tliba, Yann Dauxais, Maha Ben-Fares, Pierre Holat

机构 * F-Initiatives Université sorbonne Paris Nord(巴黎-索邦大学 Nord)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出ThinkProbe框架,将LLM推理轨迹转化为思维图,通过非生成式管道提取五维认知特征,发现推理结构是模型级稳定属性,且结构维度对问题领域敏感。

Comments Under Review for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28409 2026-06-30 cs.AR cs.AI 90%

Evidence-Driven LLM Agent for C-to-Synthesizable-C Conversion and Verification

证据驱动的LLM智能体用于C到可综合C的转换与验证

Zhe Zhao, Hongbing Lang, Zhihan Xiao, Luke Ztz Hu, John Imoleayo Adebisi, Songping Mai

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种基于大语言模型的闭环生成-验证-诊断-修复框架,通过四阶段验证器、渐进式不匹配定位链和证据检索增强生成,将C代码转换为HLS可综合C,显著优于现有方法。

Comments 14 pages, 8 figures, submitted to IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems (TCAD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29776 2026-06-30 cs.LG cs.AI 90%

Towards Generalizable and Evidential Nuclear Magnetic Resonance-Based Molecular Structure Elucidation via Large Language Model Agent

面向可泛化与可证据的核磁共振分子结构解析:基于大语言模型智能体的方法

Zheng Fang, Chen Yang, Yusen Tan, Yunpeng Zhao, Fanjie Xu, Hongxin Xiang, Hanyu Sun, Hanyu Gao, Xiaojian Wang, Wenjie Du, Yuqiang Li, Jun Xia

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) State Key Laboratory of Precision and Intelligent Chemistry, University of Science and Technology of China(中国科学技术大学精密与智能化学国家重点实验室) State Key Laboratory of Physical Chemistry of Solid Surface, College of Chemistry and Chemical Engineering, Xiamen University(厦门大学化学系固态表面物理化学国家重点实验室) The University of Hong Kong(香港大学) Peking Union Medical College and Chinese Academy of Medical Sciences(北京协和医学院中国医学科学院) The Hong Kong University of Science and Technology(香港科技大学) Hunan University(湖南大学) AI for Science Center, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室人工智能科学中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出NMRAgent智能体,结合大语言模型、光谱分析工具和化学知识图谱,通过证据推理实现高精度、可解释的分子结构解析,在新型骨架测试集上Top-1准确率提升46.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11491 2026-06-30 cs.CL cs.AI 90%

Ontology-Guided Reverse Thinking Makes Large Language Models Stronger on Knowledge Graph Question Answering

本体引导的反向思维使大语言模型在知识图谱问答中更强

Runxuan Liu, Bei Luo, Jiaqi Li, Baoxin Wang, Ming Liu, Dayong Wu, Shijin Wang, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Beijing University of Posts and Telecommunications(北京邮电大学) Joint Laboratory of HIT and iFLYTEK(哈工大与科大讯飞联合实验室) University of Science and Technology of China(中国科学技术大学) Pengcheng Laboratory(鹏城实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Ontology-Guided Reverse Thinking框架,通过反向推理构建路径,提升大语言模型在知识图谱问答中的表现,实验表明其在WebQSP和CWQ数据集上达到最佳性能。

Comments We now public our source codes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29929 2026-06-30 cs.AI 89%

HippoSpark: An On-Demand Experience System for LLM Reasoning

HippoSpark: 一种用于LLM推理的按需经验系统

Jingyao Liu, Danling Meng, Chen Huang, Yukun Yan, Zhenghao Liu, Wenqiang Lei, See-Kiong Ng, Maosong Sun

专题命中 推理与问题求解 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 提出HippoSpark状态级经验系统,在推理过程中按需检索局部瓶颈的精确指导,在数学、科学和编程基准上优于标准提示和任务级经验基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29689 2026-06-30 cs.CL 88%

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30639 2026-06-30 cs.AI cs.CL 88%

Self-Evolving World Models for LLM Agent Planning

面向LLM智能体规划的自我进化世界模型

Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, Yang Deng

机构 * National University of Singapore(国立新加坡大学) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理学院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出WorldEvolver框架,通过情景记忆、语义记忆和选择性预见三个模块在测试时修正世界模型,提升预测准确性和下游规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29225 2026-06-30 cs.AI cs.CL 88%

PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents

PolicyGuard: 一种基于对话的子代理验证器,用于确保LLM代理遵循策略

Seongjae Kang, Taehyung Yu, Sung Ju Hwang

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出PolicyGuard子代理验证器,通过共享对话上下文、策略推理和可操作反馈,在tau²-BENCH航空数据集上使PASS4提升12个百分点,同时误拦率降低约一半。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30168 2026-06-30 cs.CV 88%

Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

潜在噪声掩码:减少多模态大语言模型中的视觉冗余

Kai Jiang, Ruishu Zhu, Siqi Huang, Hongyuan Zhang, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学和电子学(iOPEN)、西北工业大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院、中国电信(TeleAI)) Fudan University(复旦大学) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 提出Lens框架,通过轻量级LET令牌为视觉令牌评分,并注入自适应噪声抑制低相关令牌,在不改变模型结构的情况下提升多模态推理性能。

Comments 21 pages, 7 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28981 2026-06-30 cs.CY 88%

Bad company corrupts good morals: Understanding and Measuring Narrative-Induced Moral Reasoning Degradation in LLMs

坏公司败坏好道德:理解与衡量叙事引发的LLM道德推理退化

Wanying Yu, Boyang Ma, Zhibo Eric Sun, Minghui Xu, Yue Zhang

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出BreakingBad框架,系统衡量负面叙事沉浸对LLM道德推理、行为及部署风险的影响,发现叙事暴露导致道德准确率下降12%-31%,且退化具有结构性,第一人称叙事影响更强,并传播至实际部署场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29985 2026-06-30 cs.CL 87%

Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning

我们是在衡量策略还是措辞?LLM数学推理中表面多样性与方法层面多样性的差距

Sangmook Lee, Minbeom Kim, Jeonghye Kim, Dohyung Kim, Sojeong Rhee, Kyomin Jung

机构 * Seoul National University(首尔国立大学) KAIST(韩国科学技术院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出方法层面多样性概念,发现现有多样性指标无法反映策略差异,且多样性感知强化学习会降低方法多样性,直接优化方法多样性仍具挑战。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15251 2026-06-30 cs.CL 87%

The Effect of Scripts and Formats on LLM Numeracy

脚本和格式对LLM数理能力的影响

Varshini Reddy, Craig W. Schmidt, Seth Ebner, Adam Wiemerslage, Yuval Pinter, Chris Tanner

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究探讨了不同数字脚本和格式对LLM数理能力的影响,发现当输入使用不常见脚本或格式时,LLM准确性显著下降,但通过提示策略可缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30029 2026-06-30 astro-ph.IM 87%

ESOFinder: an LLM-powered tool to help users navigate ESO documentation

ESOFinder:一个基于LLM的工具,帮助用户浏览ESO文档

P. Sánchez-Sáez, C. Reinero, M. Vioque, M. Wittkowski, M. Rejkuba, M. Romaniello, A. Barnes, J. Pritchard, M. Marsset

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对ESO文档量大且多样导致用户查找困难的问题,开发了基于大语言模型和检索增强生成的ESOFinder聊天机器人,集成多类文档提供精准答案,减少幻觉,提升可靠性。

Comments Submitted to SPIE Astronomical Telescopes and Instrumentation 2026, paper number 14155-19

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29354 2026-06-30 cs.AI cs.NE 86%

When LLMs Develop Languages: Symbolic Communication for Efficient Multi-Agent Reasoning

当大语言模型发展语言:用于高效多智能体推理的符号通信

Zhengqi Pei, Qingming Huang, Shuhui Wang

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CLSR框架,让多个LLM智能体自主发明和演化紧凑符号语言,通过路由器自适应选择以优化准确率与token成本的权衡,在保持准确率的同时将推理token数减少3-6倍。

Comments ICML2026 Regular paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06638 2026-06-30 cs.LG cs.AI 86%

HEARTS: Benchmarking LLM Reasoning on Health Time Series

HEARTS:基于健康时间序列的LLM推理基准测试

Sirui Li, Shuhan Xiao, Mihir Joshi, Ahmed Metwally, Daniel McDuff, Wei Wang, Yuzhe Yang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HEARTS是一个统一的基准测试,用于评估LLM在一般健康时间序列上的分层推理能力,包含16个真实世界数据集和110个任务,揭示了LLM在多步时间推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20334 2026-06-30 cs.RO cs.AI cs.LG 86%

Demonstration-Free Robotic Control via LLM Agents

无需演示的机器人控制 via LLM 代理

Brian Y. Tsui, Alan Y. Fang, Tiffany J. Hwu

机构 * independent researchers(独立研究人员)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FAEA框架,利用通用大语言模型实现无需演示的机器人操控,通过迭代推理生成操控策略,在多个基准测试中取得高成功率,展示了通用代理在任务规划中的有效性。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01472 2026-06-30 cs.RO 86%

AERMANI-VLM: Structured Prompting and Reasoning for Aerial Manipulation with Vision Language Models

AERMANI-VLM:基于视觉语言模型的空中 manipulation 的结构提示与推理

Sarthak Mishra, Rishabh Dev Yadav, Avirup Das, Saksham Gupta, Wei Pan, Spandan Roy

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Newcastle University(纽卡斯尔大学)

专题命中 推理与问题求解 :language model(title,abstract);prompting(title)

AI总结 本文提出AERMANI-VLM框架,通过分离高层推理与低层控制,利用结构化提示生成自然语言推理轨迹,实现安全可靠的空中 manipulation 任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29481 2026-06-30 cs.CL cs.AI 85%

To Reason or to Fabricate: Reasoning Without Shortcuts via Hint-Anchored Pairwise Aggregation

推理还是捏造:通过提示锚定的成对聚合实现无捷径推理

Jiuheng Lin, Chen Zhang, Yansong Feng

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 针对强化学习前数据重叠导致模型利用捷径记忆答案的问题,提出HIPPO框架,通过提示注入触发重叠行为并利用成对奖励模型区分真实推理与捷径合理化,显著提升推理真实性及泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29091 2026-06-30 cs.LG cs.AI cs.DB 84%

Statistically Indistinguishable, Operationally Distinct: A Formal Barrier for Tabular Foundation Models

统计不可区分,操作上截然不同:表格基础模型的形式化障碍

Tassilo Klein, Johannes Hoffart

机构 * SAP SE(SAP公司)

专题命中 推理与问题求解 :foundation model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出操作图灵测试,证明仅基于值的表格模型无法区分合法与违规数据库状态,而操作审计特征可突破该障碍,揭示可识别性而非模型容量是根本限制。

Comments Accepted at the 2nd ICML Workshop on Foundation Models for Structured Data, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29999 2026-06-30 cs.AI 84%

AlgoSkill: Learning to Design Algorithms by Scheduling Human-Like Skills

AlgoSkill: 通过调度类人技能学习设计算法

Xinyuan Song, Zekun Cai, Liang Zhao

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出AlgoSkill框架,将算法设计建模为基于类型化技能库的序列决策,通过MCTS和验证反馈调度技能,在竞赛编程和组合优化任务上优于直接生成和自优化方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29786 2026-06-30 cs.CV cs.RO 83%

OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments

OP3DSG:面向真实环境的开放词汇部件感知3D场景图生成

Yirum Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(全州科学技术院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);foundation model(abstract)

AI总结 提出OP3DSG框架,通过部件感知检测与融合、几何初始化先验图及LLM精炼,实现开放词汇下对象、交互部件、空间/功能关系及可供性的统一建模,在UniGraph3D基准上达到最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏