arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-14 至 2026-07-14 共收录 91 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 91 篇

2606.11678 2026-07-14 cs.CL 版本更新 92%

Can AI Reason Like an Urban Planner? Benchmarking Large Language Models Against Professional Judgment

AI能像城市规划师一样推理吗?基于专业判断的大语言模型基准测试

Yijie Deng, He Zhu, Wen Wang, Junyou Su, Minxin Chen, Wenjia Zhang

机构 * School of Architecture and Urban Planning, Shenzhen University(深圳大学建筑与城市规划学院) Shenzhen Key Laboratory of Urban Spatial Information and Intelligent Modeling(深圳市城市空间信息与智能建模重点实验室) Department of Urban Planning and Design, The University of Hong Kong(香港大学城市规划与设计系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出UPBench框架,通过4×5知识支柱与认知水平矩阵评估25个LLM,发现模型在分析任务上优于事实回忆和综合判断,揭示了规划知识的制度依赖性。

Comments This paper has been withdrawn by the authors because the current version requires substantial revision and further validation before it can be considered a reliable representation of the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18850 2026-07-14 cs.CL 版本更新 92%

Cognitive Alpha Mining via LLM-Driven Code-Based Evolution

通过LLM驱动的代码基于进化进行认知Alpha挖掘

Fengyuan Liu, Yi Huang, Sichun Luo, Yuqi Wang, Yazheng Yang, Xinye Li, Zefa Hu, Junlan Feng, Qi Liu

机构 * Jiutian Research, China Mobile(九天研究,中国移动) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CogAlpha框架,结合代码级Alpha表示与LLM驱动的推理和进化搜索,以实现更广泛、结构化且人似的探索,提升Alpha发现的预测准确性与经济解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10411 2026-07-14 cs.SE cs.AI 新提交 91%

Mitigating LLM Sycophancy in Code Smell Detection Using Evidence-Guided Reasoning Prompts

使用证据引导推理提示减轻代码异味检测中的大语言模型谄媚现象

Istiaq Ahmed Fahad, Kamruzzaman Asif, Md. Nurul Ahad Tawhid

机构 * Institute of Information Technology(信息科技研究所) University of Dhaka(达卡大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究基于LLM的代码异味检测中谄媚偏差问题,通过MLCQ数据集评估不同提示框架影响,发现模型对提示变化敏感。提出证据引导去偏提示策略,降低决策不稳定性,提高鲁棒性,为解决该问题提供有效方法。

Comments 11 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10296 2026-07-14 cs.AI cs.CL 新提交 90%

SPARK: Susceptibility-Guided Profiling and Steering of Latent Reasoning States in Large Language Models

SPARK:大语言模型中基于敏感性的潜在推理状态分析与引导

Dongxu Zhang, Yiding Sun, Zihao Guo, Xiangyang Yang, Kai Tang, Lin Chen, Cheng Tan, Jihua Zhu

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Tencent(腾讯)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型推理失败问题,提出SPARK方法,利用隐藏状态响应诊断推理状态并引导测试时干预,通过长度控制敏感性等手段,在实验中提升了Qwen3系列模型性能,证明敏感性对推理失败诊断及干预的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26104 2026-07-14 cs.CL cs.AI 版本更新 89%

Assert, don't describe: Linguistic features that shift LLM reasoning about animal welfare

断言,而非描述:改变LLM关于动物福利推理的语言特征

Jasmine Brazilek, Harper Dunn

机构 * Compassion Aligned Machine Learning (CaML)(同情对齐机器学习实验室) Independent researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过词汇匹配的立场对比探针,测量十种语言特征对Llama-3.2-1B模型动物福利推理的影响,发现断言性确定性等七种特征增强支持动物福利,而模糊语言等两种特征削弱立场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10438 2026-07-14 cs.RO cs.NI 新提交 89%

Large Language Model Enhanced Differentiable Trajectory Planning for IoT-Enabled Autonomous Driving

用于物联网支持的自动驾驶的大语言模型增强可微轨迹规划

Shihao Zhang, Jing Yang, Ziyu Song, Zheng Lin, Sunil Prajapat, Zhaochen Xia, Hemant Ghayvat, Haitao Ding, Lip Yee Por, Ashok Kumar Das

机构 * State Key Laboratory of Automotive Simulation and Control, Jilin University(吉林大学汽车仿真与控制国家重点实验室) Center of Research for Cyber Security and Network (CSNET), Faculty of Computer Science and Information Technology, Universiti Malaya(马来西亚大学计算机科学与信息技术学院网络安全与网络研究中心) Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性与信任跨学科中心) IMT, Department of Humanities and Technology, Roskilde University(罗斯基勒大学人文与技术系IMT) Center for Security, Theory and Algorithmic Research, International Institute of Information Technology(国际信息技术研究所安全、理论与算法研究中心) Department of Computer Science and Engineering, College of Informatics, Korea University(韩国大学信息学院计算机科学与工程系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 针对物联网支持的自动驾驶规划问题,提出大语言模型增强可微轨迹规划框架。通过以周围智能体为中心的数据增强、复杂度感知的语义增强模块及可微优化模块,提升规划效果,在相关基准测试中取得高分,验证了在线部署和实时闭环执行能力。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05716 2026-07-14 cs.CV 版本更新 89%

Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

场景图思维:增强多模态大语言模型的结构化视觉推理

Zhiwei Yang, Yuanchen Wu, Nan Zhang, Yucong Meng, Ke Yan, Shouhong Ding

机构 * Fudan University(复旦大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 针对多模态大语言模型忽视结构化关系的问题,提出场景图思维(SaGe)范式,通过自动数据引擎转换数据、构建训练数据,采用两阶段图对齐训练范式,在多模态基准测试中取得显著改进,提升细粒度感知和推理能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06205 2026-07-14 cs.CL cs.AI 版本更新 88%

Tool-MCoT: Tool Augmented Multimodal Chain-of-Thought for Content Safety Moderation

Tool-MCoT:用于内容安全审核的工具增强多模态链式思维

Shutong Zhang, Dylan Zhou, Yinxiao Liu, Yang Yang, Huiwen Luo, Wenfei Zou

机构 * Stanford University(斯坦福大学) Google(谷歌) Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Tool-MCoT,一种基于工具增强的多模态链式思维模型,用于提升内容安全审核的效率与准确性,通过训练小语言模型以有效利用外部工具进行推理和决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10245 2026-07-14 cs.CL cs.IR 新提交 88%

PTEI: Integrating Personality Traits to Enhance Emotional Intelligence in Large Language Models

PTEI:在大语言模型中整合人格特质以提高情商

Amir Reza Jafari, Praboda Rajapaksha, Reza Farahbakhsh, Noel Crespi

机构 * Telecom SudParis, Institut Polytechnique de Paris(巴黎电信学院,巴黎综合理工学院) Aberystwyth University(阿伯里斯特威斯大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究针对大语言模型在复杂情感推理中不如人类的问题,提出PTEI框架,通过提取人格特质并用于人格感知提示引导模型推理,结合对比学习优化检索系统,经实验验证其能增强模型情感理解能力,与CoT推理结合可进一步提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11207 2026-07-14 cs.CL cs.AI 新提交 88%

ProgramTab: Boosting Table Reasoning of LLMs via Programmatic Paradigm

ProgramTab:通过编程范式提升大语言模型的表格推理能力

Pei Guo, Enjie Liu, Yunzhi Tan, Mochi Gao, Jianxin Zhang, Ruichao Zhong, Juntao Li, Bo Hu, Zang Li

机构 * Big Data and AI Platform Department, Tencent(腾讯大数据与人工智能平台部) Institute of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的表格推理问题,提出ProgramTab框架,指导LLMs用Python代码预处理表格数据并进行关键内容提取,实验证明该框架能有效处理表格推理任务,性能优于基于LLM的基线。

Comments Large Language Models, Table Reasoning, In-context Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21334 2026-07-14 cs.AI cs.CE cs.CL cs.LG econ.GN q-fin.EC 版本更新 88%

Ideological Bias in LLMs' Economic Causal Reasoning

大语言模型在经济因果推理中的意识形态偏见

Donggyu Lee, Hyeok Yun, Jungwon Kim, Junsik Min, Sungwon Park, Sangyoon Park, Jihee Kim

机构 * Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院) College of Business, KAIST(韩国科学技术院商学院) School of Computing, KAIST(韩国科学技术院计算机学院) Division of Social Science, HKUST(香港科技大学社会科学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究探讨LLM在经济因果推理中的意识形态偏见,通过扩展EconCausal基准测试,评估20种先进LLM在处理意识形态冲突案例时的准确性,发现LLM在意识形态冲突案例上表现更差,且存在系统性偏倚。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10386 2026-07-14 cs.CL cs.AI 新提交 87%

Structured Thoughts For Improved Reasoning And Context Pruning

用于改进推理和上下文修剪的结构化思维

Zain Sarwar, Supriyo Chakraborty, Berkcan Kapusuzoglu, Chia-Hsuan Lee, Anirban Das, Stephen Rawls, Kartik Balasubramaniam, Sambit Sahu

机构 * University of Chicago(芝加哥大学) Capital One(第一资本金融公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究针对大语言模型长推理痕迹的问题,引入结构化思维框架,通过构建数据集微调模型,使其采用结构化推理风格提升性能,还能实现上下文修剪,在数学任务中可节省内存并保持一定性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10340 2026-07-14 cs.AR 新提交 87%

When Fuzzing Meets Understanding: LLM-Driven Semantic Test Generation for RTL Verification

当模糊测试与理解相遇:用于RTL验证的大语言模型驱动的语义测试生成

Kun Wang, Cangyuan Li, Kaiyan Chang, Siyang Cai, Yinhe Han, Ying Wang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对硬件验证难题,提出ChipFuzzer框架,利用大语言模型语义推理能力。采用双阶段工作流程,覆盖引导阶段结合控制流分析提升覆盖率,错误引导阶段借助历史数据提高错误发现率,实验显示其显著提升验证效果。

Comments 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17889 2026-07-14 cs.CV 版本更新 87%

AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning

AeroRAG:结构化多模态检索增强型LLM用于细粒度航空视觉推理

Junxiao Xue, Quan Deng, Tingqi Hu, Meicong Si, Xinyi Yin, Yunyun Shi, Xuecheng Wu

机构 * Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AeroRAG,通过结构化场景图引导的多模态检索增强生成框架,解决航空场景中视觉问答的挑战,提升对小物体、数量、位置及物体关系的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11358 2026-07-14 cs.CL 新提交 86%

RefineEvo: Planning-Guided Heuristic Evolution with Bidirectional Experience

RefineEvo:基于双向经验的规划引导启发式进化

Yang Wu, Junran Pan, Yifan Zhang, Ning Xu, Fanshuo Zeng, Jian Cheng

机构 * C$^2$DL, Institute of Automation, Chinese Academy of Sciences(C2DL,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing(人工智能学院,中国科学院大学,北京) University of Chinese Academy of Sciences, Nanjing(中国科学院大学,南京)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对自动启发式设计中基于LLM方法的不足,提出RefineEvo框架,通过规划器和反射器,结合双向经验池动态调度进化算子,在经典组合优化基准测试中表现出色,提升了解质量和令牌效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09839 2026-07-14 cs.AI cs.CV cs.HC 新提交 86%

Exploring Agentic Workflows for Generating High Quality Math Visual Aids

探索用于生成高质量数学视觉辅助工具的智能工作流程

Rizwaan Malik, Ashna Khetan, Isabel Sieh, Samin Khan

机构 * Stanford Graduate School of Education(斯坦福大学教育研究生院) Department of Computer Science(计算机科学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对中学数学图表可靠生成难的问题,引入智能工作流程,让 LLM 智能体评估并迭代改进生成的视觉效果,通过探索性评估确定改进关键领域,初步证明可提高 AI 生成数学图表的可靠性和教育价值。

Comments 13 pages, 9 figures. Exploratory course project on agentic workflows for generating and evaluating K 12 mathematical diagrams

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09979 2026-07-14 cs.SE 新提交 86%

Using LLMs to Adjudicate Static-Analysis Alerts with Error Reduction Techniques

使用具有错误减少技术的大语言模型来判定静态分析警报

William Klieber, David Svoboda, Lori Flynn, Ruben Martins

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究用大语言模型判定静态分析警报,采用一致性检查和LLM推理评估两种方法,在三个测试套件上评估多个LLMs,中级推理LLMs经错误缓解后召回率和特异性高,还探讨了相关问题及合成程序作为证据的结果。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06534 2026-07-14 cs.CV 版本更新 86%

CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models

CAIRN:使用拓扑感知大型多模态模型进行跨房间3D场景理解

He Liang, Chenyang Ma, Yiming Zhang, Sangyun Shin, Andrew Markham, Niki Trigoni, Yuhang He

机构 * University of Oxford(牛津大学) Microsoft(微软公司) Simon Fraser University(西蒙弗雷泽大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对现有3D-LLMs不能处理多房间场景问题,提出拓扑感知3D-LLM即CAIRN。其将Transformer注意力与场景层次对齐,通过多种方式增强模型能力。在新基准CAIRN-MR上实验,CAIRN在多房间任务中大幅超越前人,单房间任务也具竞争力。

Comments Project Page: https://oceansdepp.github.io/cairn_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16395 2026-07-14 cs.AI cs.SE 版本更新 85%

LLM-Driven Collaborative Model for Untangling Commits via Explicit and Implicit Dependency Reasoning

基于显式和隐式依赖推理的大语言模型驱动的提交解缠协作模型

Bo Hou, Xin Tan, Kai Zheng, Fang Liu, Yinghao Zhu, Li Zhang

机构 * State Key Laboratory of Complex \& Critical Software Environment (SKLCCSE), School of Computer Science Engineering, Beihang University Beijing China SKLCCSE, School of Computer Science School of Computing Data Science, The University of Hong Kong Hong Kong SAR China Engineering, Beihang University Data Science, The University of Hong Kong

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对开发者常产生的缠结提交问题,提出ColaUntangle协作框架,集成大语言模型驱动智能体,构建显式和隐式上下文捕捉信息,经实验验证,该框架在提交解缠任务中性能优于基线,凸显基于大语言模型协作框架的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09149 2026-07-14 cs.LG cs.AI cs.MA 版本更新 85%

Enabling Agents to Communicate Entirely in Latent Space

使智能体能够在潜在空间中完全交流

Zhuoyun Du, Runze Wang, Huiyu Bai, Zouying Cao, Xiaoyong Zhu, Yu Cheng, Bo Zheng, Wei Chen, Haochao Ying

机构 * State Key Lab of CAD&CG(CAD与CG国家重点实验室) Future Living Lab of Alibaba(阿里巴巴未来生活实验室) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江医学影像人工智能重点实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Interlat方法,通过利用LLM的连续隐藏状态实现智能体间的潜在空间通信,实验表明其在跨异构模型中表现优异,提升了推理速度并保持性能。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09962 2026-07-14 cs.RO 新提交 85%

Task Planning for Mobile Manipulation in Retail Stores using Foundation Models with Iterative Re-planning

使用具有迭代重新规划的基础模型进行零售商店中的移动操作任务规划

Vismay Vakharia, Sanjana Garai, Rolif Lima, Nijil George, Vighnesh Vatsal, Kaushik Das

机构 * TCS Research, Tata Consultancy Services Ltd.(塔塔咨询服务公司TCS研究院)

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究零售场景补货问题,利用大语言模型和视觉语言模型,结合定制移动操作平台、用户驱动提示及反馈迭代重新规划方法纠错,在模拟环境验证端到端系统,为零售自动化提供了新的任务规划方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09756 2026-07-14 cs.RO 新提交 85%

LLM-Centric Agentic AI for UAV Swarms: Architecture, Enabling Technologies, and Open Problems

用于无人机群的以大语言模型为中心的智能体人工智能:架构、使能技术及开放问题

Yousef Emami, Rahim Taheri, Mohammadhossein Homaei, Muhammad Atif Ur Rehman, Mohammad Shojafar

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对无人机群实际部署受限问题,提出以大语言模型为中心的智能体人工智能LAUS,回顾相关使能技术,分析威胁,确定包括抗幻觉推理等在内的开放研究挑战。

Comments 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09693 2026-07-14 cs.LG cs.AI 新提交 84%

Depth-Entropy Guided Sampling for Training-Free LLM Reasoning

用于无训练语言模型推理的深度熵引导采样

Zibin Meng, Peng Xie, Kani Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在提升无训练语言模型推理能力,提出深度熵引导采样(DEGS)方法,利用逐层熵坍缩作为质量信号,结合序列似然性与深度熵结构,在多个模型和基准测试中达到无训练最优精度,在域外和难题测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16728 2026-07-14 cs.LG 版本更新 83%

The Cost of Reasoning: Chain-of-Thought Induces Overconfidence in Vision-Language Models

推理的成本:链式推理诱导视觉-语言模型的过度自信

Robert Welch, Emir Konuk, Kevin Smith

机构 * KTH Royal Institute of Technology, Stockholm, Sweden(皇家理工学院) Science for Life Laboratory, Stockholm, Sweden(生命科学实验室)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 研究发现链式推理会降低视觉-语言模型的不确定性估计质量,主要机制是隐式答案条件化,导致模型过度自信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04673 2026-07-14 cs.AI 版本更新 83%

Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message

木马提示:通过伪造助手消息来破解对话式多模态模型

Wei Duan, Li Qian

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究针对对话式多模态模型的安全漏洞,提出木马提示越狱技术,通过伪造对话历史绕过安全机制,在谷歌Gemini-2.0上实验显示其攻击成功率高于现有方法,揭示对话AI安全缺陷,呼吁转变验证范式。

Comments We stopped working on this idea because we realized that there was a paper submitted before it that took almost identical approach

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11173 2026-07-14 cs.CV 新提交 82%

When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning

当深度以文字表述比图像展示更好用时:用于视觉语言空间推理的深度序数提示

Quynh Vo, Phuc Dao, Cong-Duy Nguyen, Thong Nguyen

机构 * National University of Singapore(新加坡国立大学) Center of AI Research, VinUniversity(文大人工智能研究中心)

专题命中 推理与问题求解 :prompting(title,abstract);language model(abstract)

AI总结 研究视觉语言模型空间推理难题,提出深度序数提示(DOP)方法,该方法无需训练,将单目深度转换为序数文本提示,在伪深度提供可靠排序时可改善空间推理,简单且针对性强,与其他无需训练的深度提示方法有竞争力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11696 2026-07-14 cs.AI 新提交 81%

Think Through a Bottleneck: Hourglass Reasoning for Rigorous Induction

突破瓶颈:用于严格归纳的沙漏推理

Huan Zhu

机构 * Peking University(北京大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型少样本归纳推理能力不足的问题,提出沙漏推理方法,通过在推理阶段强制实现严格上下文隔离,构建符号编码器 - 解码器。实验表明该方法在多基准测试中显著提升准确率,证实收益源于阶段隔离和初始归纳质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11324 2026-07-14 cs.RO cs.AI cs.LG 版本更新 81%

Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

Embodied-R1.5:通过具身基础模型演化物理智能

Yifu Yuan, Yaoting Huang, Xianze Yao, Yutong Li, Shuoheng Zhang, Linqi Han, Pengyi Li, Jiangeng Sun, Wenting Jia, Zhao Zhang, Yuhao Liu, Ruihao Liao, Yucheng Hu, Qiyu Wu, Yuxiao Li, Zibin Dong, Fei Ni, Yan Zheng, Shuyang Gu, Yi Ma, Hongyao Tang, Han Hu, Jianye Hao

机构 * Tianjin University(天津大学) Tencent Hunyuan(腾讯混元)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出统一具身基础模型Embodied-R1.5,通过自动化数据管道和多任务平衡强化学习,在8B参数下实现24项基准中16项最优,并支持微调为VLA模型。

Comments Embodied R1.5 technical report. Project page: https://embodied-r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09714 2026-07-14 cs.SD cs.AI cs.CL eess.AS 版本更新 81%

MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models

MUGEN:评估和改进大型音频-语言模型的多音频理解

Chih-Kai Yang, Yun-Shao Tsai, Yu-Kai Guo, Ping-Le Tsai, Yen-Ting Piao, Hung-Wei Chen, Ting-Lin Hsiao, Yun-Man Hsu, Ke-Han Lu, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 MUGEN通过评估多音频理解能力,揭示了大型音频-语言模型在多音频输入下的性能瓶颈,并通过排列自一致性策略提升了模型的预测准确性。

Comments Interspeech 2026. Project page: https://github.com/danielqwer/MUGEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11615 2026-07-14 cs.SE 新提交 80%

ThinkLog: Leveraging Reasoning for Log Statement Generation

ThinkLog:利用推理进行日志语句生成

Kazuki Kusama, Honglin Shu, Masanari Kondo, Tao Xiao, Yasutaka Kamei

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对现有端到端日志语句生成方法准确性有限的问题,提出ThinkLog,该方法基于LLM,通过将推理融入提示作为少样本示例,引导LLM生成日志语句,在准确率提升15.4%的同时,推理成本约为现有最佳方法的50%。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏