arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-12 至 2026-06-12 共收录 117 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 16 篇

2510.05430 2026-06-12 cs.RO 版本更新 50%

Active Semantic Perception

主动语义感知

Huayi Tang, Pratik Chaudhari

机构 * General Robotics, Automation, Sensing and Perception (GRASP) Laboratory(通用机器人、自动化、传感与感知实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出一种基于紧凑多层场景图和大语言模型的主动语义感知方法,用于高效探索未知环境,在仿真和真实机器人上验证了优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 8 篇

2606.13603 2026-06-12 cs.LG cs.AI cs.CL 新提交 90%

Beyond the Commitment Boundary: Probing Epiphenomenal Chain-of-Thought in Large Reasoning Models

超越承诺边界:探究大型推理模型中的附带思维链

Daniel Scalena, Sara Candussio, Luca Bortolussi, Elisabetta Fersini, Malvina Nissim, Gabriele Sarti

机构 * CLCG, University of Groningen(格罗宁根大学CLCG) University of Milano-Bicocca(米兰-布雷拉大学) University of Trieste(特里耶大学) Khoury College of Computer Sciences, Northeastern University(东北大学Khoury计算机科学学院)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过早期退出估计思维链步骤的因果重要性,发现推理中存在从瞬态猜测到稳定答案的“承诺边界”,后续步骤为附带现象,可提前退出以缩短推理长度达55%而不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12828 2026-06-12 cs.AI 新提交 70%

Topical Phase Transitions in Artificial Intelligence Research: Large-Scale Evidence and an Early-Warning Signature for Emerging Topics

人工智能研究中的主题相变:大规模证据与新兴主题的早期预警信号

Rasul Khanbayov, Hasan Kurban

机构 * College of Science and Engineering(科学与工程学院) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Doha, Qatar(卡塔尔多哈)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 通过分析2017-2025年五大AI会议论文,发现AI主题通过“相变”方式突然爆发,并基于早期预警信号识别未来需关注的主题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08794 2026-06-12 cs.LG cs.CL 版本更新 62%

One Token to Fool LLM-as-a-Judge

一个令牌就能欺骗LLM裁判

Yulai Zhao, Haolin Liu, Dian Yu, Sunyuan Kung, Meijia Chen, Haitao Mi, Dong Yu

机构 * Princeton University(普林斯顿大学) University of Virginia(弗吉尼亚大学) Tencent AI Lab(腾讯人工智能实验室) Rutgers University(罗格斯大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 发现基于参考的生成式奖励模型易受奖励黑客攻击,表面输入(如非词符号或通用推理开头)能持续引发假阳性奖励,提出使用截断模型输出作为对抗性负例的数据增强策略,构建鲁棒的Master奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12507 2026-06-12 cs.LG 新提交 57%

Rubric-Guided Self-Distillation: Post-Training Without Rubric Verifiers

基于评分标准的自蒸馏:无需评分标准验证器的后训练

MohammadHossein Rezaei, Anas Mahmoud, Zihao Wang, Utkarsh Tyagi, Advait Gosai, Razvan-Gabriel Dumitru, Aakash Sabharwal, Bing Liu, Yunzhong He

机构 * Scale AI

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 提出RGSD方法,通过将评分标准作为条件蒸馏到学生模型,无需验证器即可实现密集逐令牌学习,在医学和科学领域达到与基于评判的GRPO相当的评分标准满足率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26940 2026-06-12 cs.CL 版本更新 57%

Select to Think: Unlocking SLM Potential with Local Sufficiency

Select to Think: 利用局部充分性解锁小语言模型潜力

Wenxuan Ye, Yangyang Zhang, Xueli An, Georg Carle, Yunpu Ma

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 提出Select to Think (S2T)方法,通过将大语言模型角色从生成转为选择,并蒸馏选择逻辑到小语言模型,使其在推理时无需依赖大模型,显著提升性能。

Comments Accepted to ICML 2026. Code is available at https://github.com/YeRona/Select-to-Think

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13438 2026-06-12 cs.IR 新提交 50%

CQC-RAG: Robust Retrieval-Augmented Generation via Cross-Query Consistency

CQC-RAG: 通过跨查询一致性实现鲁棒的检索增强生成

Yanjia Sun, Sifan Liu, Jie Shao

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出CQC-RAG框架,通过生成语义等价但句法多样的查询,并基于跨查询一致性评估答案置信度稳定性,有效过滤噪声诱导的幻觉,在开放域问答任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25787 2026-06-12 cs.CV 版本更新 50%

Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking

自进化视觉语言模型用于图像质量评估:基于投票与排序

Wen Wen, Tianwu Zhi, Kanglong Fan, Yang Li, Xinge Peng, Yabin Zhang, Yiting Liao, Junlin Li, Li Zhang

机构 * City University of Hong Kong(香港城市大学) ByteDance Inc.(字节跳动公司)

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出EvoQuality框架,通过自一致性生成伪标签,利用群体相对策略优化迭代提升VLM的图像质量感知能力,无监督下在多个IQA基准上超越监督方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21561 2026-06-12 cs.CV 版本更新 50%

Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning

通过逐步偏好调优的多模态智能体迭代工具使用探索

Pengxiang Li, Zhi Gao, Bofei Zhang, Yapeng Mi, Xiaojian Ma, Chenrui Shi, Tao Yuan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 提出SPORT方法,通过任务合成、步骤采样、步骤验证和偏好调优的迭代循环,使多模态智能体无需预收集数据即可自主探索和优化工具使用策略,在GTA和GAIA基准上分别提升6.41%和3.64%。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 10 篇

2604.27960 2026-06-12 cs.AI 版本更新 88%

LLMs as ASP Programmers: Self-Correction Enables Task-Agnostic Nonmonotonic Reasoning

LLMs 作为 ASP 程序员:自我纠正实现任务无关的非单调推理

Adam Ishay, Joohyung Lee

机构 * Arizona State University(亚利桑那州立大学) Samsung Research(三星研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(title,abstract);分类 cs.AI

AI总结 提出 LLM+ASP 框架,通过自我纠正循环将自然语言转化为回答集程序,实现无需任务特定工程的非单调推理,在多个基准上优于 SMT 方法。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13649 2026-06-12 cs.CL cs.LG 新提交 88%

Operadic consistency: a label-free signal for compositional reasoning failures in LLMs

Operadic一致性:LLM中组合推理失败的无标签信号

Nathaniel Bottman, Yinhong Liu, Kyle Richardson

机构 * Incubilate University of Cambridge(剑桥大学) Allen Institute for Artificial Intelligence(艾伦人工智能研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 提出Operadic一致性(OC)作为检测大语言模型组合推理失败的无标签信号,在四个多跳QA数据集上与准确率强相关(Pearson r≥0.86),优于自一致性等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13233 2026-06-12 cs.LG cs.AI 新提交 81%

ReSET: Accurate Latency-Critical NVFP4 Reasoning via Step-Aware Temperature Scaling

ReSET: 通过步骤感知温度缩放实现精确的延迟关键型NVFP4推理

Sihwa Lee, Janghwan Lee, Donghoon Yoo, Jae Gon Kim, Hanyul Ryu, Soojung Ryu, Jungwook Choi

机构 * Hanyang University(汉阳大学) Xenoscube Korean Inc.(Xenoscube韩国公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对大型推理模型在NVFP4低精度推理中精度下降和延迟问题,提出基于推理步骤熵的温度缩放方法ReSET,并设计CUDA小M核,在多个基准上提升精度约2点,解码速度提升2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13634 2026-06-12 cs.CL math.CT 新提交 79%

Operads for compositional reasoning in LLMs

用于LLM组合推理的Operad框架

Nathaniel Bottman, Kyle Richardson

机构 * Allen Institute for Artificial Intelligence(人工智能研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出operad作为问题分解的数学框架,定义问题operad Q,将QA模型解释为Q上的代数,并引入operadic一致性度量,实验表明该度量与准确性强相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18307 2026-06-12 cs.CL 版本更新 79%

Reasoning Models Know What's Important, and Encode It in Their Activations

推理模型知道什么重要,并在其激活中编码

Yaniv Nikankin, Martin Tutek, Tomer Ashuach, Jonathan Rosenfeld, Yonatan Belinkov

机构 * Technion(技术离子大学) University of Zagreb, FER(扎格雷布大学,FER) MIT(麻省理工学院) Kempner Institute, Harvard(哈佛大学凯普纳研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 通过分析模型激活而非仅依赖推理链文本,发现激活能更有效识别关键推理步骤,且模型在生成后续步骤前已内部编码步骤重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12479 2026-06-12 cs.LG cs.AI 新提交 62%

ReCal: Reward Calibration for RL-based LLM Routing

ReCal: 基于强化学习的LLM路由的奖励校准

Qihang Yu, Hanwen Tong, Zhengqi Zhang, Bo Zheng, Feng Wei, Shengyu Zhang, Zemin Liu, Fei Wu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出ReCal框架,通过分层奖励分解和分布感知优化校准奖励信号,解决多目标冲突和异质性任务优化偏差,提升LLM路由性能与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13663 2026-06-12 cs.CL 新提交 57%

HyperTool: Beyond Step-Wise Tool Calls for Tool-Augmented Agents

HyperTool:超越逐步工具调用的工具增强型智能体

Yaxin Du, Yifan Zhou, Yujie Ge, Jiajun Wang, Xianghe Pang, Shuo Tang, Tuney Zheng, Bryan Dai, Jian Yang, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) IQuest Research Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 针对工具增强型LLM中逐步调用导致执行粒度不匹配的问题,提出HyperTool统一可执行接口,将确定性工具子流程折叠为单次调用,在多步工具任务上显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13262 2026-06-12 cs.AI 新提交 57%

From Verdict to Process: Agentic Reinforcement Learning for Multi-Stage Fact Verification

从判决到过程:面向多阶段事实核查的智能体强化学习

Rongxin Yang, Shenghong He, Siyuan Zhu, Chao Yu

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出ProFact框架,通过智能体强化学习端到端优化多阶段事实核查流程,引入过程感知奖励解决稀疏延迟监督问题,提升验证性能和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21570 2026-06-12 cs.AI cs.RO 版本更新 57%

From Digital to Physical: Digital Agents as Autonomous Coaches for Physical Intelligence

从数字到物理:数字代理作为物理智能的自主教练

Zixing Lei, Genjia Liu, Yuanshuo Zhang, Qipeng Liu, Yuzhu Cai, Sixiang Chen, Jixian Wu, Yunhong Wang, Weixin Li, Chuan Wen, Bo Zhao, Shanghang Zhang, Wenzhao Lian, Siheng Chen

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Zhongguancun Academy, Beijing, China(中关村学院) School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai, China(上海交通大学集成电路学院) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院多媒体信息处理国家重点实验室)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 提出EmboCoach-Bench基准,评估LLM代理自主设计具身策略的能力,通过迭代调试和优化,代理在平均成功率上超越人工基线26.5%,并具备自我修正能力。

Comments 53 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13450 2026-06-12 eess.AS cs.SD 新提交 50%

Endpoint Anticipation for Low-Latency Spoken Dialogue

低延迟口语对话的端点预测

Sathvik Udupa, Shinji Watanabe, Petr Schwarz, Jan Cernocky

机构 * Brno University of Technology(布拉格技术大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出端点预测方法,通过提前预测对话结束信号实现低延迟,在部分上下文中投机执行LLM和TTS流水线,平均延迟降低505毫秒。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 28 篇

2606.13171 2026-06-12 cs.CL cs.AI 新提交 94%

NTS-CoT: Mitigating Hallucinations in LLM-based News Timeline Summarization with Chain-of-Thought Reasoning

NTS-CoT: 基于思维链推理减轻大模型新闻时间线摘要中的幻觉

Feng Lyu, Huiqin Yan, Sijing Duan, Hao Wu, Shuang Gu, Xue Qiao, Weixu Zhang, Haolun Wu

机构 * Central South University(中南大学) Tsinghua University(清华大学) Nanjing University(南京大学) Suzhou Aerospace Information Research Institute(苏州空天信息研究院) McGill University(麦吉尔大学)

专题命中 推理评测 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大模型在新闻时间线摘要中产生内容不忠实和信息遗漏两类幻觉,提出NTS-CoT框架,通过元素思维链、日期选择和因果思维链三个模块有效缓解幻觉,在三个基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12608 2026-06-12 cs.CL cs.LG 新提交 84%

Shopping Reasoning Bench: An Expert-Authored Benchmark for Multi-Turn Conversational Shopping Assistants

购物推理基准:面向多轮对话购物助手的专家编写基准

Shuxian Fan, Seonwoo Min, Youna Hu, Botao Xia, Jayakrishnan Unnikrishnan, Rowan Musselmann, Yifan Gao, Qingyu Yin, Priyanka Nigam, Bing Yin

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出一个由零售专家编写的525个任务的多轮对话购物推理基准,包含10863个加权评分标准,评估9个模型显示通过率仅57-77%,多轮任务性能下降4-18分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13192 2026-06-12 cs.AI 新提交 83%

Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach

基于多模态大语言模型的移动用户体验推理:任务、基准与方法

Ruichao Mao, Zhou Fang, Teng Guo, Hao Yang, Yaping Li, Shaohua Peng, Maji Huang, Xiaoyu Lin, Shuoyang Liu, Xuepeng Li, Yuyu Zhang, Hai Rao

机构 * Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出UXBench基准(2000个VQA样本)评估多模态大模型在UI推理上的能力,并设计UI-UX模型,通过奖励路由和不对称过渡奖励机制在UXBench上达到0.7963准确率,超越Claude-4.5-Sonnet。

Comments 10 pages, 6 figures, Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10403 2026-06-12 cs.CL 新提交 83%

KCSAT-ML: Probing Reasoning Models with Nationwide-Cohort Human Difficulty

KCSAT-ML: 用全国队列人类难度探测推理模型

Sanghee Park, Geewook Kim, Kee-Eung Kim

机构 * NAVER Cloud AI(NAVER云AI) KAIST AI(韩国科学技术院人工智能系)

专题命中 推理评测 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL

AI总结 提出KCSAT-ML基准(含664道韩国高考数学题及339道带官方错误率的核心题)和难度对齐推理增益(DRG)指标,揭示视觉语言模型在人类高错误率题目上准确率崩溃、测试时缩放非单调以及同一模型族内反缩放与过度思考并存的现象。

Comments 18 pages, 14 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14367 2026-06-12 cs.CL cs.AI cs.IR cs.LG 版本更新 82%

InnoEval: On Research Idea Evaluation as a Knowledge-Grounded, Multi-Perspective Reasoning Problem

InnoEval:将研究思路评估视为基于知识的多视角推理问题

Shuofei Qiao, Yunxiang Wei, Xuehai Wang, Bin Wu, Boyang Xue, Ningyu Zhang, Hossein A. Rahmani, Yanshan Wang, Qiang Zhang, Keyan Ding, Jeff Z. Pan, Huajun Chen, Emine Yilmaz

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出InnoEval框架,通过异构深度知识检索和多视角评审委员会,实现基于知识的多维度解耦评估,在点对点、成对和分组评估任务中优于基线方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13220 2026-06-12 cs.AI cs.CE cs.ET cs.LG cs.MA 新提交 81%

LLM-as-an-Investigator: Evidence-First Reasoning for Robust Interactive Problem Diagnosis

LLM作为调查员:基于证据优先的鲁棒交互式问题诊断

Fabrizio Marozzo, Pietro Liò

机构 * University of Calabria(卡拉布里亚大学) University of Cambridge(剑桥大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出证据优先的AI方法LLM-as-an-Investigator,通过估计问题歧义、生成假设、提问澄清并更新概率,避免过早接受用户假设,提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12767 2026-06-12 cs.AI 新提交 79%

Constructing Evaluation Datasets for Procedural Reasoning: Balancing Naturalness, Grounding, and Multi-Hop Coverage

构建程序性推理评估数据集:平衡自然性、基础性和多跳覆盖

Sarah Elshabrawy, Rahul K. Dass, Ashok K. Goel

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究基于任务-方法-知识(TMK)模型的问题生成策略对程序性和多跳推理数据集质量的影响,提出基础性验证框架,发现严格TMK生成策略在基础性和可用性上最优。

Comments 10 pages, 2 numbered figures. Workshop submission to HAIL @ AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12731 2026-06-12 cs.LG cs.CY 新提交 79%

Normative Robustness as a Frontier for Non-Verifiable Reasoning in LLMs

规范性鲁棒性作为LLM中不可验证推理的前沿

Elizaveta Tennant, Benjamin Henke, Anita Keshmirian, Murray Shanahan, Verena Rieser, Kristian Lum, Sydney Levine, Julia Haas

机构 * DeepMind Institute of Philosophy, School of Advanced Study, University of London(伦敦大学高等研究院哲学研究所) Technische Universität Berlin(柏林工业大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 提出道德推理作为不可验证推理的典型子域,定义道德鲁棒性并引入可扩展的多轮对抗评估框架,发现模型会向用户偏好偏移推理(平均6.5%),且受顺序和轮次影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02627 2026-06-12 cs.AI 版本更新 79%

DecompSR: A dataset for decomposed analyses of compositional multihop spatial reasoning

DecompSR:用于组合多跳空间推理分解分析的数据集

Lachlan McPheat, Navdeep Kaur, Robert Blackwell, Alessandra Russo, Anthony G. Cohn, Pranava Madhyastha

机构 * The Alan Turing Institute(艾伦·图灵研究所) Imperial College London(帝国理工学院伦敦分校) The University of Leeds(利兹大学) City St George’s University of London(伦敦城市圣乔治大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出DecompSR数据集(超500万数据点),通过程序化生成独立控制组合性的多个方面(如推理深度、语言变异性),用于细粒度评估大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12657 2026-06-12 cs.AI cs.DB cs.RO 新提交 70%

TrajGenAgent: A Hierarchical LLM Agent for Human Mobility Trajectory Generation

TrajGenAgent: 一种用于人类移动轨迹生成的分层LLM智能体

Siyu Li, Toan Tran, Lingyi Zhao, Khurram Shafique, Li Xiong

机构 * Emory University(埃默里大学) University of Florida(佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出TrajGenAgent,一种无需微调的分层LLM智能体框架,通过编排器-工作者两阶段设计生成真实轨迹,在时空保真度、语义一致性和个体行为真实性上优于现有方法。

Comments 14 pages, 2 figures, 8 tables. Accepted by the 27th IEEE International Conference on Mobile Data Management (MDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12160 2026-06-12 cs.CL 新提交 70%

A Controlled Study of Decoding-Time Truthfulness Methods on Instruction-Tuned LLMs

指令调优大语言模型解码时真实性方法的受控研究

Ao Sun

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本研究通过分析每层令牌logits特征,提出CHAIR框架检测幻觉,在TruthfulQA和MMLU上显著提升零样本检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏