arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-30 至 2026-04-30 共收录 89 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2510.20956 2026-04-30 cs.CR cs.CL 87%

Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training

自我越狱:语言模型在良性推理训练后可通过推理自行摆脱安全对齐

Zheng-Xin Yong, Stephen H. Bach

机构 * Brown University(布朗大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 研究发现推理语言模型在良性训练后可能通过引入良性假设来规避安全限制,提出通过增加安全推理数据训练可缓解该问题。

Comments Published in The Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25926 2026-04-30 cs.CL cs.IR 86%

MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese

MATH-PT:一个针对欧洲葡萄牙语和巴西葡萄牙语的数学推理基准数据集

Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) Fundação Getulio Vargas(古特曼基金会) Instituto de Telecomunicações(电信研究所) Universidade de Coimbra, CISUC/LASI, DEI(科英布拉大学,CISUC/LASI,DEI) Basque Center for Applied Mathematics(巴斯克应用数学中心)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

AI总结 本文提出MATH-PT数据集,包含1729个欧洲和巴西葡萄牙语数学问题,评估了当前最先进的LLM在数学推理中的表现,发现前沿模型在选择题表现优异,但在涉及图表或开放性问题时性能下降。

Comments Accepted at 17th International Conference on Computational Processing of Portuguese (PROPOR 2026). Open access to dataset repo https://huggingface.co/datasets/tiagoteixeira03/MATH-PT and model outputs https://github.com/deep-spin/math-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11731 2026-04-30 cs.CL 70%

Thinking with Drafting: Optical Decompression via Logical Reconstruction

用草图思考:通过逻辑重建实现光学解压

Jingxuan Wei, Honghao He, Caijun Jia, Siyuan Li, Zheng Sun, Yuhang Xu, Yuanyuan Lin, Linzhuang Sun, Yuchen Wu, Bihui Yu, Xiangxiang Zhang, Cheng Tan

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences 3 ByteDance 4 Westlake University(中国科学院大学 3 字节跳动 4 西湖大学) Key Laboratory of Computing Power Network(计算功率网络重点实验室) Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(信息安全,教育部,山东计算机科学中心(济南国家超级计算中心),齐鲁工业大学(山东省科学院))

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出通过逻辑重建实现光学解压,引入TwD方法,利用领域特定语言作为中间表示,以生成可执行代码的视觉证明,建立视觉生成与逻辑验证的闭环系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10150 2026-04-30 cs.LG cs.AI 62%

Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective

重新思考RLVR中的熵干预:从熵变化视角

Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen

机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Tencent(腾讯) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文从熵变化角度分析RLVR中的熵崩溃问题,提出STEER方法通过理论估计熵变化来调整token权重,有效缓解熵崩溃并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26573 2026-04-30 cs.LG 57%

PAINT: Partial-Solution Adaptive Interpolated Training for Self-Distilled Reasoners

PAINT:部分解适应插值训练用于自蒸馏推理器

Zhiquan Tan, Yinrong Hong

机构 * Tsinghua University(清华大学) Beihang University(北航)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 PAINT通过部分解适应插值训练,在自蒸馏推理器中提升大语言模型的推理能力,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06160 2026-04-30 cs.AI 57%

Student Guides Teacher: Weak-to-Strong Inference via Spectral Orthogonal Exploration

学生指导教师:通过频谱正交探索实现弱到强推断

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Spectral Orthogonal Exploration框架,通过正交探针引入语义异质性推理信号,提升数学推理任务的准确率和采样效率。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16591 2026-04-30 cs.CL 57%

Heterogeneous Adaptive Policy Optimization: Tailoring Optimization to Every Token's Nature

异质自适应策略优化:针对每个token的性质进行定制化优化

Zheng Liu, Mengjie Liu, Siwei Wen, Mengzhang Cai, Bin Cui, Conghui He, Wentao Zhang

机构 * Peking University Shanghai AI Laboratory(北京大学上海人工智能实验室) Beihang University(北京航空航天大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University Zhongguancun Academy, 5 Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京大学中关村学院,5北京软件硬件协同人工智能系统重点实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出HAPO算法,通过熵度量异质性指导优化,实现细粒度调节。算法包含四个核心组件,通过token级处理提升LLM在数学推理、代码和逻辑任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 6 篇

2409.12059 2026-04-30 cs.CL cs.AI cs.LG 82%

MeTHanol: Modularized Thinking Language Models with Intermediate Layer Thinking, Decoding and Bootstrapping Reasoning

MeTHanol:模块化思维语言模型与中间层思维、解码与推理bootstrap

Ningyuan Xi, Xiaoyu Wang, Yetao Wu, Teng Chen, Qingqing Gu, Yue Zhao, Jinxian Qu, Zhonglin Jiang, Yong Chen, Luo Ji

机构 * Beihang University(北航) Beijing Institute of Technology(北京理工大学) Geely AI Lab(吉利人工智能实验室)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MeTHanol模块化思维语言模型,通过中间层思维解码与双阶段推理提升LLM的认知能力,实验表明其在理论思维和 vignette 任务中表现出色,能规划、反思并生成类人回答。

Comments 19 pages, 7 figures. IJCNN2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06002 2026-04-30 cs.AI cs.CL cs.IR 81%

Deterministic Legal Agents: A Canonical Primitive API for Auditable Reasoning over Temporal Knowledge Graphs

确定性法律代理:用于可审计时间知识图谱推理的规范性原始API

Hudson de Martim

机构 * Federal Senate of Brazil(巴西联邦议会)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SAT-Graph API,通过确定性符号子系统与概率语言模型交互,实现法律领域可审计的时间知识图谱推理,将单次检索生成改为主动推理-行动-观察流程。

Comments Substantially revised version consolidating the paper as a formal SAT-Graph API specification: clarifies Probability Isolation and post-anchoring determinism, broadens semantic anchoring to open and thematic legal queries, refines the data models and temporal primitives, and strengthens the use cases, limitations, and bibliography

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06635 2026-04-30 cs.LG 79%

Graph Property Inference in Small Language Models: Effects of Representation and Reasoning Strategy

在小型语言模型中进行图属性推断:表示与推理策略的影响

Michal Podstawski

机构 * NASK National Research Institute, Warsaw, Poland(波兰华沙国家研究 institute)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.LG

AI总结 研究探讨了小型指令微调语言模型在图属性推断中的表现,发现输入表示和推理策略显著影响结果,未经过微调的模型在估计图属性时存在系统性误差,但通过改进表示和推理设计可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22750 2026-04-30 cs.CL cs.AI cs.CY cs.HC cs.SE 62%

How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks

AI代理如何花费你的钱?分析和预测代理编码任务中的令牌消耗

Longju Bai, Zhemin Huang, Xingyao Wang, Jiao Sun, Rada Mihalcea, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学) All Hands AI Google Deepmind(谷歌DeepMind) Microsoft AI(微软AI) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了代理编码任务中令牌消耗模式,发现代理任务消耗远高于代码推理和代码聊天,且模型在任务执行前难以准确预测自身令牌使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25236 2026-04-30 cs.AI cs.LG eess.SP 62%

Networks of Causal Abstractions: A Sheaf-theoretic Framework

因果抽象网络:一种她夫理论框架

Gabriele D'Acunto, Paolo Di Lorenzo, Sergio Barbarossa

机构 * DIET Sapienza University of Rome(Sapienza罗马大学DIET)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出因果抽象网络(CAN)框架,通过她夫理论统一多个上下文依赖因果机制模型,解决分布式智能体间因果视角协调问题,实现因果学习与推理。

Comments Major changes: added convergence proof for CK diffusion dynamics; clarified relation with our prior work arXiv:2602.02623, removing substantial overlap; shortened background

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21272 2026-04-30 cs.CR cs.SE 50%

LLM-Powered Detection of Price Manipulation in DeFi

基于大语言模型的去中心化金融中价格操纵检测

Lu Liu, Wuqi Zhang, Lili Wei, Hao Guan, Yongqiang Tian, Yepang Liu, Shing-Chi Cheung

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出PMDetector框架,结合静态分析与大语言模型推理,主动检测DeFi中的价格操纵漏洞,通过三阶段流程提升检测精度与召回率,实验表明其在效率和成本上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 7 篇

2604.26521 2026-04-30 cs.AI cs.CV cs.LG cs.LO 81%

Grounding vs. Compositionality: On the Non-Complementarity of Reasoning in Neuro-Symbolic Systems

基础性与组成性:神经符号系统中推理非互补性研究

Mahnoor Shahid, Hannes Rothe

机构 * Place-Beyond-Bytes

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究指出神经符号系统中组成性推理并非符号 grounding 的副产品,通过 iLTN 实验证明仅依赖 grounding 无法实现泛化,联合训练 grounding 与推理可提升零样本准确性。

Comments Accepted at AAAI MAKE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26053 2026-04-30 cs.LO cs.MA 71%

I Would If I Could: Reasoning about Dynamics of Actions in Multi-Agent Systems

若我能的话:多智能体系统中行动动态的推理

Rustam Galimullin, Hermine Grosinger, Munyque Mittelmann

专题命中 逻辑推理 :reasoning(title)

AI总结 本文提出ATL-D和ATEL-D,用于建模智能体行动的动态授予与撤销过程及其对知识的影响,探讨了逻辑表达力、规范系统关系及计算复杂性。

Comments This is an extended version of the paper with the same title that will appear in KR 2026, and which contains a technical appendix with proof details

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18112 2026-04-30 cs.CL cs.MM 70%

Retrieval-Augmented Multimodal Model for Fake News Detection

增强检索的多模态模型用于虚假新闻检测

Yiheng Li, Weihai Lu, Hanyi Yu, Yue Wang

机构 * University of International Business and Economics(国际商务经济大学) Peking University(北京大学) University of Southern California(南加州大学) Upstart Holdings, Inc.(Upstart Holdings公司)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出RAMM模型,通过多模态大语言模型和抽象叙述对齐模块,解决虚假新闻检测中跨实例叙述一致性缺失和领域知识不足的问题,实验验证了其有效性。

Comments Accepted to SIGIR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26522 2026-04-30 cs.AI cs.LG cs.LO cs.MA cs.SC 62%

AGEL-Comp: A Neuro-Symbolic Framework for Compositional Generalization in Interactive Agents

AGEL-Comp: 一种用于交互智能体组合泛化能力的神经符号框架

Mahnoor Shahid, Hannes Rothe

机构 * Universität Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AGEL-Comp通过动态因果程序图、归纳逻辑编程引擎和混合推理核心,实现基于符号和神经网络的组合泛化学习,优于纯LLM模型。

Comments Accepted at IntelliSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08373 2026-04-30 cs.AI cs.LG 62%

Grounding Generative Planners in Verifiable Logic: A Hybrid Architecture for Trustworthy Embodied AI

基于可验证逻辑的生成规划器:一种可信具身AI的混合架构

Feiyu Wu, Xu Zheng, Yue Qu, Zhuocheng Wang, Zicheng Feng, Hui Li

机构 * School of Cyber Engineering, Xidian University(电子科技大学信息工程学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VIRF框架,通过逻辑导师与LLM的对话机制实现主动协作,提升具身AI的安全性与可靠性,实验显示其在家庭安全任务中表现优异。

Comments Accepted to ICLR 2026. Project page. https://openreview.net/forum?id=wb05ver1k8&noteId=v1Ax8CwI71

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26340 2026-04-30 cs.LG 57%

Adaptive and Fine-grained Module-wise Expert Pruning for Efficient LoRA-MoE Fine-Tuning

自适应和细粒度模块级专家剪枝用于高效的LoRA-MoE微调

Weihang Li, Jianchun Liu, Hongli Xu

机构 * School of Computer Science and Technology, University of Science and Technology of China, China(计算机科学与技术学院,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China, China(苏州先进研究院,中国科学技术大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DMEP框架,通过动态模块级专家剪枝优化LoRA-MoE微调,减少冗余参数并提升训练效率,实验表明在多个推理基准上参数减少35%-43%,训练吞吐量提升约10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03467 2026-04-30 cs.AI cs.HC 57%

The Dual Role of Abstracting over the Irrelevant in Symbolic Explanations: Cognitive Effort vs. Understanding

抽象在符号解释中的双重作用:认知努力与理解

Zeynep G. Saribatur, Johannes Langer, Ute Schmid

机构 * Institute of Logic and Computation, TU Wien(逻辑与计算研究所,维也纳技术大学) Cognitive Systems, University of Bamberg(认知系统,巴姆伯格大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨形式抽象(去除与聚类)对人类推理表现和认知努力的影响,发现聚类提升理解,去除降低认知负担,支持抽象增强人中心符号解释的假设。

Comments To appear in the Proceedings of the 48th Annual Meeting of the Cognitive Science Society (CogSci 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 21 篇

2603.15262 2026-04-30 cs.AI 83%

Probe-then-Plan: Environment-Aware Planning for Industrial E-commerce Search

探测-然后规划:面向工业电商搜索的环境感知规划

Mengxiang Chen, Zhouwei Zhai, Jin Li

机构 * JD.com Beijing China(京东北京中国)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出环境感知搜索规划(EASP),通过探测-规划机制解决电商搜索中盲点与延迟的矛盾,通过离线数据合成、规划器训练和在线服务适应性路由提升搜索相关召回率和UCVR、GMV。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26781 2026-04-30 cs.CV 78%

Virtual-reality based patient-specific simulation of spine surgical procedures: A fast, highly automated and high-fidelity system for surgical education and planning

基于虚拟现实的患者特异性脊柱手术模拟:一种快速、高度自动化和高保真的系统,用于手术教育和规划

Raj Kumar Ranabhat, Tayler D Ross, Tony Jiao, Jeremie Larouche, Joel Finkelstein, Michael Hardisty

机构 * Holland Bone and Joint Program, Sunnybrook Research Institute(霍尔德骨科与关节程序,圣布鲁诺研究学院) Division of Spine Surgery, Sunnybrook Health Sciences Centre(脊柱外科部,圣布鲁诺健康科学中心) Division of Orthopaedic Surgery, Department of Surgery, University of Toronto(骨科部,外科部,多伦多大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出利用AI和计算机视觉生成患者特异性脊柱减压模拟,通过多模态融合和分割技术提高建模精度,提升手术教育和规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26569 2026-04-30 cs.RO 78%

LLM-Flax : Generalizable Robotic Task Planning via Neuro-Symbolic Approaches with Large Language Models

LLM-Flax:通过大规模语言模型的神经符号方法实现通用机器人任务规划

Seongmin Kim, Daegyu Lee

机构 * Department of Physical AI Engineering(物理人工智能工程系) Faculty of Department of Advanced Defense Technology and Industry(高级国防技术与产业学院)

专题命中 规划推理 :planning(title);self-correction(abstract)

AI总结 LLM-Flax通过神经符号方法实现通用机器人任务规划,利用本地部署的大语言模型,无需手动编写规则或训练数据,三个阶段框架显著提升了任务规划效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25602 2026-04-30 cs.AI 70%

OxyGent: Making Multi-Agent Systems Modular, Observable, and Evolvable via Oxy Abstraction

OxyGent:通过Oxy抽象使多智能体系统模块化、可观察和可进化

Junxing Hu, Tianlong Li, Lei Yu, Ai Han

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 OxyGent通过Oxy抽象和OxyBank引擎,实现多智能体系统的模块化、可观察性和可进化性,通过统一抽象和动态规划提升可扩展性和可观测性,实验证明其在复杂工业环境中的鲁棒性和可扩展性。

Comments 10 pages, 10 figures, ACL 2026 System Demonstration track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26630 2026-04-30 cs.CL 70%

SAGE: A Strategy-Aware Graph-Enhanced Generation Framework For Online Counseling

SAGE:一种面向在线咨询的策略感知图增强生成框架

Eliya Naomi Aharon, Meytal Grimland, Avi Segal, Loona Ben Dayan, Inbar Shenfeld, Yossi Levi Belz, Kobi Gal

机构 * Ben-Gurion University of the Negev(贝叶特·沙瓦大学) University of Haifa(海法大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 SAGE通过整合心理框架和实时压力信号,提升在线咨询的策略预测与响应质量,为高风险危机咨询提供决策支持工具。

Comments Full version of the work accepted as a short paper at the 34th ACM Conference on User Modeling, Adaptation and Personalization (UMAP '26). 9 pages, 4 figures, 5 tables

Journal ref Proceedings of the 34th ACM Conference on User Modeling, Adaptation and Personalization (UMAP '26), June 08--11, 2026, Gothenburg, Sweden

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26275 2026-04-30 cs.SE 67%

Agentic AI in the Software Development Lifecycle: Architecture, Empirical Evidence, and the Reshaping of Software Engineering

软件开发生命周期中的代理AI:架构、实证证据与软件工程的重塑

Happy Bhati

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文探讨代理AI在软件开发生命周期中的应用,提出六层参考架构,分析代理SDLC与传统SDLC的差异,并通过实证数据展示其在性能、生产力和劳动力市场的影响。

Comments 9 pages, 5 figures, 2 tables, survey paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22063 2026-04-30 cs.LG cs.AI 62%

Reliability Auditing for Downstream LLM tasks in Psychiatry: LLM-Generated Hospitalization Risk Scores

精神科下游LLM任务中的可靠性审计:LLM生成的住院风险评分

Shevya Panda, Shinjini Bose, Ananya Joshi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了LLM在精神科住院风险评分中的可靠性问题,通过合成患者数据评估提示设计和非临床信息对预测稳定性的影响,揭示了非临床信息对模型输出的显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23163 2026-04-30 cs.AI cs.CL cs.CR cs.IT cs.MA math.IT 62%

A Decision-Theoretic Formalisation of Steganography With Applications to LLM Monitoring

基于决策理论的隐写术形式化及其在大语言模型监控中的应用

Usman Anwar, Julianna Piskorz, David D. Baek, David Africa, Jim Weatherall, Max Tegmark, Christian Schroeder de Witt, Mihaela van der Schaar, David Krueger

机构 * University of Cambridge(剑桥大学) Massachusetts Institute of Technology(麻省理工学院) UK AI Safety Institute(英国人工智能安全研究所) University of Oxford(牛津大学) Mila, University of Montreal(蒙特利尔大学米尔人工智能实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出决策理论视角下的隐写术形式化方法,通过通用V-信息量定义隐写差距,用于检测和缓解大语言模型中的隐写推理行为。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26501 2026-04-30 cs.CL cs.AI cs.HC 62%

Tree-of-Text: A Tree-based Prompting Framework for Table-to-Text Generation in the Sports Domain

树-文本:一种基于树的提示框架,用于体育领域中的表格到文本生成

Shang-Hsuan Chiang, Tsan-Tsung Yang, An-Zi Yen, Wen-Chih Peng

机构 * National Yang Ming Chiao Tung University

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Tree-of-Text框架,通过三阶段生成过程提升表格到文本生成的精度与效率,在多个体育数据集上表现优异。

Comments Accepted by ACL SRW 2025: Long Paper (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26235 2026-04-30 cs.CR cs.AI cs.CL 62%

LATTICE: Evaluating Decision Support Utility of Crypto Agents

LATTICE:评估加密代理决策支持效用的基准

Aaron Chan, Tengfei Li, Tianyi Xiao, Angela Chen, Junyi Du, Xiang Ren

机构 * Sahara AI University of Southern California(南加州大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LATTICE基准,用于评估加密代理在真实用户场景中的决策支持能力,通过六个评估维度、16种任务类型和LLM评委,实现大规模可扩展评估,揭示不同代理在决策支持质量上的显著差异及权衡。

Comments 15 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏