arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-27 至 2026-03-27 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 9 篇

2507.16507 2026-03-27 cs.AI cs.IR 79%

Agentic RAG with Knowledge Graphs for Complex Multi-Hop Reasoning in Real-World Applications

具有知识图谱的代理RAG用于现实世界应用中的复杂多跳推理

Jean Lelong, Adnane Errazine, Annabelle Blangero

机构 * Ekimetrics

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 INRAExplorer通过多工具架构和知识图谱实现复杂多跳推理,提升专业领域知识交互能力。

Comments ECAI 2025 demo track, 4 pages

Journal ref ECAI 2025, Frontiers in Artificial Intelligence and Applications, vol. 413, pp. 5163-5166, IOS Press

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24877 2026-03-27 cs.HC cs.AI 74%

More Than "Means to an End": Supporting Reasoning with Transparently Designed AI Data Science Processes

不止是‘手段’:通过透明设计的AI数据科学过程支持推理

Venkatesh Sivaraman, Patrick Vossler, Adam Perer, Julian Hong, Jean Feng

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

AI总结 本文探讨了医疗领域中两个AI数据科学系统如何通过透明设计的中间产物促进推理,强调了中间产物在帮助用户分析选择和改进问题中的关键作用。

Comments Accepted to Workshop on Tools for Thought at CHI'26: Understanding, Protecting, and Augmenting Human Cognition with Generative AI - From Vision to Implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16889 2026-03-27 cs.CL 70%

Can GRPO Boost Complex Multimodal Table Understanding?

GRPO能否提升复杂多模态表格理解?

Xiaoqiang Kang, Shengen Wu, Zimu Wang, Yilin Liu, Xiaobo Jin, Kaizhu Huang, Wei Wang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) University of Southern California(南加州大学) Duke Kunshan University(杜克大学昆山分校)

专题命中 复杂问题求解 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。

Comments EMNLP 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13303 2026-03-27 cs.CV 67%

ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement

ShowTable:通过协作反思与精炼解锁创意表格可视化

Zhihang Liu, Xiaoyi Bao, Pandeng Li, Junjie Zhou, Zhaohe Liao, Yefei He, Kaixun Jiang, Chen-Wei Xie, Yun Zheng, Hongtao Xie

机构 * USTC(中国科学技术大学) CASIA(中国科学院自动化研究所) NJU(南京大学) SJTU(上海交通大学) ZJU(浙江大学) FDU(福建师范大学) Tongyi Lab(通义实验室)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract)

AI总结 本文提出ShowTable框架,结合大语言模型与扩散模型,通过逐步自我纠正过程实现创意表格可视化,引入TableVisBench基准测试,展示其在多模态推理、生成和纠错方面的优势。

Comments Accepted to CVPR 2026, project page: https://lntzm.github.io/showtable-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25697 2026-03-27 cs.SE cs.AI 57%

The Kitchen Loop: User-Spec-Driven Development for a Self-Evolving Codebase

厨房循环:用户驱动的自演化代码库开发

Yannick Roy

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 本文提出厨房循环框架,通过统一信任模型实现自主演化软件,包含规范表面、用户模拟、不可战胜测试和漂移控制,验证两个生产系统285+次迭代,产生1,094+合并请求且无回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25176 2026-03-27 cs.CL 57%

Prompt Attack Detection with LLM-as-a-Judge and Mixture-of-Models

基于LLM-as-a-Judge和混合模型的提示攻击检测

Hieu Xuan Le, Benjamin Goh, Quy Anh Tang

机构 * GovTech, Singapore(新加坡政府科技局)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨轻量级通用LLM在真实生产环境中作为安全判断者的可靠性,通过结构化推理过程检测提示攻击,实验表明Gemini-2.0-Flash-Lite-001等模型可有效用于实时防护,同时评估混合模型对攻击检测的提升效果。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03370 2026-03-27 cs.CL 57%

EQ-Negotiator: Dynamic Emotional Personas Empower Small Language Models for Edge-Deployable Credit Negotiation

EQ-Negotiator:动态情感人格赋能小型语言模型进行边缘部署的信用谈判

Yunbo Long, Yuhan Liu, Alexandra Brintrup

机构 * Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院) Department of Engineering, University of Cambridge(剑桥大学工程系) The Alan Turing Institute, London, UK(伦敦阿尔法顿研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出EQ-Negotiator框架,通过整合博弈论与隐马尔可夫模型,使小型语言模型具备动态情感人格,提升边缘设备上的信用谈判效率与道德标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06790 2026-03-27 cs.LG 57%

Get RICH or Die Scaling: Profitably Trading Inference Compute for Robustness

获取鲁棒性或死亡扩展:通过推理计算获利地进行鲁棒性交易

Tavish McDonald, Bo Lei, Stanislav Fort, Bhavya Kailkhura, Brian Bartoldson

机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Independent Researcher(独立研究者)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 研究探讨了推理计算与模型鲁棒性之间的关系,发现初始鲁棒性足以使模型遵循指令时,推理计算能提升对抗鲁棒性,通过强化视觉编码器可进一步增强模型的鲁棒性。

Comments 23 pages

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12200 2026-03-27 cs.CV 50%

CompBench: Benchmarking Complex Instruction-guided Image Editing

CompBench:复杂指令引导图像编辑的基准测试

Bohan Jia, Wenxuan Huang, Yuntian Tang, Junbo Qiao, Jincheng Liao, Shaosheng Cao, Fei Zhao, Zhaopeng Feng, Zhouhong Gu, Zhenfei Yin, Lei Bai, Wanli Ouyang, Lin Chen, Fei Zhao, Yao Hu, Zihan Wang, Yuan Xie, Shaohui Lin

机构 * East China Normal University(华东师范大学) Xiaohongshu Inc.(小红书) KLATASDS, MOE, China(中国教育部统计与数据科学重点实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Fudan University(复旦大学) University of Oxford(牛津大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 CompBench旨在解决现有图像编辑基准测试对任务复杂度简化的问题,通过引入复杂指令引导的图像编辑基准,评估模型在精细操控能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏