arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-29 至 2026-07-29 共收录 103 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 20 篇

2607.24829 2026-07-29 cs.IR cs.LG 新提交 57%

Improving Rare Medication Recommendation with Counterfactual Data Augmentation and Large Language Models

通过反事实数据增强和大语言模型改进罕见药物推荐

Shinhwan Kang, Soo Yong Lee, Jaewon Kim, Kijung Shin, Buru Chang

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 针对现有方法在推荐罕见药物时性能低的问题,提出GenRxR框架,利用大语言模型生成反事实数据缓解数据稀缺,集成大语言模型建模联合推荐药物关系,经指令调整增强临床推理,实验显示其性能优于多个基线。

Comments Accepted for publication at the 20th ACM Conference on Recommender Systems (RecSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24783 2026-07-29 cs.AI 新提交 57%

Unified Semantic Modeling Framework for Large-Scale Job Understanding at LinkedIn

领英大规模职位理解的统一语义建模框架

Dan Xu, Baofen Zheng, Jianqiang Shen, Qi Xiao, Benjamin Hoan Le, Wen Pu, Saurabh Gupta, Ran Zhou, Neha Saraf, Alice Leung, Qianqi Shen, Liangjie Hong, Jingwei Wu, Wenjing Zhang

机构 * LinkedIn Corporation(领英公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 领英为应对职位理解系统构建挑战,提出统一语义建模框架。先微调小型语言模型,再引入多适配器架构。经离线评估和在线A/B测试,该框架提升了性能、降低了复杂性,为构建行业规模文本理解系统提供实用见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24759 2026-07-29 cs.AI cs.CY cs.DL 新提交 57%

Beyond Memory: A Templated Substrate for Heterogeneous Collaborative Knowledge Work with LLM Agents

超越记忆:一种用于异构协作知识工作的带大语言模型代理的模板化基础架构

Priscila Saboia Moreira, Christopher R. Sweet

机构 * University of Notre Dame(圣母大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究指出知识工作成果难传承,大语言模型代理无持久记忆。提出llm-wiki-memory-template,它是异构协作知识工作基础架构,沿多人类、多代理、多领域三个轴,通过案例研究展示其能保留失败路径等,解决负面结果丢失问题。

Comments 15 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24236 2026-07-29 cs.CL 版本更新 57%

CAGE: Cognitive Attribution Graphs for Faithful Inline Citation Generation in Long-Form Question Answering

CAGE:用于长格式问答中忠实内联引用生成的认知归因图

Zhichao Yan, Shizhao Li, Jiapu Wang, Haoran Luo, Qingang Zhang, Jiaoyan Chen, Ru Li, Jeff Z. Pan

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 长格式问答中存在引用不足以支持主张的问题,CAGE提出两阶段框架,先训练认知图归纳模型构建支持子图,再用结构化引用推理模型生成对齐引用,实验证明该方法有效并实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22690 2026-07-29 cs.AI 版本更新 57%

LazyMem: Retrieve Broadly, Construct Selectively for Efficient Long-Term Agent Memory

LazyMem:广泛检索,按需构建以实现高效长期智能体记忆

Jing Yu, Yibo Zhao, Jiaming Zhang, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,华东师范大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体长期记忆中原始对话历史的问题,提出LazyMem方法,将记忆构建推迟到查询时,通过轻量级模型处理候选池,经特定训练方式,在基准测试中取得高准确率,减少记忆令牌数和延迟。

Comments 29 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05811 2026-07-29 cs.AI 版本更新 57%

Sheet As Token: A Graph-Enhanced Representation for Multi-Sheet Spreadsheet Understanding

表格作为标记:一种增强图的多表表格理解表示

Yiming Lei, Yuhang Yao, Yujia Zhang, Yiqi Wang, Bo Guan, Depei Zhu, Chunhui Wang, Zhuonan Hao, Tianyu Shi

机构 * Effyic Technology Co., Ltd(Effyic技术有限公司) McGill University(麦吉尔大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Sheet as Token框架,通过图增强方法将每个工作表视为统一语义单元,提升多表表格检索能力,实验表明图增强的跨表推理在有限计算下优于浅层图基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27720 2026-07-29 cs.AI 版本更新 57%

Why Does Grounding Hurt Medical VQA? Benchmarking, Diagnosis, and Fine-Tuning of Vision-Language Models

对前沿视觉-语言模型进行审计以实现可信的医学视觉问答:定位失败、格式崩溃和领域适应

Xupeng Chen, Binbin Shi, Chenqian Le, Qifu Yin, Lang Lin, Haowei Ni, Ran Gong, Panfeng Li

机构 * New York University, New York, USA(纽约大学) Tsinghua University, Beijing, China(清华大学) Columbia University, New York, USA(哥伦比亚大学) University of Michigan, Ann Arbor, USA(密歇根大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文审计了五种前沿视觉-语言模型在医学视觉问答中的表现,发现定位失败和格式崩溃是信任瓶颈,通过领域适应可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10282 2026-07-29 cs.LG 版本更新 57%

Linear-LLM-SCM: Benchmarking LLMs for Coefficient Elicitation in Linear-Gaussian Causal Models

线性-LLM-SCM:用于线性高斯因果模型系数提取的LLM基准测试

Kanta Yamaoka, Sumantrak Mukherjee, Thomas Gärtner, David Antony Selby, Stefan Konigorski, Eyke Hüllermeier, Viktor Bengs, Sebastian Josef Vollmer

机构 * Data Science and its Applications, German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心数据科学与应用部门) Dept. of Computer Science, University of Kaiserslautern–Landau (RPTU)(科隆-兰道大学计算机科学系) Digital Health - Machine Learning Research Group, Hasso Plattner Institute for Digital Engineering(哈索·普朗纳研究所数字工程学院数字健康-机器学习研究组) Institute of Informatics, University of Munich (LMU)(慕尼黑大学信息学院) Hasso Plattner Institute for Digital Health at Mount Sinai, Icahn School of Medicine at Mount Sinai(西奈山医学院哈索·普朗纳研究所数字健康中心) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出线性-LLM-SCM框架,用于评估LLM在连续域中对线性高斯因果模型参数化的表现,揭示了LLM在定量因果推理中的局限性。

Comments [v2] Accepted at Workshop on Structured Data for Health@ICML 2026 Seoul,South Korea. 19 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17351 2026-07-29 cs.CL 版本更新 57%

Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers

语言模型的物理:第4.1部分,架构设计与Canon层的魔力

Zeyuan Allen-Zhu

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出Canon层,通过轻量级架构组件提升语言模型的推理深度和广度,验证了其在不同架构中的有效性,并展示了其在学术预训练中的潜力。

Comments V1.1 appeared in NeurIPS 2025 main conference; V2 adds GDN experiments, tightens others for a stronger, fairer comparison, and reorganizes sections; V3 adds Result 2.1 and Section 5.2 on how Canon layers improve hierarchical feature learning, from our Jan 2026 talk

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25936 2026-07-29 cs.CR 新提交 50%

From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs

从角色提示到无限思考:利用角色条件进行大语言模型推理成本攻击

Zhiyi Mou, Wangze Ni, Tianfang Xiao, Haoyang LI, Chen Jason Zhang, Hanzhi Ma, Yang Bai, Zhibo Wang, Kui Ren

专题命中 其他推理 :reasoning(abstract)

AI总结 研究LLMs推理成本问题,提出RolePlay框架利用角色条件诱导低效行为放大推理成本,实验证明该框架优于现有方法,为LLM推理效率攻击提供新视角。

Comments 17pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25792 2026-07-29 cs.NI 新提交 50%

The Model in the Middle: Toward AI-Native Real-Time Communication

中间的模型:迈向人工智能原生实时通信

Ziqian Liu, Minghao Li, Yiming Qiu

专题命中 其他推理 :reasoning(abstract)

AI总结 研究迈向人工智能原生实时通信,提出将模型视为有状态计算中间盒的新观点,探索网络感知推理调度等三个跨阶段协调机会,构建Conflux验证,结果显示在网络退化时响应延迟等有改善,呼吁建立相关实时通信堆栈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24964 2026-07-29 cs.CR 新提交 50%

ALIBI: Adaptive Agentic Attacks on LLM-Based Vulnerability Detectors via Adversarial Code Comments

ALIBI:通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击

Zixuan Wu, Cristina Nita-Rotaru

专题命中 其他推理 :reasoning(abstract)

AI总结 研究如何通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击,提出ALIBI框架,将现实世界漏洞修复提交转换为编码任务评估多个检测器,发现其高度易受攻击,揭示攻击面并推动安全意识设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09181 2026-07-29 cs.DB 版本更新 50%

Evaluating the Practical Effectiveness of LLM-Driven Index Tuning on Microsoft SQL Server

评估基于大语言模型的索引优化的实用性效果:微软数据库优化顾问

Xiaoying Wang, Wentao Wu, Vivek Narasayya, Surajit Chaudhuri

专题命中 其他推理 :reasoning(abstract)

AI总结 本文通过工业基准和真实企业工作负载评估LLM驱动的索引优化效果,对比微软数据库优化顾问(DTA),发现LLM在部分情况下能提供更优执行时间配置,但生产环境中应用仍面临性能波动、集成影响和验证成本等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏