arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-29 至 2026-07-29 共收录 36 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 36 篇

2607.24892 2026-07-29 cs.LG cs.AI 新提交 93%

LLM as Forecasting Planner: Training-Free Text Conditioning for Time-Series Foundation Models

大语言模型作为预测规划器:时间序列基础模型的免训练文本条件设定

Huu Hiep Nguyen, Dung Nguyen, Minh Hoang Nguyen, Dai Do, Hung Le

机构 * Deakin University(迪肯大学) Applied Artificial Intelligence Initiative(应用人工智能倡议)

专题命中 推理与问题求解 :LLM(title,summary_cn);foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究文本条件时间序列预测问题,核心方法是将预测设为TSFM生成轨迹上的规划问题,以冻结TSFM为模拟器、LLM为策略和价值函数,实例化\rc{}框架,主要贡献是通过实验证明该框架能带来持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10282 2026-07-29 cs.LG 版本更新 92%

Linear-LLM-SCM: Benchmarking LLMs for Coefficient Elicitation in Linear-Gaussian Causal Models

线性-LLM-SCM:用于线性高斯因果模型系数提取的LLM基准测试

Kanta Yamaoka, Sumantrak Mukherjee, Thomas Gärtner, David Antony Selby, Stefan Konigorski, Eyke Hüllermeier, Viktor Bengs, Sebastian Josef Vollmer

机构 * Data Science and its Applications, German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心数据科学与应用部门) Dept. of Computer Science, University of Kaiserslautern–Landau (RPTU)(科隆-兰道大学计算机科学系) Digital Health - Machine Learning Research Group, Hasso Plattner Institute for Digital Engineering(哈索·普朗纳研究所数字工程学院数字健康-机器学习研究组) Institute of Informatics, University of Munich (LMU)(慕尼黑大学信息学院) Hasso Plattner Institute for Digital Health at Mount Sinai, Icahn School of Medicine at Mount Sinai(西奈山医学院哈索·普朗纳研究所数字健康中心) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出线性-LLM-SCM框架,用于评估LLM在连续域中对线性高斯因果模型参数化的表现,揭示了LLM在定量因果推理中的局限性。

Comments [v2] Accepted at Workshop on Structured Data for Health@ICML 2026 Seoul,South Korea. 19 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24765 2026-07-29 cs.CL cs.AI cs.HC 新提交 88%

Measuring and Improving Behavioral Consistency in Large Language Models through Fact-Heuristic-Emotion State Enforcement

通过事实-启发式-情感状态强制来测量和提高大语言模型中的行为一致性

Gi-Hun Lee, Joong Yull Park

机构 * School of Mechanical Engineering, Chung-Ang University(韩国中央大学机械工程学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型行为一致性,通过认知内核模型CKM强制模型在决策前区分事实、假设和评估信号,经多实验评估发现其可降低输出变异性、减少决策翻转率,证明行为一致性可测且能部分改善。

Comments 40 pages, 6 figures; 54-page supplementary material included as an ancillary file. Code, prompts, and data: https://github.com/TeenyToolSoftware/cogos-behavioral-consistency

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24957 2026-07-29 cs.CV 新提交 88%

PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models

感知基准:评估多模态大语言模型中的原子视觉感知

Zichao Lin, Yifeng Xie, Bowen Qu, Haiming Wang, Jia Li, Haoning Wu, Yuhao Dong, Zuhao Yang, Jinguo Zhu, Haoyu Lu, Zijia Zhao, Tongtian Yue, Zhangyang Qi, Junwei Yang, Mengfan Dong, Peizhou Cao, Chenzhuang Du, Zaida Zhou, Haotian Yao, Hao Yang, Hongcheng Gao, Lin Sui, Weihong Li, Xinxing Zu, Jia Chen, Yao Wang, Xiaoxue Wu, Yalin Wang, Y. Charles, Yiping Bao, Yangyang Liu, Zhiqi Huang, Xinyu Zhou

机构 * Moonshot AI(登月人工智能)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 介绍用于评估多模态大语言模型原子视觉感知能力的PerceptionBench基准,通过自下而上方法构建错误分类法及相关问题,测试16个前沿模型,发现原子感知待解决,该基准为衡量MLLM视觉感知边界提供标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00344 2026-07-29 cs.CL 版本更新 87%

PilotRL: Training Language Model Agents via Global Planning-Guided Progressive Reinforcement Learning

PilotRL: 通过全局规划引导的渐进式强化学习训练语言模型代理

Keer Lu, Chong Chen, Bin Cui, Yunhuai Liu, Wentao Zhang

机构 * Peking University(北京大学) Huawei Cloud BU(华为云业务部)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 PilotRL通过全局规划引导的渐进式强化学习训练语言模型代理,提升长周期决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25996 2026-07-29 cs.SE 新提交 87%

RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models

RepoReasoner:评估长上下文语言模型的仓库级代码推理能力

Yanlin Wang, Suiquan Wang, Yanli Wang, Bowen Zhang, Daya Guo, Jiachi Chen, Zibin Zheng

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 研究针对现有代码推理基准测试局限,引入RepoReasoner评估仓库级代码推理,通过多阶段管道构建基准,评估输出预测和调用链预测能力,发现当前LLMs在仓库级推理存在局限,为未来相关研究提供方向。

Comments Published in FSE'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25947 2026-07-29 cs.AI cs.CL 新提交 86%

A Cost-Effective Multimodal LLM Reasoning Framework for Question Answering over Irregular Clinical Time Series

一种用于不规则临床时间序列问答的经济高效多模态大语言模型推理框架

Frank Nie, Ethan B Liu, Yuan Zhu, Wei Fan, Jindong Han

机构 * Shandong University(山东大学) University of Auckland(奥克兰大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对不规则临床时间序列问答,提出ClinPRISM框架。该框架含不规则感知多尺度编码器、时间证据蒸馏器和渐进对齐策略,通过构建训练数据,在40亿参数大语言模型主干上实现最优性能,兼具低时间序列令牌数和低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24789 2026-07-29 cs.IR cs.CV cs.LG cs.MM 新提交 85%

NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model

NEXT:通过视觉语言模型进行推理驱动的视频推荐

Yuming Liu, Hongye Yang, Harrison Zhao, Ellie Zhu, Bokai Cao, Lei Huang, Lizhu Zhang, Xiangjun Fan

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究提出推理驱动的视频推荐框架NEXT,通过对用户已观看视频推理推断其下一个意图来检索后续视频。训练NEXT-8B视觉语言模型,在DocVQA性能上表现出色,在特定评估中提升下一个意图逻辑质量,部署后带来生产收益,证明其可作为实用推理引擎。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24964 2026-07-29 cs.CR 新提交 85%

ALIBI: Adaptive Agentic Attacks on LLM-Based Vulnerability Detectors via Adversarial Code Comments

ALIBI:通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击

Zixuan Wu, Cristina Nita-Rotaru

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究如何通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击,提出ALIBI框架,将现实世界漏洞修复提交转换为编码任务评估多个检测器,发现其高度易受攻击,揭示攻击面并推动安全意识设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03881 2026-07-29 cs.CY cs.AI cs.HC 版本更新 83%

LLM-generated personalized nudges for improving pro-environmental behavior: Field evidence from resource conservation

利用大型语言模型的迭代个性化增强行为提示:一项关于电力和热水节约的实地实验

Zonghan Li, Yi Liu, Chunyan Wang, Song Tong, Kaiping Peng, Feng Ji

机构 * School of Environment, Tsinghua University(清华大学环境学院) Department of Applied Psychology and Human Development, University of Toronto(多伦多大学应用心理学与人类发展系) State Key Laboratory of Regional Environment and Sustainability, Tsinghua University(清华大学区域环境与可持续性国家重点实验室) Department of Psychology, Beijing Normal University at Zhuhai(北京师范大学珠海校区心理学系) Department of Psychology and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本研究利用大型语言模型实现迭代个性化,通过实地实验发现其在促进节能方面效果显著,且在前两轮干预中表现更优,但热水节约效果较弱且随时间减弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25145 2026-07-29 quant-ph cs.AI 新提交 81%

Agentic AI for Scientific Reasoning in Autonomous Quantum Sensing Experiments

用于自主量子传感实验中科学推理的智能体人工智能

Takuya Isogawa, Ryotaro Okabe, Nutdech Phadetsuwannukun, Mingda Li, Paola Cappellaro

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究围绕大语言模型智能体实现用于金刚石中NV中心自主实验的智能体人工智能工作流程,主要贡献为展示自主实验流程,引入离线基准评估智能体推理,结果表明自主实验中智能体与代码分工明确,智能体负责假设和数据评估,代码控制硬件与执行安全约束。

Comments 11 pages, 4 figures + Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25408 2026-07-29 cs.AI 新提交 79%

Context Assembly as the Controlled Variable: A Control-Theoretic View of Harness Policies for Frozen LLM Agents

作为受控变量的上下文组装:冻结大语言模型智能体利用策略的控制理论视角

Debjyoti Paul

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 研究聚焦大语言模型智能体,以往控制工具选择等,本文将上下文组装视为受控变量,通过上下文博弈或强化学习策略在线学习,进行形式分解、稳定性论证及不确定性校准分析,给出控制理论视角的相关证据。

Comments 6 pages, 2 figures, 1 table. Code and companion paper's data: https://github.com/dpaul0501/context-optimization-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01862 2026-07-29 cs.MA cs.AI cs.NI 版本更新 77%

RadioMaster: Multi-Agent System for Autonomous Radio Signal Generation

RadioMaster: 自主无线电信号生成的多智能体系统

Jiazhen Lei, Yuxin Sha, Tianze Cao, Sihan Wang, Bingbing Wang, Zeming Yang, Fengyuan Zhu, Xiaohua Tian

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RadioMaster,一个全自主的多智能体框架,通过RadioWiki、RadioAgent和RadioEmulator三大支柱,将用户意图转化为真实无线信号,解决现有模型因领域知识和硬件约束敏感性不足而无法生成无线电信号的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16780 2026-07-29 cs.IR cs.AI cs.HC 版本更新 77%

Comparing RAG and GraphRAG for Page-Level Retrieval Question Answering on a Math Textbook

比较RAG和GraphRAG在数学教科书页面级检索问答中的应用

Eason Chen, Chuangji Li, Eric Li, Zimo Xiao, Jionghao Lin, Kenneth R. Koedinger

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究在本科数学教科书页面级问答中比较RAG和GraphRAG,用477个问答对数据集在检索准确率和答案质量两指标上对比五个RAG模型、BM25基线及GraphRAG,发现基于嵌入的RAG更优,还通过开源模型复制实验,为AI辅导系统设计提供参考。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03595 2026-07-29 cs.AI cs.CL 版本更新 76%

Controllable LLM Reasoning via Sparse Autoencoder-Based Steering

通过稀疏自编码器基于的转向实现可控的大语言模型推理

Yi Fang, Wenjie Wang, Mingfeng Xue, Boyi Deng, Fengli Xu, Dayiheng Liu, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.CL、cs.AI

AI总结 本文提出SAE-Steering方法,通过稀疏自编码器分解隐藏状态,实现对大语言模型推理策略的高效控制,提升推理准确率和灵活性。

Comments Accepted to the ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25993 2026-07-29 cs.CV 新提交 75%

Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

超越缩放:学习用于超高分辨率遥感的多工具视觉推理

Fengxiang Wang, Jiangnan Huang, Mingshuo Chen, Yueying Li, Yang Shi, Junwei Luo, Haoyu Wang, Yansheng Li, Jing Zhang, Haiyan Zhao, Wenjing Yang

机构 * National University of Defense Technology(国防科技大学) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract)

AI总结 针对超高分辨率遥感图像给多模态大语言模型带来的挑战,提出GeoMTVR数据集,结合监督微调与以工具注意力为重点的强化学习算法开发GeoLens,实验证明其在多工具视觉推理方面优于直接推理和单工具放大基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24779 2026-07-29 cs.AI cs.LG 新提交 73%

HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising

HOBA:用于自适应在线广告的分层策略性投标代理

Ji Wu, Yunshan Peng, Wentao Bai, Yunke Bai, Wenzheng Shu, Jinan Pang, Yanxiang Zeng, Xialong Liu

机构 * Kuaishou Technology(快手科技)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对在线广告投标系统问题,提出 HOBA 分层强化学习框架,在三个时间尺度解耦相关环节,通过实验验证其优于现有基线,大规模在线部署实现目标成本提升 3.6%,证明该范式有效。

Comments 10pages,accepted by KDD 2026 ads track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07395 2026-07-29 cs.CV cs.AI cs.LG 版本更新 73%

When Prompts Ignore Structure: Graph-Based Attribute Reasoning for Calibrated VLMs

当提示忽略结构时:基于图的属性推理用于校准视觉语言模型

Tanay Sodha, Aditya Sharma, Ramya Hebbalaguppe, Vinti Agarwal, Pranav Murthy Yeluripaty

机构 * Birla Institute of Technology and Science, Pilani(贝拉科技与科学学院皮拉尼分校) TCS Research(塔塔咨询服务公司研究院)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型测试时自适应中可靠置信度估计问题,提出ARGTCA方法,将(类,属性)对表示为符号属性图节点,用对比目标训练图注意力网络,引入两种属性选择策略,实验证明该方法能有效降低校准误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25124 2026-07-29 cs.HC 新提交 71%

UrbanTrace: LLM-Assisted Discovery and Semantics-Aware Integration of Spatial Data

UrbanTrace:基于大语言模型的空间数据发现与语义感知集成

Sonia Castelo, Eden Wu, Joao Rulff, Harish Doraiswamy, Juliana Freire, Claudio Silva

专题命中 推理与问题求解 :LLM(title)

AI总结 研究针对城市决策中异构空间数据整合问题,提出UrbanTrace视觉分析系统,利用离线分析器结合大语言模型,通过三个交互式视图实现有效空间聚合,经评估在数据发现上表现优异,将空间聚合敏感性转化为视觉资产。

Comments 11 pages, 7 figures. Accepted to IEEE VIS 2026 (Full Papers Track). Author's version accepted for publication in IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25537 2026-07-29 cs.CV cs.AI 新提交 70%

Visual prompt engineering for video models

视频模型的视觉提示工程

Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer, Neha Kalibhat, Zi Wang, Mani Malek, Oyvind Tafjord, Kevin Swersky, Been Kim, Priyank Jaini

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 研究视频模型能否从视觉提示工程中受益,通过自动修改任务图像提升性能,如视觉物理推理任务。发现视觉提示工程(VIPE)能提高视频推理性能,比传统方法更有效,为提升视频模型视觉推理性能提供简单高效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24991 2026-07-29 cs.SE cs.AI 新提交 70%

Preliminary Guidelines for Using and Evaluating GenAI Tools to Support Systematic Literature Reviews

使用和评估生成式人工智能工具以支持系统文献综述的初步指南

Barbara Kitchenham, Sebastián Pizard, Lech Madeyski, Ronnie de Souza Santos, Martin Shepperd, David Budgen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨如何用GenAI支持系统文献综述,通过快速审查、思想实验等方法,识别评估GenAI用于SLRs的问题及过程要点,形成GUEST建议,助研究人员利用GenAI开展可靠综述与评估研究,强调其需人工监督及能提供成本效益帮助。

Comments 58 pages, 2 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24833 2026-07-29 cs.AI 新提交 70%

AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning

AdaKP:面向推理强化学习的在线自适应知识点选择

Zibin Meng, Zhenyu Zhao, Chunqiang Run

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对强化学习在竞赛级数学中奖励稀疏问题,提出AdaKP在线自适应知识点选择方法,通过熵代理评分,结合三种机制及验证门,改进标准训练器,在竞赛数学基准上优于静态选择基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25881 2026-07-29 cs.CL astro-ph.CO astro-ph.IM cs.HC gr-qc 新提交 70%

AI's Capability in Assisting Scientific Research in Physics, Astrophysics, and Cosmology II: Project Planning and Proposal Evaluation

人工智能在协助物理、天体物理和宇宙学科学研究中的能力II:项目规划与提案评估

Jia Liu, Veena Krishnaraj, Kateryna Vovk, Kosuke Aizawa, Adrian E. Bayer, Linda Blot, Jessica Cowell, Suyog Garg, Jonathan Grée, Anamaria Hell, Ben Horowitz, Masaya Ichikawa, Kanyuni Iemoto, Keigo Kondo, Zacharie Lorsin, Kevin McCarthy, Jamie Robinson, Miguel Ruiz-Granda, Leander Thiele, Ievgen Vovk, Mingshen Zhou

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型在科学项目规划与提案评估中的作用,人类和三个当代模型生成计划,再由人类与前沿模型盲评,结果显示当前模型能产出类似人工的计划,但人工智能评审员更青睐人工智能生成的提案,部署时需谨慎。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13454 2026-07-29 cs.CV cs.AI 版本更新 70%

GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding

GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解

Hao Li, Han Fang, Zixin Pan, Xin Wei, Hongbo Sun, Jinglin Xu, Zhiyu Lin, Ye Yuan, Zhongjiang He, Yu Yu, Hao Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对从2D图像理解3D空间关系的挑战,提出GeoAnchor框架,通过分解3D空间信息为互补组件并结合协作训练策略,实现动态可解释推理,在复杂3D推理任务中优于现有技术。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15753 2026-07-29 cs.AI 版本更新 70%

RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought

RoboPIN: 基于锚定思维链的具身推理

Yaoting Huang, Yifu Yuan, Linqi Han, Chengwen Li, Shuoheng Zhang, Xianze Yao, Hongyao Tang, Yan Zheng, Jianye Hao

机构 * Tianjin University(天津大学)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出Pinned Chain-of-Thought (PinCoT)推理范式,通过结构化视觉锚点绑定实体,解决多步推理中实体引用漂移和视觉解耦问题;训练4B参数模型在14个基准上平均超越最强7B基线12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15050 2026-07-29 cs.CL 版本更新 70%

Beyond Factual Accuracy: Evaluating Global Reasoning Integrity in RAG Systems with LogicScore

超越事实准确性:使用逻辑得分评估RAG系统中的全球推理完整性

Zhichao Yan, Yunxiao Zhao, Jiapu Wang, Jiaoyan Chen, Xiaoli Li, Ru Li, Jeff Z. Pan

机构 * Shanxi University(山西大学) Nanjing University of Science and Technology(南京理工大学) University of Manchester(曼彻斯特大学) Singapore University of Technology and Design(新加坡科技设计大学) University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出LogicScore,通过全局推理审查弥补RAG系统在长文本生成中逻辑完整性不足的问题,揭示模型在事实准确性高但全局推理质量差的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05580 2026-07-29 cs.AI 版本更新 70%

AlphaCrafter: Harnessing Multi-Agent Workflows for Cross-Sectional Quantitative Trading

AlphaCrafter:一个跨截面量化交易的全栈多智能体框架

Yishuo Yuan, Jiayi Sheng, Sirui Zeng, Jiaqi Wang, Jiaheng Liu

机构 * Nanjing University(南京大学)

专题命中 推理与问题求解 :LLM(abstract_cn);foundation model(abstract);分类 cs.AI

AI总结 AlphaCrafter通过连续适应的因子到执行管道,整合因子发现、制度适应选择和风险约束执行,实现跨截面量化交易的鲁棒性能。

Comments Submitted to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25825 2026-07-29 cs.MA 新提交 67%

CHILL-Harness: Counterfactual Harness Learning for Efficient Reasoning in Long-Horizon Agents

CHILL-Harness:用于长期智能体高效推理的反事实控制学习

Jiarun Fu, Lizhong Ding, Sida Chen, Honglei Xin, Chunhui Zhang, Pengqi Li, Qiuning Wei, Ye Yuan, Guoren Wang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究长期智能体控制中因依赖固定策略导致效率低的问题,提出CHILL-Harness方法,通过因果干预效应学习和优势实现因果编排,结合成功保留目标与约束,在多任务实验中减少消耗与时间,保持或提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25182 2026-07-29 cs.CL cs.AI cs.IR 新提交 62%

TabRank: Chain-of-Thought Distillation for Table Re-Rankers

TabRank:表格重排器的思维链蒸馏

Adarsh Singh, Kushal Raj Bhandari, Jianxi Gao, Soham Dan, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Rensselaer Polytechnic Institute(伦斯勒理工学院) Scale AI

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对表格检索训练推理重排器的问题,提出TabRank框架,通过构建数据集并探索两种训练紧凑推理模型的变体,经压力测试,该方法在多表格检索数据集上显著提升性能,有效推广到多表格推理。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24984 2026-07-29 physics.geo-ph cs.AI cs.LG 新提交 62%

Automatic Knowledge Graph Construction and Query for Earthquake Catalogs

地震目录的自动知识图谱构建与查询

Yuxin Zhou, Huai Zhang, S. Mostafa Mousavi

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究针对地震目录中开放性问题解答受限的情况,应用GraphRAG直接处理原始表格记录,构建可查询知识图谱,经评估改进并识别陷阱,提供实用查询接口,确保结果准确可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏