arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 255 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 255 篇

2607.03853 2026-07-07 cs.CV 新提交 50%

CogRad: A Cognitively-Inspired Multi-Agent Framework for Radiology Report Generation

CogRad:一种用于放射学报告生成的受认知启发的多智能体框架

Saif Ur Rehman Khan, Hasaan Maqsood, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

机构 * German Research Center for Artificial Intelligence(德国人工智能研究中心) Intelligentx GmbH(智能X有限公司) Department of Core Informatics, Graduate School of Informatics, Osaka Metropolitan University(大阪城市大学信息科学研究生院核心信息学系)

专题命中 测试时计算 :verifier(abstract)

AI总结 提出受认知启发的多智能体框架CogRad,围绕放射科医生阅读过程的四个阶段构建报告生成,通过多智能体协作提升报告质量,在多个数据集上取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02942 2026-07-07 cs.DC cs.MA 新提交 50%

A Workflow-Aware Serving Layer for Agentic Applications

用于智能应用的工作流感知服务层

Jiayi Qian, Zishen Wan, Hanchen Yang, Chun Tao, Souvik Kundu, Tushar Krishna

专题命中 测试时计算 :verifier(abstract)

AI总结 研究智能AI应用工作流,其介于现有两层之间。提出Dyserve工作流感知服务层填补空白,通过整数线性规划在异构后端池编译节点模型和验证器选择,还可在不同压力水平预求解并动态调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31537 2026-07-01 cs.CV cs.MA 新提交 50%

DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation

DataEvolver: 面向文本丰富图像生成的自我进化多智能体数据构建

Siyu Yan, Yizhen Gao, Yilin Wang, Dongxing Mao, Alex Jinpeng Wang

机构 * Central South University(中南大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 提出DataEvolver,一种自我进化的多智能体框架,通过反馈驱动策略迭代优化数据构建,显著提升文本丰富图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25091 2026-06-25 cs.DC 新提交 50%

Speculation at a Distance: Where Edge-Cloud Speculative Decoding Actually Pays Off

远距离推测:边缘-云推测解码何时真正有效

Yuan Lyu, Bharath Irukulapati, Jaya Prakash Champati

专题命中 测试时计算 :verifier(abstract)

AI总结 本文通过闭式不等式分析分布式推测解码(DSD)在广域网边缘-云通信下的延迟收益,指出其仅在低RTT场景下优于共置SD,并发现多租户容量是DSD的主要优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24525 2026-06-24 cs.CV 新提交 50%

VisCritic: Visual State Comparison as Process Reward for GUI Agents

VisCritic: 视觉状态比较作为GUI智能体的过程奖励

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出VisCritic框架,通过比较操作前后截图在视觉特征空间中的变化来验证GUI智能体动作,结合孪生视觉Transformer和动作感知评判头,无需额外人工标注即可提升多基准测试性能。

Comments 17 pages, 4 figures; ECCV 2026 submission; supplementary material uploaded as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23997 2026-06-24 cs.IR 新提交 50%

ChartWalker: Benchmarking the Cross-Chart RAG Task with Hierarchical Knowledge Graphs

ChartWalker: 跨图表RAG任务的基准测试

Ning Tang, Chenghan Xie, Hanyang Yuan, Yi Li, Renhong Huang, Qian Kou, Xiaofeng Shi, Hua Zhou, Jiarong Xu

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出ChartWalker框架,通过层次化知识图谱和结构感知采样生成跨图表RAG基准,揭示现有方法性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22337 2026-06-24 econ.TH cs.GT econ.GN q-fin.EC 新提交 50%

Theorist Toolbox: Tools for Agent Based LLM-assisted economic theory Research

理论家工具箱:基于智能体的LLM辅助经济理论研究工具

Moran Koren

专题命中 测试时计算 :verifier(abstract)

AI总结 提出一种验证优先的经济理论LLM辅助协议,通过三种可重用方法(单次检查、对抗性证明-验证对、多智能体项目)在等级膨胀的Gans-Kominers特征模型上设计Groves/Pigouvian激励机制的实例验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19684 2026-06-19 cs.CV 新提交 50%

Exploring Multi-Modal Large Language Models and Two-Stage Fine-Tuning for Fashion Image Retrieval

探索多模态大语言模型与两阶段微调在时尚图像检索中的应用

Nguyen Cao Hoang, Hoang Bui Le, Nam Vo Hoang, Trung-Nghia Le

机构 * University of Science, VNU-HCM(胡志明市国家大学下属理科大学) Vietnam National University, Ho Chi Minh(胡志明市国家大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出融合多模态大语言模型(LLaVA)生成属性感知三元组,并采用两阶段微调策略增强对比学习,以解决时尚图像检索中标注数据稀缺和负采样简单的问题。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18550 2026-06-18 cs.CR 新提交 50%

The Gate Is Only as Honest as Its Contracts: ContractGuard for the Contract Layer of Risk-Aware Causal Gating

门仅与其合约一样诚实:面向风险感知因果门控合约层的ContractGuard

Laxmipriya Ganesh Iyer, Rahul Suresh Babu

专题命中 测试时计算 :verifier(abstract)

AI总结 针对工具增强型LLM代理的间接提示注入,提出ContractGuard,通过验证合约完整性(而非风险标签)来防御攻击,在基准测试中实现零注入成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17669 2026-06-17 cs.SD 新提交 50%

DeSRPA: Decoupled Speech Role-Playing Agent via Inference-Time Intervention

DeSRPA: 通过推理时干预的解耦语音角色扮演智能体

Wenqiu Tang, Zhen Wan, Takahiro Komamizu, Ichiro Ide

机构 * Nagoya University(名古屋大学) National Institute of Informatics(国立情报学研究所)

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出DeSRPA框架,通过推理时干预冻结骨干模型,利用双层控制向量机制解耦认知推理与副语言表达,在语音角色扮演中实现个性与情感一致性,超越端到端微调方法。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18121 2026-06-17 cs.MA cs.IT math.IT 新提交 50%

On the Reliability of Networks of AI Agents: Density Evolution, Stopping Sets, and Architecture Optimization

AI代理网络的可靠性:密度演化、停止集与架构优化

Ehsan Aghazadeh, Hossein Pishro-Nik

专题命中 测试时计算 :verifier(abstract)

AI总结 将多代理AI系统建模为稀疏图上的消息传递,扩展LDPC编码的密度演化理论,分析三种擦除失效模式,并证明密度演化定理以预测未解决子声明的渐近比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14723 2026-06-16 cs.CV 新提交 50%

Disagreement-Based Cross-Model Routing for Implicit Video Question Answering

基于分歧的跨模型路由用于隐式视频问答

Durga Sandeep Saluru

机构 * Independent Researcher(独立研究员)

专题命中 测试时计算 :reasoning(abstract)

AI总结 针对隐式视频问答中单模型精度瓶颈和自一致性策略失效问题,提出无标签无训练的分歧驱动跨模型路由方法,将分歧样本路由至第二模型,在ImplicitQA基准上提升平均准确率1.43%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14700 2026-06-15 cs.CV 新提交 50%

RepFusion: Leveraging Multimodal Priors for Denoising in Representation Space

RepFusion:利用多模态先验在表示空间中进行去噪

Xichen Pan, Aashu Singh, Satya Narayan Shukla, Xiangjun Fan, Shlok Kumar Mishra, Saining Xie

机构 * Meta AI New York University(纽约大学)

专题命中 测试时计算 :test-time compute(abstract)

AI总结 提出RepFusion方法,利用多模态大语言模型作为噪声表示编码器,为扩散变压器提供条件信号,在相似推理预算下优于新初始化解码器基线。

Comments Project Page: https://xichenpan.com/repfusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13438 2026-06-12 cs.IR 新提交 50%

CQC-RAG: Robust Retrieval-Augmented Generation via Cross-Query Consistency

CQC-RAG: 通过跨查询一致性实现鲁棒的检索增强生成

Yanjia Sun, Sifan Liu, Jie Shao

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出CQC-RAG框架,通过生成语义等价但句法多样的查询,并基于跨查询一致性评估答案置信度稳定性,有效过滤噪声诱导的幻觉,在开放域问答任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10724 2026-06-10 cs.CR 新提交 50%

Fingerprinting All AI Cluster I/O Without Mutually Trusted Processors

无需互信处理器的所有AI集群I/O指纹识别

Naci Cankaya, Jakub Kryś, Jonathan Ng, Luke Marks, Felix Krückel

专题命中 测试时计算 :verifier(abstract)

AI总结 提出一种通过网络分流器计算哈希来加密承诺进出数据中心所有信息的方法,并设计“安全网关设备”消除隐蔽信道,以实现对AI集群I/O的可验证审计。

详情

展开后加载摘要…

URL PDF HTML 收藏