Monte Carlo Tree Search for Table-to-Multimodal Report Generation
面向表格到多模态报告生成的蒙特卡洛树搜索
专题命中 工具调用 :planning(abstract);分类 cs.AI
AI总结 针对表格到多模态报告生成的现有方法缺陷,本文提出基于MCTS的MCTS-Report框架,通过分解原子动作与多维奖励函数优化,在自建的MMRBench基准上取得优于基线的77.9总体得分。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
面向表格到多模态报告生成的蒙特卡洛树搜索
专题命中 工具调用 :planning(abstract);分类 cs.AI
AI总结 针对表格到多模态报告生成的现有方法缺陷,本文提出基于MCTS的MCTS-Report框架,通过分解原子动作与多维奖励函数优化,在自建的MMRBench基准上取得优于基线的77.9总体得分。
HALT:面向检索增强搜索智能体的感知验证式停止策略
机构 * KAIST(韩国科学技术院)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 该研究针对检索增强搜索智能体的冗余检索问题,提出轻量级感知验证停止策略HALT,在三个多跳QA基准上减少冗余搜索且保持精确匹配,无需修改宿主智能体。
Comments 23 pages, 6 figures. Code: https://github.com/Noverse0/HALT
何时与何地查看:用于高效长视频理解的自适应视觉证据调度
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 提出无需训练的EcoFrame框架,通过熵门控预算调度和注意力引导候选提议实现高效视觉证据调度,在多个长视频理解基准上实现精度与效率的更优权衡。
参数优化:面向大语言模型工具调用的难度分级基准与探测引导训练
专题命中 工具调用 :tool use(abstract);分类 cs.AI
AI总结 针对大语言模型工具调用参数填写关注度不足的问题,提出含PBT和PGR的探测引导框架,发布ParamBench基准,使5个开放模型在多基准上的参数生成平均精确匹配率从19.7%升至59.6%。
Comments 15 pages, 8 figures
CRISP:用于训练高效深度搜索智能体的关键步骤感知
专题命中 工具调用 :tool use(abstract);分类 cs.CL
AI总结 本研究针对深度搜索智能体效率低的问题,提出CRISP框架,通过区分关键与冗余交互优化奖励,在保持准确率的同时,使BrowseComp和HLE-Verified上的交互回合分别减少15.1%和33.2%。
Comments 15 pages, 6 figures
基于几何场的鲁棒双调和蒙皮技术
专题命中 工具调用 :tool use(abstract);分类 cs.LG
AI总结 本文提出一种基于几何场的无网格鲁棒自动蒙皮技术,借助硬件光线追踪实现的拉格朗日表示优化双调和能量,可在开放曲面等现有方法失效的场景生成与最优方法相当的权重,经全面评估验证其有效性。
先获取再探索:面向搜索智能体的持久工作空间上选择与提取解耦
机构 * Renmin University of China(中国人民大学) ; Xiaohongshu Inc.(小红书公司) ; National University of Singapore(新加坡国立大学)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 该研究针对搜索智能体提出Fetch-then-Explore方法,将页面选择与证据提取解耦,在两个基准测试中提升了智能体的搜索性能,核心是通过持久工作空间实现页面复用与证据累积。
CoEvoKG:用自演进搜索智能体协同演进知识图谱
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 CoEvoKG框架将知识图谱作为训练任务源与智能体演进的持久证据记忆,联合训练任务生成器与搜索智能体,形成自演进与知识积累闭环,在六个问答基准上提升了三款骨干模型的准确率。
Comments 10 pages, 4 figures
RL-Lock:用于生成互锁组件的强化学习
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 针对现有互锁组件生成方法依赖手工启发式、难处理复杂案例的问题,研究人员提出强化学习框架RL-Lock,结合结构化动作分块与MCTS学习,高效生成互锁组件,在复杂场景表现更优。
DocNavRAG:面向复杂文档问答的、具有状态化证据构建能力的文档结构化图RAG
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 工具调用 :agentic(abstract);分类 cs.CL
AI总结 本文提出DocNavRAG,将文档结构组织为可导航图并维护证据状态,在四个文档QA基准上,相比最强基线平均提升答案质量7.8%、上下文充分性17.7%。
Comments 19 pages, 5 figures, 16 tables
Search-GRT:面向复杂问答任务优化的搜索智能体引导检索训练
机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城AI中心)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 针对LLM搜索的奖励稀疏问题,提出GRT方法,通过真实信息限制检索过程,在多跳问答等任务上实现超40%性能提升并提高训练效率。
Comments Accepted at Interspeech 2026
面向LLM智能体的实用在线KV缓存压缩:一项实证研究
机构 * UC Santa Barbara(加州大学圣巴巴拉分校) ; LinkedIn(领英公司)
专题命中 工具调用 :agent(abstract);分类 cs.CL
AI总结 该研究针对LLM智能体的KV缓存瓶颈,实证对比了令牌驱逐与注意力匹配两类在线压缩方法,发现延迟压缩可恢复性能,令牌驱逐在代理不完善时更鲁棒,能大幅压缩KV缓存并提升吞吐量。
基于人类反馈的强化学习
机构 * Nathan Lambert(纳瑟恩·拉姆伯特)
专题命中 工具调用 :tool-use(abstract);分类 cs.LG
AI总结 本书系统介绍强化学习从人类反馈的核心方法,涵盖指令微调、奖励模型训练及拒绝采样等关键技术,探讨合成数据与评估中的前沿问题。
Comments 239 pages. Web-native version at https://rlhfbook.com/ Continually improving, latest version at website
AdaVFM:通过LLM引导执行实现边缘智能的自适应视觉基础模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Meta
专题命中 工具调用 :agent(abstract);分类 cs.LG
AI总结 本文提出AdaVFM,一种通过LLM引导执行实现边缘设备上语言对齐视觉基础模型高效推理的自适应框架,通过动态调整计算实现性能与效率的平衡。
增强基于用户反馈的需求优先级确定
专题命中 工具调用 :planning(abstract);分类 cs.SE
AI总结 本文通过增强ReFeed方法,将需求优先级确定从独立实体转向相互关联,提升搜索基于解决方案的效果,实验显示改进方法在实际应用中表现更优。
Comments Revised manuscript submitted to Information and Software Technology
自博弈与技能演化:能提出、解决并记忆的自演化搜索智能体
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 本研究提出SESA智能体,通过任务生成与技能记忆的双向循环协同演化,在7个问答基准上较SSP、SkillRL等基线实现准确率提升,且支持无记忆部署与可选推理检索。
用于增强复杂离散选择任务决策的机器学习方法分析
专题命中 工具调用 :tool use(abstract);分类 cs.LG
AI总结 本研究分析四种机器学习模型在复杂离散选择任务中学习和预测五类选择规则的性能,发现半参数及非参数模型总体优于参数模型,孪生神经网络在能源政策偏好案例中表现最佳。
Comments Published in Decision Analytics Journal, Dec 16 2025
PlantBGC:基于无标签领域自适应与弱监督的植物生物合成基因簇发现Transformer
专题命中 工具调用 :workflow(abstract);分类 cs.LG
AI总结 该研究针对植物BGC标签稀缺问题,提出PlantBGC模型,通过无标签领域自适应与弱监督实现植物BGC的精准发现,提升了已知BGC的恢复率并缩短了基因座长度。
IndustryForge-27B:面向工业CAD的领域增强多模态基础模型
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 该研究构建基于Qwen3.5-VL-27B的IndustryForge-27B多模态基础模型,整合6个工业CAD子语料库训练,在CAD基准测试中性能远超基础模型与GPT-5.4,可作为工业智能体的通用基础。
Comments 14 pages
评估和定价AI生成响应中的广告
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 针对AI生成响应中广告评估与定价的核心挑战,该研究构建智能体模拟框架生成监督,提炼出高效评估器,实现更优的点击意图预测,还推导了最优支付规则并扩展了广告生成的训练目标。
Comments 9 pages, 2 figures
AlphaSchema:探索基于大语言模型(LLM)的阿尔法挖掘的交易语义空间
机构 * X-Tech ; Monash University(莫纳什大学) ; PandaAI(熊猫AI) ; IIIS, Tsinghua University(清华大学智能产业研究院(IIIS))
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 AlphaSchema构建并探索结构化交易语义空间,通过解耦探索与实施、结合代理模型平衡探索与利用,在中国股市挖掘出强预测与投资组合表现的因子池,且对LLM选择具鲁棒性。
Comments Initial Version
为机器人设计知识驱动任务的方法论
机构 * Computer Vision and Aerial Robotics group (CVAR), Centre for Automation and Robotics (CAR) Universidad Politécnica de Madrid (UPM), Madrid, Spain(计算机视觉与空中机器人小组(CVAR)、自动化与机器人中心(CAR)马德里理工大学(UPM)、马德里,西班牙)
专题命中 工具调用 :planning(abstract);分类 cs.AI
AI总结 本文提出了一种基于知识图谱的机器人任务设计方法论,通过在ROS 2系统中实现,提升自主任务的效率和智能性。
Journal ref 2024 7th Iberian Robotics Conference (ROBOT)
PILA:用于大语言模型原生广告的即插即用插入法
专题命中 工具调用 :workflow(abstract);分类 cs.CL
AI总结 研究如何通过自然整合赞助内容实现大语言模型盈利的问题,提出PILA方法,将广告插入重构成条件响应重写问题并解耦为轻量级边车模块,实验证明该方法能在保持回复质量的同时提高广告效果。
提炼时间搜索与推理:通过 harness 辅助的高效数据合成发展用于未来预测的大语言模型
机构 * The Chinese University of Hong Kong(香港中文大学) ; Meituan LongCat Team(美团龙猫团队)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 研究未来事件预测难题,提出时间截断 harness 方法,通过强制时间截断减少时间泄漏与对拒绝采样等的依赖,构建相关语料库和度量标准,经蒸馏实验验证该方法能提升模型表现,将高质量数据转化为模型参数提升。
RESTOR:通过强化学习自动生成RESTful API的测试预言机
专题命中 工具调用 :workflow(abstract);分类 cs.SE
AI总结 针对RESTful API测试中定义可靠测试预言机的挑战,Restor框架利用强化学习,通过数据增强管道微调大语言模型生成测试断言,在工业数据集和生产工作流程中表现出色,提升测试用例采用率并减少人工QA工作。
Comments Accepted to ISSTA 2026. 22 pages, 8 figures, 2 tables
计算营养中统计支持的大语言模型成分与食谱数据收集
专题命中 工具调用 :workflow(abstract);分类 cs.AI
AI总结 研究针对计算营养中成分数据问题,提出结合统计估计、不变性检查和网络获取的大语言模型管道。通过该管道可获取精确数据,在参考集上实现高匹配度并大幅降低误差,将大语言模型辅助数据库构建变为可控流程。
HarnessLLM:使用大语言模型生成Rust验证框架
专题命中 工具调用 :workflow(abstract);分类 cs.SE
AI总结 研究针对Rust代码内存安全验证开发验证框架难的问题,提出HarnessLLM自动化工作流程,利用大语言模型从测试套件生成框架,经实验评估效果良好,能检测内存安全漏洞,是首个用大语言模型为Rust项目内存安全验证生成框架的工作。
通过自主语言智能体进行个性化推荐工具学习
机构 * Microsoft(微软公司)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 研究针对基于大语言模型的智能体在推荐系统中的局限性,提出PRTA框架,让LLM作中央规划器与多推荐模型交互,负责高级推理和个性化工具选择,传统模型进行全排序评分,设计反射机制,实验表明该框架提升了全排序推荐性能。
Comments 6 pages. Accepted by RecSys'26
基于认知先验的复杂策略
机构 * Eindhoven University of Technology(埃因霍温理工大学) ; Lazy Dynamics(懒动力学)
专题命中 工具调用 :planning(abstract);分类 cs.AI
AI总结 研究探讨复杂推理在主动推理中的作用,通过在反应迷宫中评估,发现单独要素不足,复杂推理和全联合认知先验主动推理结合认知驱动与闭环推理解决环境问题,优势源于闭环形式,可在认知先验变分推理中表示。
用于量子储层架构设计的混合大语言模型引导搜索
机构 * QuantumAI Lab, Fractal Analytics India(量子AI实验室,Fractal Analytics印度)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 研究量子储层计算架构设计问题,提出基于模拟器的基准测试\method,比较五种策略,其中\hybrid策略表现出色,在多任务中优于随机搜索,证明生成模型嵌入混合搜索循环可作高级控制器。
Comments 4 pages, 2 figures, 3 tables