Strategy-first synthesis planning for complex natural products
复杂天然产物的优先策略合成规划
专题命中 复杂问题求解 :planning(title);分类 cs.AI
AI总结 基于大语言模型的智能体框架SynthEx,可规划出传统算法无法实现的复杂天然产物合成路线,其关键步骤获化学家认可,相关路线数据库SynthAtlas已开放。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
复杂天然产物的优先策略合成规划
专题命中 复杂问题求解 :planning(title);分类 cs.AI
AI总结 基于大语言模型的智能体框架SynthEx,可规划出传统算法无法实现的复杂天然产物合成路线,其关键步骤获化学家认可,相关路线数据库SynthAtlas已开放。
用于聚合物自动化粗粒度分子动力学的多智能体框架
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST))
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI
AI总结 本文提出CGMas多智能体框架,可自动完成聚合物粗粒度分子动力学的拓扑构建等全流程,完成27项任务,22项密度匹配度在5%内,模拟时间大幅缩短,确立了智能体式LLM用于聚合物粗粒化的可行性。
Kimi K2.5:视觉代理智能
机构 * Kimi Team(Kimi 团队)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Kimi K2.5通过联合优化文本和视觉模态,提出Agent Swarm框架,实现多模态代理智能的先进性能和高效任务处理。
Comments Kimi K2.5 tech report
MolBioKG:通过多分辨率结构锚定将图外分子锚定到生物医学知识图谱中
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 MolBioKG是解决生物医学KG中图外分子冷启动问题的两层系统,通过多分辨率结构锚定实现分子与KG的关联,在多项任务中优于基线并提升关键指标。
Comments Preprint
Kimi K3:开放前沿智能
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 介绍Kimi K3这一2.8T参数的专家混合模型,基于Kimi Delta Attention等构建,结合多种方法使缩放效率提升约2.5倍。经训练后在多领域强化学习表现出色,虽整体性能略逊最强专有模型,但在多项任务中达前沿水平且优于其他模型,还发布模型权重助力研究。
Comments K3 tech report
OpenForgeRL:在任何环境中训练原生利用工具的智能体
机构 * Columbia University(哥伦比亚大学) ; Dartmouth College(达特茅斯学院) ; Microsoft Research(微软研究院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对现代AI智能体依赖复杂推理工具难端到端训练的问题,提出OpenForgeRL框架,通过轻量级代理和Kubernetes编排器,在多环境下对基于工具的智能体端到端训练,验证了框架效果并分析了工具选择和RL对智能体行为的影响。
Comments added github link
可信代理网络:在代理网络中,信任必须被内置,而非事后添加
机构 * University of Southern California(南加州大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文探讨了在代理网络中信任必须被内置而非事后添加的问题,提出了一个综合的概念框架,通过四个设计支柱来建立代理网络中的信任。
Comments Accepted at SIGKDD 2026 Blue Sky Ideas Track
Skill-RAG: 通过隐藏状态探测与技能路由实现故障状态感知的检索增强
机构 * University of Michigan(密歇根大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Rutgers University(罗格斯大学) ; University of Pennsylvania(宾夕法尼亚大学) ; New Jersey Institute of Technology(新泽西理工学院) ; TU Darmstadt(图腾斯大学) ; Wake Forest University(威克森林大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 提出Skill-RAG框架,通过轻量级隐藏状态探测器和基于提示的技能路由器,在检索失败时诊断原因并选择四种技能(查询重写、问题分解、证据聚焦、退出)纠正查询-证据错位,显著提升多轮检索后困难案例的准确性。
令牌效率指数:用于AI令牌效率的同行基准复合指标
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 该研究提出TEI,一种同行基准复合指标,通过纳入组织AI使用数据计算三类指标并聚合,生成0-100分等结果,以透明方式基准AI令牌效率并识别支出优化机会。
Comments 11 pages, 6 figures
专题命中 复杂问题求解 :reasoning(abstract)
视界差距:长视界大语言模型智能体的规划、记忆、执行、训练与评估
机构 * DeepGrounding(深地研究机构) ; AlphaAvatar(阿尔法 Avatar 公司)
专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.CL
AI总结 本文提出长视界大语言模型智能体存在的视界差距,调研1547篇相关论文,厘清长视界等属性,分析领域应对措施并提出开放测量问题。
Comments 39 pages, 6 figures
我在视频中寻找你:面向以人为中心的视频推理的身份条件查询
机构 * Beijing Jiaotong University(北京交通大学) ; HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团) ; MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究提出了身份条件查询(ICQ)任务,构建了ISYV基准、训练集与框架,实验显示主流多模态大语言模型在该任务上表现不佳,ISYV模型性能优于强基线且接近闭源模型。
Comments Accepted to ACM Multimedia 2026 (MM '26). 6 figures, 5 tables
用于可泛化深度伪造视频检测的多智能体取证推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 针对深度伪造检测的现有方法泛化性不足问题,本文构建含10万视频的FaceVid-Forensics-100K数据集,提出多智能体取证推理框架,在域外测试集上性能优于GPT、Gemini等模型。
Comments 22 pages, 8 figures, 14 tables
推理与双记忆联合优化的自学习诊断代理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Jacobi Medical Center(雅各比医学中心)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出SEA自学习诊断代理,通过认知启发的双记忆模块联合优化推理与记忆管理,实现在MedCaseReasoning数据集上达到92.46%准确率,并在ER-Reason数据集上取得最佳表现,验证了经验转化为可重用知识的有效性。
GraphVerse:面向多模态大语言模型的综合性视觉图推理基准
机构 * New York University(纽约大学) ; Sensetime Research(商汤科技研究院) ; Tsinghua University(清华大学) ; New York University Shanghai(上海纽约大学) ; University of Georgia(佐治亚大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 针对现有多模态大语言模型(MLLMs)评估缺乏结构化视觉推理测试的问题,提出GraphVerse基准,通过以图为中心的图像编辑(GIE)策略和VGR-Score指标,评估MLLMs在单/配对图像场景下的视觉图推理能力,揭示其相关局限并验证方法有效性。
Comments 33 pages, 16 figures
Multi-Legal-Bench: 跨司法管辖区、语言和法律传统的法律推理评估LLM
机构 * SecondLayer
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI
AI总结 提出Multi-Legal-Bench,首个跨司法管辖区法律基准,在6个国家、4个语系和1.34亿份法院判决上评估LLM,发现少样本效果跨辖区复制、无单一模型主导所有语言、跨语言迁移不遵循语言邻近性、分词器效率不显著预测跨语言准确率。
Comments 17 pages, 5 figures, 9 tables. v2 corrects scorer and taxonomy defects, adds no-model baselines showing label leakage, re-runs the Lithuanian cells on de-leaked text, and withdraws the claim that few-shot helps on judgment-form classification everywhere; all tables and figures regenerated. Dataset: https://huggingface.co/datasets/overthelex/multi-legal-bench
GeoBenchLLM:评估大语言模型地理相关任务的综合基准
机构 * University of Toulouse(图卢兹大学) ; IRIT(信息与电信科学研究所)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出GeoBenchLLM综合基准,选取12个地理相关公开数据集评估LLMs的地理空间与时间理解能力,发现推理能力与模型规模对性能影响显著,基准可公开获取。
Comments Accepted at CIKM2026
每瓦智能:衡量本地AI的智能效率
机构 * Stanford University(斯坦福大学) ; Together AI
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了本地AI在能源效率和性能上的表现,提出了一种统一的衡量指标IPW,展示了本地推理在重新分配需求方面的能力,并揭示了本地加速器的优化潜力。
ResidencyRL:在模拟临床环境中开展的强化学习
机构 * Google DeepMind(谷歌DeepMind) ; Google Research(谷歌研究院) ; Houston Methodist Hospital(休斯顿卫理公会医院) ; Trinity Health Group(三一健康集团) ; Stanford Oncology Partners(斯坦福肿瘤学伙伴) ; St. Luke Hospital(圣卢克医院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出 ResidencyRL,通过多轮强化学习训练临床 AI 智能体,在模拟临床环境中提升诊断准确性、降低漏报率,且能力可迁移至多个医学基准测试,为临床 AI 发展提供了新路径。
CAi Copilot:通过意图驱动的智能体工作流减少分子设计中的操作工作量
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Nanjing University(南京大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 CAi Copilot是面向专家的意图驱动智能体,通过三层架构整合分子设计分散工具,在45项任务中整体性能最优,得分84.59,可将设计意图转化为可追溯工作流。
多模态大语言模型(MLLMs)能否解码创造性飞跃?推出面向跨概念理解的C4框架
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) ; School of Computer Science and Engineering, Shandong University of Science and Technology(山东科技大学计算机科学与工程学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究推出受认知启发的C4成语跨概念创造力评估框架,构建含884个案例的C4-Eval集,评估10款MLLMs发现闭源模型准确率最高达50.7%,揭示当前MLLMs创造性解码能力存在显著差距。
评估自主编程代理中的计划合规性
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; IBM(IBM公司)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文系统分析了编程代理在执行任务时对计划的遵循情况,通过16991条轨迹评估不同计划变体的影响,发现计划提醒能提高任务成功率,但不恰当的计划补充可能降低性能。
Fisher-R1:训练用于可靠假设检验的大语言模型智能体
机构 * Stanford University(斯坦福大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究构建了含425项多领域假设检验任务的P-Bench基准,训练出Fisher-R1智能体,其在P-Bench上较DeepSeek-V4-Pro单试验成功率平均提升21%,证明强化学习可提升LLM的统计推理可靠性。
DiDPO:用于编码智能体训练的差异内差异策略优化
机构 * University of Science and Technology of China (USTC)(中国科学技术大学) ; Stanford University(斯坦福大学) ; Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) ; Tongji University(同济大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对编码智能体训练的细粒度信用分配难题,提出DiDPO方法,在Qwen2.5-7B-Coder上性能超可比方法10%以上,开源了支持多种RL方法的verl-code代码库。
Comments 16 pages, 6 figures, work in progress
PHOENIX:通过预测性自修复与多智能体AI恢复实现的经微调小型语言模型驱动的自主卫星寿命延长
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对CubeSat在轨故障无法及时修复导致寿命不足的问题,提出PHOENIX系统,利用微调SLM与多智能体AI实现自主故障修复,基于ESA基准验证了初步效果。
Comments 6 pages, 2 figures. Accepted at IEEE IRAI 2026 (International Conference on Responsible Artificial Intelligence)
科学边缘评估:SEE——迈向真实科学发现的缺失环节
机构 * Alibaba Group(阿里巴巴集团) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; University of Alberta(阿尔伯塔大学) ; Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究构建多模态基准SEE评估19个MLLMs,发现其仅达48.7%准确率,通用模型优于专用模型,工具使用可提至52.7%但仍难实现科学发现所需的证据约束推断,需从解释转向推导。
MoCA:隐式社会语境分析
机构 * National University of Singapore(新加坡国立大学) ; University of Oxford(牛津大学) ; Wuhan University(武汉大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出隐式社会语境分析(MoCA)新任务,构建含3108个实例的基准数据集,提出CoDAR框架提升模型性能,但模型与人类推理仍存差距,凸显隐式社会理解难度。
索引SLM技术报告
机构 * Bilibili(哔哩哔哩)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 哔哩哔哩开发Index-1.9B系列小语言模型,包括基础模型等四个模型。预训练采用特定方法,Index-1.9B-Base在标准基准测试表现出色,还进行了多项控制研究,所有模型及评估代码已公开。
Comments 16 pages, 9 figures. v2: updated author list (added Yang Liu and Yuxin Li; marked core contributors and project lead) and added a release-date note on the first page
MEDLEY-BENCH:在AI元认知中规模购买评估但不控制
机构 * Department of Clinical Science, Intervention and Technology (CLINTEC), Karolinska Institutet(临床科学、干预与技术部门(CLINTEC),Karolinska研究所) ; Department of Clinical Physiology, Karolinska University Hospital(临床生理学部门,Karolinska大学医院) ; Department of Biomedical Engineering and Health Systems, KTH Royal Institute of Technology(生物医学工程与健康系统部门,KTH皇家理工学院) ; Department of Textile Technology, University of Borås(纺织技术部门,Borås大学) ; Department of Medical Technologies, Karolinska University Hospital(医学技术部门,Karolinska大学医院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 MEDLEY-BENCH评估了12种模型家族中35个模型在五个领域130个模糊实例上的行为元认知能力,发现评估能力随模型规模增加而增强,但控制能力不增加,揭示了元认知能力与规模无关的结论。
基于LLM的智能体评估统一框架的必要性
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对当前LLM智能体评估受系统提示、工具集和环境动态等混杂因素影响的问题,提出标准化统一评估框架以提升公平性和可复现性。