LOCARD: An Agentic Framework for Blockchain Forensics
LOCARD:区块链取证的代理框架
机构 * Imperial College London(帝国理工学院)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 本文提出一种新的区块链取证方法,通过LOCARD框架实现动态决策过程,结合结构化信念状态机制,展示了在跨链交易追踪中的有效性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
LOCARD:区块链取证的代理框架
机构 * Imperial College London(帝国理工学院)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 本文提出一种新的区块链取证方法,通过LOCARD框架实现动态决策过程,结合结构化信念状态机制,展示了在跨链交易追踪中的有效性。
AgentSocialBench: 评估人类中心代理社交网络中的隐私风险
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 研究探讨了人类中心代理社交网络中的隐私挑战,提出AgentSocialBench基准,揭示代理协作中隐私保护的复杂性及现有LLM在隐私保护上的不足。
Comments 43 pages, 9 figures
HAG:基于主题自适应的分层人口树状代理生成
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 本文提出HAG框架,通过分层决策过程生成符合主题需求的代理群体,提升宏观分布与微观一致性。实验表明HAG在减少群体对齐误差和增强社会一致性方面表现优异。
Comments Accepted by ACL 2026 main
清晰的道路,清晰的视野:智能交通中多天气恢复的进展
机构 * Finolex Academy of Management and Technology(Finolex管理与技术学院) ; Drone Lab, Centre for Artificial Intelligence and Robotics, IIT Mandi(印度理工学院曼迪分校人工智能与机器人中心无人机实验室) ; Mehta Family School of Data Science and Artificial Intelligence, IIT Guwahati(印度理工学院古瓦哈提分校梅塔家族数据科学与人工智能学院) ; SPACE42 ; Centre of Excellence: Artificial Intelligence, School of Computer Science, UPES Dehradun(UPES德拉敦分校计算机科学学院人工智能卓越中心)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 本文综述了图像和视频恢复技术,以缓解天气引起的视觉障碍,分类了传统方法和数据驱动模型,并讨论了多天气系统和未来方向。
Comments Accepted for publication in IEEE Transactions on Intelligent Transportation Systems (2026)
BalancedDPO:适应性多指标对齐
机构 * Purdue University(普渡大学) ; University of Maryland(马里兰大学) ; Indian Institute of Technology Bombay(印度理工学院孟买分校) ; University of Central Florida(中佛罗里达大学)
专题命中 评测与基准 :preference optimization(abstract);分类 cs.AI
AI总结 BalancedDPO通过多指标共识和动态参考模型更新,在DPO框架中实现多指标偏好对齐,提升模型在不同评估标准下的稳定性与性能。
Comments Transactions on Machine Learning Research, Apr 2026
Journal ref Transactions on Machine Learning Research, Apr 2026
你的代理比你想象的更脆弱:揭示代理LLM中的间接注入漏洞
机构 * Arizona State University(亚利桑那州立大学) ; Morgan Stanley(摩根士丹利) ; UC Davis(加州大学戴维斯分校) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; Rice University(莱斯大学) ; Florida State University(佛罗里达州立大学) ; University of Oxford(牛津大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL
AI总结 研究揭示了代理LLM在动态环境中存在严重的间接注入漏洞,通过评估六种防御策略发现现有防护不足,提出基于表示工程的检测方法以提升安全性。
地球嵌入揭示从空间视角的多样化城市信号
机构 * Texas A&M University(德克萨斯农工大学) ; The University of Alabama(阿拉巴马大学) ; Emory University(埃默里大学)
专题命中 评测与基准 :foundation model(abstract);分类 cs.LG
AI总结 本文通过对比三种地球嵌入模型,评估其在预测六个美国大都市区2020-2023年14项社区指标中的表现,发现其在捕捉与建成环境结构直接相关的指标方面表现突出,但对受细粒度行为和本地政策影响的指标预测能力较弱。
Comments 30 pages, 18 figures
RDFace:一种用于罕见疾病面部图像分析的基准数据集,在极端数据稀缺和表型意识合成生成下
机构 * Western University(西安大略大学) ; Concordia University(康考迪亚大学) ; University of Toronto(多伦多大学) ; University of Winnipeg(温尼伯大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 RDFace包含456张儿童面部图像,涵盖103种罕见遗传疾病,旨在开发和评估在低数据条件下高效的人工智能模型,通过合成生成和数据增强提升诊断准确率。
Comments Accepted to CVPR 2026. 8 pages main paper + appendix
想法瓶颈:分解人工智能生成与人类经济学研究之间的质量差距
机构 * Tsinghua University(清华大学) ; Social Catalyst Lab at the University of Zurich(苏黎世大学社会催化剂实验室)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 本文通过分析953篇经济学论文,发现人工智能生成的研究想法质量显著低于人类,占整体质量差异的71%,执行质量差距较小,但机制分析深度不足仍是主要瓶颈。
ToG-Bench:面向任务的时空接地在第一人称视频中
机构 * East China Normal University(华东师范大学) ; Fudan University(复旦大学)
专题命中 评测与基准 :foundation model(abstract);分类 cs.AI
AI总结 本文提出ToG-Bench,首个面向任务的时空视频接地基准,通过任务导向的接地、显式-隐式双接地和一对一多接地特性,评估多对象和显式-隐式对象接地性能,揭示任务导向时空视频接地的挑战与性能差距。
Comments 26 pages
InCTRLv2:通用残差模型用于少样本异常检测和分割
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出InCTRLv2,一种通用少样本异常检测与分割框架,通过双分支结构引入判别异常评分学习和单类异常评分学习模块,利用视觉-文本语义先验实现双视角异常检测。
通过涂鸦和跨语言触发器对自动驾驶VLMs进行多模态后门攻击
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出GLA攻击方法,利用自然触发器在自动驾驶场景中实现隐蔽稳定的后门攻击,实验显示仅需10%污染率即可达到90%攻击成功率且无误报,同时提升模型性能指标,揭示了自动驾驶VLMs的安全威胁。
Comments This is a submission to the "Pattern Analysis and Applications". The manuscript includes 14 pages and 6 figures. All authors have approved the submission, and there is no conflict of interest to declare
ECHO:基于多智能体协作的多媒体事件提取的事件中心超图操作
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Tianjin University(天津大学) ; Chongqing University of Posts and Telecommunications(重庆邮电大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 评测与基准 :LLM(abstract)
AI总结 ECHO通过多智能体协作将多媒体事件提取重构为超图的迭代优化过程,明确事件结构并提高可审查性,实验表明其在事件提及和论证角色上分别提升了7.3和15.5个F1分数。
ComPass:基于对比学习的程序修复中自动补丁正确性评估
专题命中 评测与基准 :language model(abstract)
AI总结 ComPass利用对比学习和数据增强解决程序修复中补丁过拟合问题,通过代码转换规则生成语义保持的代码片段,提升补丁正确性评估的准确性。
Comments 31 pages, 3 figures
FACE:一种细粒度的无参考评价方法用于对话信息检索
专题命中 评测与基准 :LLM(abstract)
AI总结 本文提出FACE,一种细粒度对话信息检索评价方法,通过优化LLM指令对对话不同层面进行评分,实现与人类判断强相关,且具有跨模型和数据集的泛化能力。
Comments Accepted at SIGIR 2026 (Full Paper track)
LOGER:用于野外鲁棒深度伪造检测的局部-全局集成
机构 * Shanghai Jiao Tong University(上海交通大学) ; INTSIG Information(INTSIG信息)
专题命中 评测与基准 :foundation model(abstract)
AI总结 LOGER通过局部-全局集成框架提升深度伪造检测鲁棒性,利用多尺度视觉基础模型捕捉全局异常,结合多实例学习策略提取局部伪造痕迹,有效应对真实世界退化。
Comments 2nd place (out of 94 teams) in the NTIRE 2026 Robust Deepfake Detection Challenge
弥合维度差距:2D视觉模型适应3D分析的分类与综述
机构 * Independent Researcher(独立研究员)
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文综述了将2D视觉模型适应3D分析的策略,分类为数据导向、架构导向和混合方法,探讨了计算复杂度、预训练依赖性和几何归纳偏置的权衡。
Comments VISAPP 2026
Journal ref Proceedings of the 21st International Conference on Computer Vision Theory and Applications - Volume 3: VISAPP 2026; ISBN 978-989-758-804-4; ISSN 2184-4321, SciTePress, pages 353-364
CardioSAM:面向高精度心脏MRI分割的拓扑感知解码器设计
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文提出CardioSAM,结合冻结的SAM编码器与轻量可训练的心脏专用解码器,通过引入心脏特定注意力模块和边界细化模块,提升心脏MRI分割的精度与临床应用性。
JAMMEval: 一个经过精细优化的日本基准数据集,用于可靠的视觉-语言模型评估
机构 * Kyoto University(京都大学) ; NII LLMC(国立信息学研究所LLMC) ; NII(国立信息学研究所) ; Waseda University(早稻田大学) ; Institute of Science Tokyo(东京科学大学)
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出JAMMEval,通过两次人工标注优化七个现有日本基准数据集,提升数据质量和评估可靠性,并验证了其在日语VQA任务中对模型能力的准确评估。
Comments 16 pages, 11 figures
IQRA 2026:现代标准阿拉伯语(MSA)自动发音评估挑战
机构 * DFKI(德国人工智能研究中心) ; Technical University of Berlin(柏林工业大学) ; University of Sheffield(谢菲尔德大学) ; University of New South Wales(新南威尔士大学) ; Alexandria University(亚历山大大学) ; QCRI(卡塔尔计算研究所) ; Taibah University(塔伊巴大学) ; HUMAIN
专题命中 评测与基准 :language model(abstract)
AI总结 本文介绍了IQRA 2026挑战赛的成果,展示了在现代标准阿拉伯语发音检测与诊断(MDD)方面的研究进展,通过新增的Iqra_Extra_IS26数据集和多种模型方法,使F1分数提升了0.28。
Comments 5 pages paper
RAGRouter-Bench:一种自适应RAG路由的数据库和基准测试
专题命中 评测与基准 :LLM(abstract)
AI总结 本文提出RAGRouter-Bench,首个用于自适应RAG路由的数据库和基准测试,通过整合查询-语料兼容性、细粒度语料指标和统一评估协议,系统评估生成质量和资源消耗,验证自适应路由在不同查询-语料上下文中的有效性。
CodeWiki: 评估AI生成大规模代码库整体文档的能力
专题命中 评测与基准 :LLM(abstract)
AI总结 CodeWiki提出一个统一框架,用于生成多语言代码库的自动化文档,通过层级分解、递归多代理处理和多模态合成,提升文档质量,实验显示其在高脚本语言上的改进显著。
Comments Accepted at ACL 2026
LLM-ODE:利用大语言模型发现动态系统的数据驱动方法
机构 * The Graduate Center, CUNY(纽约市立大学研究生中心) ; Queens College and The Graduate Center, CUNY(纽约市立大学皇后学院与研究生中心)
专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG
AI总结 本文提出LLM-ODE框架,利用大语言模型指导符号进化,提升动态系统方程发现的效率和准确性。
搜索,不要猜测:教小语言模型成为有效的搜索代理
机构 * New York University(纽约大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Nanyang Technological University(南洋理工大学)
专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
AI总结 本文通过评估复杂多跳推理任务,发现小语言模型(SLMs)虽参数较少,但检索工具使用更少且易产生幻觉。提出轻量级微调方法\policy,使SLMs能可靠检索并生成基于证据的答案,提升Bamboogle和HotpotQA性能17.3和15.3分,达到LLM水平。
Comments 13 pages, 5 figures
利用语法约束大语言模型实现精确的机器人指令理解
机构 * Industrial and Manufacturing Engineering, Florida State University(佛罗里达州立大学工业与制造工程系)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SLM(abstract)
AI总结 本文提出一种结合语法驱动NLU系统和微调LLM的混合模型,通过两阶段过程确保生成的指令在机器人可读的JSON格式中有效,提升工业人机协作的安全性和效率。
Comments Accepted at ASME MSEC2026
RUQuant: 向大语言模型的均匀量化精修迈进
机构 * Dalian University of Technology(大连理工大学) ; Peking University(北京大学) ; Macao Polytechnic University(澳门理工大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)
AI总结 本文提出RUQuant方法,通过理论分析和两阶段正交变换,解决激活分布非均匀导致的量化精度下降问题,在不需微调的情况下实现高精度量化。
Comments Accepted to KDD 2026. 12 pages, 9 figures
PolySwarm:一种多智能体大语言模型框架,用于预测市场交易和延迟套利
机构 * Department of Computer Science, State University of New York, Binghamton(纽约州立大学宾汉姆顿分校计算机科学系) ; Department of Software Engineering, Arizona State University(亚利桑那州立大学软件工程系)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文提出PolySwarm框架,通过多智能体大语言模型实时预测市场交易和去中心化平台上的延迟套利,结合贝叶斯方法和信息论分析,展示其在概率校准上的优越性能。
Comments 13 pages, 3 figures, 3 tables
SoLA:利用软激活稀疏性和低秩分解实现大语言模型压缩
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 SoLA通过软激活稀疏性和低秩分解技术,在无需训练的情况下压缩大语言模型,显著提升语言模型和下游任务的准确性。
迈向完全自主实验室仪器控制的大型语言模型
机构 * Key Laboratory of Wide Band-Gap Semiconductor Technology, School of Advanced Materials and Nanotechnology, Xidian University(西安电子科技大学先进材料与纳米技术学院宽禁带半导体技术重点实验室)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本文探讨了大型语言模型在实验室仪器自动化中的应用,展示如何通过ChatGPT生成定制脚本,降低技术门槛,并展示LLM辅助工具如何发展为自主AI代理,实现仪器的自主操作与策略优化。
Comments 16 pages, 5 figures. Accepted manuscript published in Small Structures. Supporting data and code available at https://doi.org/10.5281/zenodo.15065601
Journal ref Small Structures, 2025, 6(8), 2500173
CCA Reimagined: 一种大型语言模型用于拥塞控制的探索性研究
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 本文通过模拟引导研究,系统探讨了大型语言模型驱动的拥塞控制可行性,提出更通用的LLM拥塞控制策略,实验表明LLM方案在动态网络条件下可降低延迟达50%,仅牺牲极小吞吐量。