Exploring Anti-Aging Literature via ConvexTopics and Large Language Models
通过凸优化和大语言模型探索抗衰老文献
专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于凸优化和大语言模型的抗衰老文献主题建模方法,通过稳定且细粒度的主题发现,提升可解释性和可重复性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
通过凸优化和大语言模型探索抗衰老文献
专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于凸优化和大语言模型的抗衰老文献主题建模方法,通过稳定且细粒度的主题发现,提升可解释性和可重复性。
AutoEDA:通过基于微服务的LLM代理实现EDA流程自动化
机构 * Duke University(杜克大学) ; University of Maryland, College Park(马里兰大学学院公园分校) ; University of Florida(佛罗里达大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 AutoEDA通过基于微服务的LLM代理实现EDA流程自动化,利用MCP协议提升交互可靠性,并通过本地微调模型和定制评估方法提高准确性与保密性。
Grid-Mind: 一种基于LLM的多保真度代理用于自动化连接影响评估
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 Grid-Mind是一种基于LLM的多保真度代理,通过自主协调电力系统模拟,实现自动化连接影响评估,具有高准确率和自我纠正能力。
通过幽默和谜语数据增强语言模型的横向思维以完成BRAINTEASER任务
机构 * Amazon Web Services(亚马逊网络服务)
专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过引入幽默和谜语数据增强语言模型,提升其在BRAINTEASER任务中的横向推理能力,提高句子谜题和词语谜题的准确率。
Comments Accepted at SemEval 2024 (Colocated with NAACL 2024)
Journal ref Proceedings of the 18th International Workshop on Semantic Evaluation (SemEval-2024)
面向企业级RAG系统的案例感知LLM-as-a-Judge评估
机构 * Dell Technologies(戴尔技术)
专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本文提出面向企业级RAG系统的案例感知LLM-as-a-Judge评估框架,通过八个操作指标评估多轮工作流,揭示企业关键权衡,提升系统诊断清晰度和可操作性。
Comments 12 pages including appendix, 6 figures
SpatiaLQA: 一个评估视觉-语言模型空间逻辑推理能力的基准
机构 * Zhejiang University(浙江大学) ; The University of Sydney(悉尼大学) ; ManyCore ; State Key Laboratory of Blockchain and Security, Zhejiang University(浙江大学区块链与安全国家重点实验室) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)
专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);分类 cs.LG
AI总结 SpatiaLQA提出了一种评估视觉-语言模型空间逻辑推理能力的基准,通过递归场景图辅助推理方法提升模型在复杂场景中的推理能力。
Comments Accepted by CVPR 2026
基于地理空间基础模型的生态制图
机构 * IBM Research(IBM研究) ; IBM Sustainability Software(IBM可持续性软件)
专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)
AI总结 本研究通过微调Prithvi-EO-2.0和TerraMind模型,在生态制图任务中展示了优于ResNet基线的性能,强调了数据对齐和高分辨率输入的重要性。
Comments Revised abstract
用于手动搬运任务的视觉-语言模型:从RGB视频估计水平和垂直手距
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出利用视觉-语言模型从RGB视频中非侵入性估计搬运任务的水平和垂直手距,通过两种多阶段管道验证了该方法的可行性,并展示了分割技术在减少误差方面的有效性。
深度信息合成的基准测试
机构 * Huawei Noah’s Ark Lab, UK(华为诺亚实验室,英国) ; Imperial College London(伦敦帝国理工学院) ; UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心) ; University of Zurich(苏黎世大学) ; University of Sheffield(谢菲尔德大学) ; University of Cambridge(剑桥大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 DEEPSYNTH是一个评估智能体在复杂任务中信息合成与推理能力的新基准测试,通过多阶段数据收集流程和120个跨7个领域的任务,评估LLM在现实问题中的表现。
Comments Accepted at ICLR 2026
OrthoDiffusion:一种通用的多任务扩散基础模型用于骨科MRI解释
机构 * Center for Applied Statistics and School of Statistics(应用统计中心和统计学院) ; Renmin University of China(中国人民大学) ; Institute of Sports Medicine of Peking University(北京大学运动医学研究所) ; Beijing Key Laboratory of Research and Translation for Drugs and Medical Devices in Precision Diagnosis and Treatment of Sports Injuries(北京体育损伤精准诊断与治疗药物与医疗设备研究翻译重点实验室) ; State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI
AI总结 OrthoDiffusion是一种基于扩散的多任务基础模型,通过自监督学习在膝关节MRI上预训练,实现11种结构分割和8种异常检测,具有跨关节的高泛化能力。
打破代理骨干:评估AI代理中骨干LLM的安全性
机构 * Lakera AI ; ETH Zürich(苏黎世联邦理工学院) ; UK AI Security Institute(英国人工智能安全研究所) ; OATML, University of Oxford(OATML,牛津大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出威胁快照框架,用于评估AI代理中LLM骨干的安全性,通过构建$b^3$基准测试揭示LLM安全性的关键影响因素。
Comments Julia Bazinska and Max Mathys contributed equally
K-Function:儿童语言功能的联合发音转录与评估反馈
机构 * Zhejiang University(浙江大学) ; UC Berkeley(加州大学伯克利分校) ; Duke University(达特茅斯大学) ; SCUT(上海交通大学) ; TVT ; UCSF(加州大学旧金山分校)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 K-Function通过结合子词转录与LLM评分,提升儿童语音识别精度,实现高效的语言功能评估。
Comments Accepted to 2026 ICASSP
空间-DisE:评估视觉语言模型空间推理能力的统一基准
机构 * School of Computer Science & informatics, University of Liverpool(计算机科学与信息学系,利物浦大学)
专题命中 评测与基准 :language model(title,abstract)
AI总结 本文提出Spatial-DISE基准,用于评估视觉语言模型的空间推理能力,通过四个象限分类和大规模数据集,揭示当前模型在多步骤多视角推理上的不足。
Comments ICLR 2026 Accepted Project Page: https://shinmohuang.github.io/spatialdise_page/
MUSE: 通过精确和多样的语义提升少样本全滑片图像分类
机构 * School of Big Data & Software Engineering, Chongqing University(大数据与软件工程学院,重庆大学) ; School of Computer Science & Technology, Chongqing University(计算机科学与技术学院,重庆大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 MUSE通过样本层面的细粒度语义增强和随机多视图生成,提升少样本全滑片图像分类的性能和鲁棒性。
Comments Accepted by CVPR 2026
通过分区人类监督实现可扩展的监督
机构 * The University of Tokyo(东京大学) ; RIKEN(理化学研究所)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过分区人类监督实现可扩展的监督,利用互补标签评估和训练AI系统。
Comments ICLR 2026 camera ready version
SoK: 代理技能——超越LLM代理中的工具使用
机构 * University of Technology Sydney(悉尼科技大学) ; CSIRO Data61(CSIRO数据61)
专题命中 评测与基准 :LLM(title);分类 cs.AI
AI总结 本文探讨了代理技能在LLM代理中的应用,分析了技能的生命周期管理、分类方法及其安全影响,并提出了未来研究挑战。
VAUQ:面向LVLM自评估的视觉感知不确定性量化
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Nanyang Technological University(南洋理工大学)
专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 VAUQ通过引入图像信息分数和核心区域遮蔽策略,实现对LVLM自评估的视觉感知不确定性量化,有效提升模型输出的可靠性。
InterviewSim: 一种可扩展的基于面试的人格模拟框架
机构 * Salesforce Research(Salesforce 研究)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 InterviewSim提出了一种基于真实面试数据的多维评估框架,通过系统比较证明基于真实访谈数据的方法在人格模拟中表现更优,并揭示了不同方法在人格风格与事实一致性方面的权衡。
扩展μP:跨优化器的特征学习谱条件
机构 * Purdue University(普渡大学) ; Argonne National Laboratory(阿贡国家实验室)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出了一种新的框架,用于推导更广泛优化器类别的μP,实现了跨优化器的零样本学习率转移和深度缩放参数化。
Comments 10 main pages, 16 appendix pages and 17 figures; Amended version of the publication in 17th International OPT Workshop on Optimization for Machine Learning
BrowseComp-$V^3$:一种视觉、垂直和可验证的多模态浏览代理基准测试
机构 * PKU(北京大学) ; HKUST(GZ)(香港科技大学) ; OUC(华侨大学) ; CASIA(中国科学院自动化研究所) ; HITSZ(哈尔滨工业大学) ; THU(清华大学) ; Huawei Cloud BU(华为云业务部)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 BrowseComp-$V^3$提出了一种多模态浏览代理基准测试,通过300个跨模态问题评估深度搜索能力,揭示多模态信息整合的瓶颈。
数据代理的综述:新兴范式还是过度炒作?
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Shanghai Jiao Tong University(上海交通大学) ; Renmin University of China(中国人民大学) ; Beijing Institute of Technology(北京理工大学) ; Southeast University(东南大学) ; Tsinghua University(清华大学) ; Huawei(华为) ; DeepWisdom
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文系统梳理了数据代理的分类与演变,提出分层框架并分析其技术发展与未来方向。
Comments Please refer to our paper list and companion materials at: https://github.com/HKUSTDial/awesome-data-agents
压力揭示特性:深度下的行为对齐评估
机构 * Prolific
专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出一个深度行为对齐评估基准,通过多轮场景揭示模型行为倾向,发现多数模型在多个类别存在弱点,且对齐行为呈现统一构念特性。
Comments Preprint
AdapTools: 面向代理LLM的自适应工具间接提示注入攻击
机构 * College of Computing(计算学院) ; Data Science, Nanyang Technological University, Singapore(数据科学,南洋理工大学,新加坡) ; School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 AdapTools通过自适应工具和提示生成,提升间接提示注入攻击成功率2.13倍,同时降低系统效用1.78倍,有效应对现代AI代理的快速演变特性。
Comments 11 pages
迈向可信的GUI代理:综述
机构 * University of Georgia(佐治亚大学) ; Tencent AI Seattle Lab(腾讯AI西雅图实验室) ; Microsoft Research(微软研究院) ; University of Waterloo(滑铁卢大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文综述了GUI代理的可信度挑战,提出信任分类法并分析了信任评估与安全可靠部署的开放问题。
Comments 14 pages, work in process
UniGenBench++: 一个统一的语义评估基准用于文本到图像生成
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 UniGenBench++ 提出一个统一的语义评估基准,涵盖多样化的现实场景和多语言支持,用于评估文本到图像生成模型的语义一致性。
Comments Project page: codegoat24.github.io/UniGenBench/
MigrateLib: 一种用于端到端Python库迁移的工具
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 MigrateLib利用大型语言模型、静态分析和动态分析,实现端到端的Python库迁移,能准确迁移32%的迁移任务。
Comments arXiv admin note: text overlap with arXiv:2504.13272
三个具体挑战和两个希望:对无监督引导的安全性
专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了无监督引导技术在面对特定数据集挑战时的局限性,并提出了未来研究的优先方向。
Comments 19 pages, 9 figures
PIME: 基于原型的可解释MCTS增强脑网络分析用于疾病诊断
机构 * Zhengzhou University, Zhengzhou, China(郑州大学) ; China University of Geosciences, Wuhan, China(中国地质大学(武汉)) ; University of Science and Technology Beijing, Beijing, China(北京科技大学) ; Vrije Universiteit Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹自由大学)
专题命中 评测与基准 :post-training(abstract);分类 cs.LG
AI总结 PIME通过整合原型分类和一致性训练,利用MCTS提取紧凑的最小充分解释子图,实现脑网络分析的可解释性与高准确性。
Exa-PSD:一个用于推特的波斯语情感分析新数据集
专题命中 评测与基准 :language model(abstract);分类 cs.CL
AI总结 本文提出Exa-PSD数据集,用于波斯语推特情感分析,包含12,000条推文,通过Pars Bert和Roberta模型评估,达到79.87宏F分数。
Comments This is the original submitted (preprint) version of a paper published in Language Resources and Evaluation. The final published version is available at Springer via DOI: https://doi.org/10.1007/s10579-025-09886-5
Journal ref Lang Resources & Evaluation 60, 6 (2026)
基础技能如何影响基于VLM的具身体验代理:一种原生视角
机构 * Alibaba-inc(阿里巴巴集团)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 本文提出NativeEmbodied基准测试,通过统一的原生低级动作空间评估VLM驱动具身体验代理的综合性能,并揭示基础技能缺陷对高级任务性能的限制。