arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 141 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 141 篇

2607.14190 2026-07-17 cs.LG cs.IR stat.ML 新提交 57%

A Temporal Machine Learning-Based Time-to-Event Model for Predicting ALS Progression and Healthcare Utilization

基于时间序列机器学习的事件发生时间模型预测肌萎缩侧索硬化症进展及医疗保健利用情况

Zongliang Yue, Qi Li, Terry Heiman-Patterson, Frank Bearoff, Zhaohui Qin, Huanmei Wu

机构 * Harrison College of Pharmacy, Auburn University(奥本大学哈里森药学院) Fisk University(菲斯克大学) Lewis Katz School of Medicine, Temple University(天普大学刘易斯·卡茨医学院) Emory University(埃默里大学) Barnett College of Public Health, Temple University(天普大学巴尼特公共卫生学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 研究针对ALS预测临床有意义事件的挑战,开发受数字孪生启发的事件发生时间框架,整合多源数据,经聚类、建模等确定功能域及预测因素,构建TTE模型,能生成个性化生存曲线,为ALS相关决策支持提供可行方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13411 2026-07-16 cs.CR cs.LG 新提交 57%

Evaluating Frontier AI Agents as Autonomous Clinical Security Auditors

评估前沿人工智能代理作为自主临床安全审计员

Michael O. Eniolade

机构 * University of the Cumberlands(坎伯兰大学)

专题命中 医学数据与评测 :clinical AI(abstract);分类 cs.LG

AI总结 研究旨在评估前沿人工智能代理能否自主进行临床人工智能安全审计。基于METR任务标准构建评估任务,让代理按要求实施攻击、计算得分并编写报告。通过对三个前沿模型在不同数据集和模型架构上的评估,得出各模型表现及成本等情况,部分成果已公开。

Comments 29 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13386 2026-07-16 cs.CV 新提交 57%

FM$^2$: Unified Federated Foundation Models for Heterogeneous Multimodal Medical Imaging

FM$^2$:用于异构多模态医学成像的统一联邦基础模型

Shengchao Chen, Ting Shu

机构 * School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Australian AI Institute, University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.CV

AI总结 针对医学成像基础模型构建中隐私与任务统一问题,提出FM$^2$框架,通过从头训练核心主干、结合预训练编码器、配备双混合专家模块及正则化器,并引入字幕增强学习,实现跨模态泛化,优于现有联邦基线。

Comments Accepted by ACM MM 2026 (Main Track): the 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09973 2026-07-14 cs.SD cs.AI cs.SY eess.AS eess.SP eess.SY 新提交 57%

A Production-Oriented Framework for Evaluation of SFX Generation

一种面向生产的声效生成评估框架

Mélodie Desbos, Yara Bahram, Eric Granger, Mohammadhadi Shateri

专题命中 医学数据与评测 :diagnosis(abstract);分类 eess.SP

AI总结 针对工业声音设计中声效生成评估问题,提出面向生产的评估框架,通过确定生产要求、两阶段协议及结合客观指标与人类研究,揭示不同基线的优势权衡,为声效变化评估建立协议并为设计音频生成管道提供基础。

Comments 8 pages main paper, 7 pages appendix, Proceedings of the 29th International Conference on Digital Audio Effects (DAFx26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04085 2026-07-07 cs.LG cs.AI cs.DC 新提交 57%

FedSPM: Routing-Enabled Federated Learning under Dual Heterogeneity via Semiparametric Mixture

FedSPM:通过半参数混合在双重异质性下实现支持路由的联邦学习

Zijian Wang, Pengfei Li, Guangyu Yang, Qiong Zhang

机构 * Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院) Department of Statistics and Actuarial Science, University of Waterloo(滑铁卢大学统计与精算科学系)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 针对路由预测联邦学习中未考虑客户端内潜在亚群致双重异质性影响路由和预测的问题,提出FedSPM框架,用特定客户端潜在组件表示客户端,结合分类预测与路由特征分布,开发算法并证明收敛,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01383 2026-07-03 cs.CV 新提交 57%

MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation

MIBE:面向个性化图像生成的多主体交互基准与评估器

Zhihan Chen, Yuhuan Zhao, Yijie Zhu, Xinyu Yao, Mengcong Ren, Suwen Wang, Qiuyang Yin, Yuchen Sun, Qin Wang, Lu Xin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) DeerLab LLC(DeerLab有限责任公司) Carnegie Mellon University(卡内基梅隆大学) Clemson University(克莱姆森大学) Google(谷歌) San Jose State University(圣何塞州立大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 提出MIBE框架,包含多主体交互基准(MIB)和评估器(MIE),通过解耦数据体制和双头排序诊断目标,解决多主体个性化图像生成中主体遗漏、外观失配和交互错误问题,在黄金集上达到0.922成对准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00733 2026-07-02 cs.LG cs.AI 新提交 57%

LLM-Guided ODE Discovery and Parameter Inference from Small-Cohort Aggregate Data

LLM引导的ODE发现与小群体聚合数据的参数推断

Hanning Yang, Meropi Karakioulaki, Lennart Purucker, Tim Litwin, Cristina Has, Moritz Hess

机构 * Institute of Medical Biometry and Statistics, Faculty of Medicine and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院医学统计与生物统计研究所) Department of Dermatology, Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院皮肤科) Prior Labs, University of Freiburg(弗莱堡大学Prior实验室)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 提出AgentODE框架,利用LLM提出候选ODE结构,并通过工具增强的推理代理仅基于群体级汇总统计量迭代优化参数分布,实现从稀疏、噪声数据中发现可解释的ODE结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00710 2026-07-02 cs.CV cs.AI cs.RO 新提交 57%

Creating Impactful Autonomous Driving Datasets: A Strategic Guide from Research Gap to Benchmark

创建有影响力的自动驾驶数据集:从研究空白到基准的战略指南

Richard Schwarzkopf, Jonas Merkert, Frank Bieder, Annika Bätz, Alexander Blumberg, Carlos Fernandez, Felix Hauser, Fabian Immel, Christian Kinzig, Hendrik Königshof, Fabian Konstantinidis, Martin Lauer, Willi Poh, Nils Rack, Kevin Rösch, Yinzhe Shen, Marlon Steiner, Gleb Stepanov, Dominik Strutz, Ömer Şahin Taş, Julian Truetsch, Kaiwen Wang, Royden Wagner, Jan-Hendrik Pauls, Christoph Stiller

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) FZI Research Center for Information Technology(FZI信息技术研究中心)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 提出一种诊断研究问题类型并选择最小数据操作符填补空白的战略框架,通过KITScenes案例验证,指导中小实验室和初创公司高效创建有影响力的自动驾驶数据集。

Comments Keywords: Autonomous Driving, Dataset Design, Benchmarks, Research Gap Identification. 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00491 2026-07-02 cs.CV cs.AI cs.CL 新提交 57%

MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos

MindEdit-Bench:基于野外照片的VLM中对象级反事实空间推理基准

Leyuan Yu, Xiao Tang, Minghao Liu, Xinyuan Li, Xiaokai Bai, Sheng Zhou, Qunshu Lin, Weihao Xuan, Naoto Yokoya

机构 * ZODA Zhejiang University(浙江大学) Tongji University(同济大学) The University of Tokyo(东京大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 提出MindEdit-Bench基准,包含六项空间推理任务,其中两项新任务(L4和L5)测试对象级反事实推理,VLM平均准确率仅8%-31%,远低于人类的81%-97%。

Comments 18 pages, 7 figures. Dataset available at https://huggingface.co/datasets/ZODAOfficial/MindEdit-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31626 2026-07-01 cs.CV 新提交 57%

PrISM-IQA: Image Quality Assessment Made Practical for Smartphone Photography

PrISM-IQA:面向智能手机摄影的实用图像质量评估

Shuyan Zhai, Jiaqi He, Weixia Zhang, Liang Wang, Zhenjie Lee, Zufeng Zhang, Kede Ma

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) School of Computer Science, Institute of AI, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院人工智能研究院) OPPO Research Institute(OPPO研究院) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 提出PrISM-IQA,将智能手机IQA重构为多问题有序诊断,预测每个ISP相关问题的严重等级,支持可操作的ISP调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28194 2026-06-29 cs.LG 新提交 57%

COCOLogic-V2: Identifying Logical Inconsistencies via Truly Hard-Negatives

COCOLogic-V2: 通过真正的困难负样本识别逻辑不一致性

David Steinmann, Antonia Wüst, Kristian Kersting, Wolfgang Stammer

机构 * Computer Science Department, TU Darmstadt(达姆施塔特工业大学计算机科学系) Hessian Center for AI (hessian.AI)(黑森人工智能中心) German Research Center for AI (DFKI)(德国人工智能研究中心) Max Planck Institute for Informatics, SIC(马克斯·普朗克信息学研究所SIC) RTG Neuroexplicit Models(RTG神经显式模型)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 提出COCOLogic-V2数据集,通过正样本、近边界和远边界负样本分类,评估模型在真实图像上的视觉归纳推理能力,发现模型在近边界样本上表现差,视觉归纳推理仍是开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24900 2026-06-25 cs.LG cs.AI 新提交 57%

On-Device Neural Architecture Search

设备上神经架构搜索

Andrea Mattia Garavagno, Edoardo Ragusa, Paolo Gastaldo, Antonio Frisoli, Claudio Loconsole

机构 * 1 Department of Electrical, Electronic, Telecommunication Engineering Naval Architecture, DITEN University of Genoa, Genoa 16145, Italy 2 Department of Excellence in Robotics \& AI, Scuola Superiore Sant’Anna, Piazza Martiri della Libertà 33, Pisa 56127, Italy 3 Institute of Mechanical Intelligence, Scuola Superiore Sant’Anna, Ghezzano, 56010 Pisa, Italy 4 Faculty of Technological

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 提出一种在部署设备上直接进行轻量级神经架构搜索的方法,以优化传感器实时数据分析,在人机接口中实现个性化适应,并在两个数据集上验证了其优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22890 2026-06-23 cs.CV 新提交 57%

PHOEBI: An Open-World Benchmark for Bacterial Identification in Phase-Contrast Microscopy

PHOEBI:用于相差显微镜细菌识别的开放世界基准

Aaditya Baranwal, Md Jahid Hasan, Shruti Vyas

机构 * University of Central Florida(中佛罗里达大学)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.CV

AI总结 提出PHOEBI数据集(12万张相差显微镜图像,6种杆状菌的40种组合),通过留出组合评估协议模拟开放世界场景,发现聚合器存在系统性开放世界识别失败,并设计基于锚点的轻量化解码器在未见组合上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20608 2026-06-23 cs.CY cs.AI cs.CV 新提交 57%

CourseBlueprint: A Structured Pipeline for Adaptive Pedagogical Video Generation Grounded in Course Corpora

CourseBlueprint:基于课程语料库的自适应教学视频生成的结构化流程

Md Zabirul Islam, Md Motaleb Hossen Manik, Ge Wang

机构 * Department of Computer Science, Rensselaer Polytechnic Institute(计算机科学系,拉特格斯理工学院) Department of Biomedical Engineering, Rensselaer Polytechnic Institute(生物医学工程系,拉特格斯理工学院)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.CV

AI总结 提出CourseBlueprint流程,通过结构化教学蓝图(含先决条件图、自适应控制、参与合约)从课程语料库生成自适应教学视频,实验证明显式教学合约比表面流畅性更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18518 2026-06-18 cs.LG cs.AI 新提交 57%

PSyGenTAB: A Privacy-Preserving Framework for Synthetic Clinical Tabular Data Generation via Constrained Optimization

PSyGenTAB:通过约束优化生成合成临床表格数据的隐私保护框架

Arshia Ilaty, Hossein Shirazi, Manasi Chitale, Kedar Hegde, Dhanalakshmi Ramesh, Rashmi S. Manjunath, Amir Rahmani, Hajar Homayouni

机构 * San Diego State University(圣地亚哥州立大学) University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 医学数据与评测 :medical AI(abstract);分类 cs.LG

AI总结 提出PSyGenTAB框架,将合成医疗数据生成建模为约束优化问题,通过增强拉格朗日方法嵌入可配置隐私约束,在保证隐私阈值的同时最大化临床数据效用,实验表明合成数据训练的模型性能与真实数据相当。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15449 2026-06-16 cs.CL cs.IR cs.LG 新提交 57%

Transfer Learning for FHIR Questionnaire Terminology Binding

面向 FHIR 问卷术语绑定的迁移学习

Maxim Gorshkov

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.LG

AI总结 将 FHIR 问卷项与 LOINC 代码的绑定视为检索问题,比较六种方法,发现 BioLORD 在 top-1 准确率上最优,而对比微调在 top-5 和 top-10 上表现更好,并分析了分布偏移和错误类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15032 2026-06-16 cs.LG 新提交 57%

How Should World Models Be Evaluated for Embodied Decision-Making? A Decision-Making-Centric Position

世界模型应如何评估?一个以决策为中心的立场

Yang Yu, Shiyuan Zhang, Yifei Sheng, Haoxiang Ren, Haoxin Lin

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Cirquar Technologies

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 本文指出世界模型评估中声明与证据不匹配的问题,提出以决策为中心的评估框架,强调反事实推理、策略优化等能力,并定义L0-L7评估阶梯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07656 2026-06-09 physics.chem-ph cs.CE cs.LG 新提交 57%

SC3: The Multi-Solvent Solubility Challenge and Benchmark

SC3:多溶剂溶解度挑战与基准

Vansh Ramani, Har Ashish Arora, Dhairya Kuchhal, Sergei Tatarin, Lev Krasnov, Sayan Ranu, Tarak Karmakar

机构 * Indian Institute of Technology Delhi, India(印度德里印度理工学院) Kurnakov Institute of General and Inorganic Chemistry RAS, Russia(库尔诺夫一般和无机化学研究所俄罗斯科学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 针对多溶剂溶解度预测中现有基准的缺陷,提出SC3基准,包含可复现的数据处理流程、多层级共识集和评估指标,并揭示最佳模型与理论极限仍有5倍差距。

Comments 34 pages, 16 tables, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07643 2026-06-09 cs.CV cs.AI cs.SD eess.AS 新提交 57%

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

AVI-Bench:迈向全模态大语言模型的人类级视听智能

Yaoting Wang, Ziyi Zhang, Wenming Tu, Shaoxuan Xu, Wenjie Du, Cheng Liang, Weijun Wang, Yuanchao Li, Guangyao Li, Hao Fei, Yuanchun Li, Henghui Ding, Yunxin Liu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 提出AVI-Bench基准,通过感知、理解、推理三阶段跨模态任务评估全模态大语言模型的视听智能,并引入AVI-Bench-PriSe测试原始视听感知,揭示当前模型局限,构建四级AVI分类体系。

Comments 31 pages, 8 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21818 2026-06-23 q-bio.NC 新提交 54%

Dynamic Computerized Tumbling-E Testing for Temporal Reliability of Human Sequential Perceptual Decisions

动态计算机化Tumbling-E测试用于人类顺序感知决策的时间可靠性

Avneek Sandhu, Bin Hu

专题命中 医学数据与评测 :diagnosis(abstract);分类 q-bio

AI总结 通过计算机化Tumbling-E任务收集人类试次级数据,包括反应时间、超时率和自适应阶梯行为,建立时间解析的感知决策基准,为与人工智能比较提供人类基线。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14457 2026-08-17 cs.CL 新提交 50%

Information Satisfaction: A Reader-Centered Axis for Summarization Evaluation

信息满意度:面向读者的摘要评估轴

Isabel Cachola, William Walden, Reno Kriz, Mark Dredze

机构 * St. Edward’s University(圣爱德华大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本研究提出以读者的信息满意度作为摘要评估的面向读者的轴,发现主流摘要指标无法衡量该满意度,且与人工判断一致性差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12329 2026-08-14 cs.CL cs.AI cs.HC 新提交 50%

AnchorSIPS: A Synthetic Dataset and Evaluation Resource for Evidence-Supported Psychosis-Risk Symptom Measurement

AnchorSIPS:用于证据支持的精神病风险症状测量的合成数据集与评估资源

Guilherme C. Oliveira, Stephanie Fong, Zimu Wang, Clarice Lee, Xiangyu Zhao, Duy Khoa Pham, Duong Nhu, Yiwen Jiang, Jiahe Liu, Zhongxing Xu, Dwarikanath Mahapatra, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(莫纳什大学) Orygen(奥瑞金) The University of Melbourne(墨尔本大学) Swinburne University of Technology(斯威本科技大学) University of Liverpool(利物浦大学) Khalifa University(哈利法大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出AnchorSIPS合成数据集,基于Mini-SIPS访谈构建含1万次结构化精神病风险访谈,解决临床数据隐私问题,用于研究证据提取等,实验发现LLM基线存在细节提取不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11679 2026-08-13 cs.AI cs.IR cs.MA 新提交 50%

AgenticTwin: An Agentic LLM Framework Integrated with Digital Twin for Anomaly Detection

AgenticTwin:集成数字孪生的智能体大语言模型异常检测框架

Touseef Hasan, Mounika Ghanta, Souvika Sarkar, Ujjwal Guin

机构 * School of Computing, Wichita State University(威奇托州立大学计算机学院) Auburn University(奥本大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本研究提出AgenticTwin框架,整合LLM推理与数字孪生异常检测管道,构建基准评估管道并验证轻量级开源LLM部署可行性,可提升异常诊断、检索及缓解质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10273 2026-08-12 cs.CL cs.AI 新提交 50%

Locally Deployable Small Language Models for Emergency Department Decision Support: A Systematic Benchmark of Fine-Tuning Strategies

可本地部署的小型语言模型用于急诊科决策支持:微调策略的系统基准测试

Qingfeng Zhang, Yuanxiong Guo, Yanmin Gong

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 该研究针对急诊科决策支持的隐私风险,通过基准测试发现经LoRA微调的开源小型语言模型在分诊和转诊任务上优于商业模型,可本地部署且具备临床竞争力。

Comments Accepted to AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07635 2026-08-11 stat.AP 新提交 50%

SurroPilot: An LLM-Assisted Platform for Heterogeneous Surrogate Endpoint Evaluation in Clinical Trials

SurroPilot:用于临床试验中异质性替代终点评估的大语言模型辅助平台

Xingyu Li, Peng Wei

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 SurroPilot是集成LLM与异质性中介框架的辅助平台,可通过自然语言交互完成临床试验异质性替代终点评估全流程,降低了相关方法的应用技术门槛。

Comments Submitted for journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09072 2026-08-11 cs.SE cs.AI 新提交 50%

A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents

面向编码智能体的需求澄清、规划与代码生成的统一问题解决基准

Xin Zhou, Chun Yong Chong, Kisub Kim, Yun Peng, Rui Shu, Zihan Wu, Xu Han, Guowen Yuan, Zeyang Zhuang, Jounghoon Kim, Jeongjin Ju, Seongmin Ju, Taein Yoon, David Lo

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 该研究推出SWE-RPG编码智能体基准,评估发现主流编码智能体在该基准上平均解决率仅31.5%,隐性需求恢复是主要瓶颈,为改进编码智能体提供了方向。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08392 2026-08-11 cs.AI cs.CL 新提交 50%

CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception

CAP:用于评估具备复杂动作与感知能力的跨站点浏览器智能体的可扩展基准

Zejun Xu, Taiyi Chen, Jin Li, Yongtong Gu, Qi Cheng, Aixuan Lv, Shuai Zhu, Pengfei Zhu, Kaichen Yang, Boyu Sun, Yixian Yang, Mulong Xie, Xin Liu, Dagang Li, Xiaoteng Ma, Hongru Wang

机构 * Macau University of Science and Technology(澳门科技大学) Tsinghua University(清华大学) Southeast University(东南大学) FellouAI ARGUS Lab(ARGUS实验室) The University of Edinburgh(爱丁堡大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 研究人员推出可扩展基准CAP,通过分解-重组流程构建420项跨站点网页任务,实验发现当前浏览器智能体在感知密集型交互上存在明显瓶颈,与真实需求差距较大。

Comments Accepted to COLM 2026. Project page: https://warriorxu0302.github.io/CAP-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07491 2026-08-11 cs.HC cs.SE 新提交 50%

Initial Evaluation of the Usability of Front-End Ontology Tooling

前端本体论工具可用性的初步评估

Clair Kronk, Rishabh Jain

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本研究针对生物医学领域,调查38名本体论研究者,用SUS量表评估15款前端本体论工具可用性,发现Protege和WebProtege可用性中等,熟悉程度影响得分,指出工具存在可用性差距。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06312 2026-08-07 cs.CL 新提交 50%

Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents

面向规则密集型国家标准文档评审的大语言模型基准测试与增强

Tao Wang, Qihao Yang, Rongjiao Liang, Lianghong Lin, Haitao Wang, Xinyu Cao, Tianyong Hao

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 该研究针对规则密集型国家标准文档评审推出首个基准GB/T-Bench,提出多智能体框架GB/T-Reviewer,实验显示其大幅缩小了LLM与专家在该任务上的能力差距,为高风险文档领域可信AI奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03499 2026-08-05 cs.AI 新提交 50%

WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks

WeClawArena:面向以人为中心的智能体网络中跨用户智能体协作与安全的可审计沙箱及基准

Prince Zizhuang Wang, Aojie Yuan, Haiyue Zhang, Xiyang Hu, Yue Zhao, Shuli Jiang

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 WeClawArena是面向以人为中心的智能体网络的可审计沙箱与基准,含124个基础任务及620个场景变体,可评估跨用户智能体协作的效用与攻击成功率,支持安全审计与诊断。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏