arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-08-11 至 2026-08-11 共收录 103 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 生物医学文本 10 篇

2608.09725 2026-08-11 stat.AP 新提交 50%

Comparing Tobit and Two-Part Hurdle Models for Semi-Continuous Longitudinal Data with an Application to Clonal Hematopoiesis

Tobit模型与两部分Hurdle模型在半连续纵向数据中的比较及其在克隆性造血中的应用

Sumaja Bandreddi, Pei Zhang, Rebecca L. Kelly, Mitchell J. Machiela, Paul S. Albert

专题命中 生物医学文本 :biomedical(abstract)

AI总结 本文比较了Tobit模型与两部分Hurdle模型,推导了二者等价的数学条件,通过模拟研究发现Hurdle模型更灵活稳健,将二者应用于克隆性造血研究,得到的结果与标准线性模型大致一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09545 2026-08-11 physics.optics 新提交 50%

Direct Laser Interference Patterning of Functional Metal Surfaces: From Written Geometry to Functional Interfaces

功能金属表面的直接激光干涉图案化:从写入几何到功能界面

Petr Hauschwitz

专题命中 生物医学文本 :biomedical(abstract)

AI总结 本综述以DLIP为模型系统,指出仅靠几何无法预测金属表面功能,需分离写入几何与形成的界面,明确跨领域变量可转移性,为DLIP表面工程提供预测框架。

Comments Review article, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09215 2026-08-11 stat.ME 版本更新 50%

Principled analysis of crossover designs: causal effects, efficient estimation, and robust inference

交叉设计的原理性分析:因果效应、有效估计与稳健推断

Zhichao Jiang, Peng Ding

专题命中 生物医学文本 :biomedical(abstract)

AI总结 本文提出基于设计的框架分析交叉设计,定义因果估计量并统一使用最小二乘法进行估计,提供稳健推断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15062 2026-08-11 cs.CL cs.AI 版本更新 50%

SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning

SAKE:通过强化学习进行复杂LLM推理的结构代理知识外推

Jiashu He, Jinxuan Fan, Bowen Jiang, Ignacio Houine, Dan Roth, Alejandro Ribeiro

机构 * University of Pennsylvania(宾夕法尼亚大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 生物医学文本 :biomedical(abstract)

AI总结 SAKE通过强化学习训练LLM自主检索和外推结构化知识,提升生物医学和常识领域推理性能,同时减少90%以上token使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09305 2026-08-11 math.ST stat.TH 版本更新 50%

Estimating order scale parameters of two scale mixture of exponential distributions

估计双尺度混合指数分布的顺序尺度参数

Somnath Mondal, Lakshmi Kanta Patra

专题命中 生物医学文本 :biomedical(abstract)

AI总结 本文提出改进估计方法,用于双尺度混合指数分布的有序尺度参数估计,并应用于多元Lomax分布和指数逆高斯分布。

Comments 28 pages, 20 tables, 35 citations

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 健康监测 1 篇

2608.09830 2026-08-11 cs.LG 新提交 57%

Deep Multimodal Wearable Sensor Fusion for Detection of Body-Focused Repetitive Behaviors

用于聚焦身体重复行为检测的深度多模态可穿戴传感器融合

Samaneh Rezaeimanesh, Mohsen Behradfar, Mohammad Fili, Guiping Hu

机构 * George Mason University(乔治梅森大学)

专题命中 健康监测 :biomedical(abstract);分类 cs.LG

AI总结 本研究开发多模态深度学习框架,利用腕戴式传感器数据检测聚焦身体的重复行为,在二元及九分类任务中均优于单模态基线,为可穿戴辅助心理健康诊断奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 医学数据与评测 7 篇

2608.08727 2026-08-11 cs.CV cs.AI 新提交 70%

TomaMMU: A Comprehensive Multimodal Understanding Benchmark for Tomato Leaf Diseases

TomaMMU:用于番茄叶片病害的综合多模态理解基准

Gia-Han Truong, Khang Nguyen Quoc, Luyl-Da Quach

机构 * FPT University(FPT大学) Korea University(高丽大学)

专题命中 医学数据与评测 :pathology(abstract);diagnosis(abstract);分类 cs.CV

AI总结 本研究推出用于番茄叶片病害多模态理解的TomaMMU数据集及TomaBench基准,评估14种VLMs时发现其细粒度识别等存在差距,微调后MCQ准确率达96.09%,为相关研究提供了方向。

Comments Accepted at ECCV CVPPA Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07635 2026-08-11 stat.AP 新提交 50%

SurroPilot: An LLM-Assisted Platform for Heterogeneous Surrogate Endpoint Evaluation in Clinical Trials

SurroPilot:用于临床试验中异质性替代终点评估的大语言模型辅助平台

Xingyu Li, Peng Wei

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 SurroPilot是集成LLM与异质性中介框架的辅助平台,可通过自然语言交互完成临床试验异质性替代终点评估全流程,降低了相关方法的应用技术门槛。

Comments Submitted for journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09072 2026-08-11 cs.SE cs.AI 新提交 50%

A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents

面向编码智能体的需求澄清、规划与代码生成的统一问题解决基准

Xin Zhou, Chun Yong Chong, Kisub Kim, Yun Peng, Rui Shu, Zihan Wu, Xu Han, Guowen Yuan, Zeyang Zhuang, Jounghoon Kim, Jeongjin Ju, Seongmin Ju, Taein Yoon, David Lo

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 该研究推出SWE-RPG编码智能体基准,评估发现主流编码智能体在该基准上平均解决率仅31.5%,隐性需求恢复是主要瓶颈,为改进编码智能体提供了方向。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08392 2026-08-11 cs.AI cs.CL 新提交 50%

CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception

CAP:用于评估具备复杂动作与感知能力的跨站点浏览器智能体的可扩展基准

Zejun Xu, Taiyi Chen, Jin Li, Yongtong Gu, Qi Cheng, Aixuan Lv, Shuai Zhu, Pengfei Zhu, Kaichen Yang, Boyu Sun, Yixian Yang, Mulong Xie, Xin Liu, Dagang Li, Xiaoteng Ma, Hongru Wang

机构 * Macau University of Science and Technology(澳门科技大学) Tsinghua University(清华大学) Southeast University(东南大学) FellouAI ARGUS Lab(ARGUS实验室) The University of Edinburgh(爱丁堡大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 研究人员推出可扩展基准CAP,通过分解-重组流程构建420项跨站点网页任务,实验发现当前浏览器智能体在感知密集型交互上存在明显瓶颈,与真实需求差距较大。

Comments Accepted to COLM 2026. Project page: https://warriorxu0302.github.io/CAP-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07491 2026-08-11 cs.HC cs.SE 新提交 50%

Initial Evaluation of the Usability of Front-End Ontology Tooling

前端本体论工具可用性的初步评估

Clair Kronk, Rishabh Jain

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本研究针对生物医学领域,调查38名本体论研究者,用SUS量表评估15款前端本体论工具可用性,发现Protege和WebProtege可用性中等,熟悉程度影响得分,指出工具存在可用性差距。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00898 2026-08-11 cs.CL cs.DL 版本更新 50%

Citation Grounding Measures the Oracle: Graph Coverage Determines Reported LLM Hallucination Rates in Law

引用溯源:通过法律引用图检测和减少LLM引用幻觉

Volodymyr Ovcharov

机构 * LEX AI LLC

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出引用溯源(CG)指标,利用乌克兰法院判决的引用图(1.008亿判决,5.02亿边)检测LLM法律引用幻觉,并通过CG-DPO方法(基于真实判决构建偏好对)减少幻觉,在100个法律查询上CG为0.791-0.873,幻觉率13-21%。

Comments 21 pages, 4 figures, 5 tables. Substantially revised: title, framing and several v1 results changed. Adds a coverage sweep and a separability analysis; corrects the DPO configuration, the density-accuracy correlation and the qualitative examples. Code and data: https://huggingface.co/datasets/overthelex/citation-grounding-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10015 2026-08-11 cs.AI cs.CE cs.CL cs.MM 版本更新 50%

FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks

FinTrace: LLM工具调用在长周期金融任务中的轨迹级综合评估

Yupeng Cao, Haohang Li, Weijin Liu, Wenbo Cao, Anke Xu, Lingfei Qian, Xueqing Peng, Minxue Tang, Zhiyuan Yao, Jimin Huang, K. P. Subbalakshmi, Zining Zhu, Jordan W. Suchow, Yangyang Yu

机构 * Stevens Institute of Technology(斯蒂文斯理工学院) Independent Researcher(独立研究者) The FinAI(FinAI) Duke University(杜克大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出FinTrace基准,通过800个专家标注的轨迹评估LLM工具调用,揭示模型在信息利用和最终答案质量上的不足,并通过FinTrace-Training数据集提升中间推理能力,但最终答案质量仍受限。

详情

展开后加载摘要…

URL PDF HTML 收藏