arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2334 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 578 篇

2606.08982 2026-06-10 cs.AI 版本更新 57%

Baichuan-M4: A Clinical-Grade Medical Agent System for Continuous Care

Baichuan-M4:面向持续照护的临床级医疗智能体系统

Aiyuan Yang, Canbin Piao, Chengfeng Dou, Da Pan, Dian Wang, Fan Yang, Fei Deng, Fei Li, Guangwei Ai, Hui Liu, Hongda Zhang, Jinyang Tai, Kai Lu, Lijun Liu, Linwei Chen, Linyu Li, Meiqing Guo, Peidong Guo, Qiang Ju, Rihui Xin, Shuai Wang, XinKai Ma, Xudong Chen, Yichuan Mo, Yijie Zhou, Leyi Pan, Yihe Luo, Zian Wang

机构 * Baichuan AI(百川智能) THUBPM Group, Tsinghua University(清华大学THUBPM课题组)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出Baichuan-M4临床级医疗大模型,通过统一运行时、持续照护强化学习框架和临床工具层三大支柱构建智能体系统,在多项医疗评估中取得领先结果,幻觉率降至3.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05463 2026-06-10 cs.AI 版本更新 57%

PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage

PSEBench: 一个用于评估大语言模型在患者安全事件分类中的可控且可验证的基准

Keqi Han, Ryan Young, Annabel Strauss, Lindsey Hughes, Katharine M. Nesbitt, Nicole Schueler, Che Ngufor, Carl Yang, Yuan Xue, Zhijun Yin

机构 * Emory University(埃默里大学) Scale AI Mayo Clinic(梅奥诊所) Vanderbilt University Medical Center(范德比大学医学中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出基于政策条款卡的结构化构建方法,通过锚点驱动实例化和闭环验证生成带真实标签的叙事,并创建包含5074个案例的基准PSEBench,评估15个代表性LLM在患者安全事件分类中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03217 2026-06-10 cs.LG cs.CY 版本更新 57%

Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability

大语言模型中的道德敏感性:通过行为剖析和机制可解释性对上下文偏见进行分层评估

Yash Aggarwal, Atmika Gorti, Vinija Jain, Aman Chadha, Krishnaprasad Thirunarayan, Manas Gaur

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Purdue University(普渡大学) Meta Apple(苹果公司) Wright State University(怀特州立大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出道德敏感性指数(MSI)量化大语言模型在七级压力测试中的偏见概率,并通过行为剖析和机制验证揭示模型偏见随情境变化的U型曲线,发现推理蒸馏会重新激活浅层统计关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07415 2026-06-10 cs.CV cs.CL 版本更新 57%

ChartREG++: Towards Benchmarking and Improving Chart Referring Expression Grounding under Diverse referring clues and Multi-Target Referring

ChartREG++:面向多样化指代线索和多目标指代的图表指代表达式定位基准与改进

Tianhao Niu, Ziyu Han, Xuan Dong, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对现有图表指代表达式定位基准的局限,提出支持多种定位形式、多目标指代、多样化线索和图表类型的基准,并利用代码驱动合成流水线生成像素级实例掩码,训练实例分割模型集成到多模态定位框架,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14717 2026-06-10 cs.CL 版本更新 57%

What Really Matters for Table LLMs? A Meta-Evaluation of Model and Data Effects

表格LLM真正重要的是什么?模型与数据影响的元评估

Naihao Deng, Sheng Zhang, Henghui Zhu, Shuaichen Chang, Jiani Zhang, Alexander Hanbo Li, Chung-Wei Hang, Hideo Kobayashi, Yiqun Hu, Patrick Ng

机构 * University of Michigan(密歇根大学) AWS AI Labs(AWS人工智能实验室) Figma OKX Google(谷歌)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 通过指令微调12个模型并在16个基准上评估,发现基座模型选择比训练数据对性能影响更大,泛化与推理仍是挑战。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09823 2026-06-09 cs.MA cs.AI 版本更新 57%

CalBench: Evaluating Coordination-Privacy Trade-offs in Multi-Agent LLMs

CalBench: 评估多智能体大语言模型中的协调-隐私权衡

Chelsea Zou, Yiheng Yao, Selena She, Noah Goodman, Robert D. Hawkins

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 提出CalBench基准,用于在私有信息下评估多智能体日程协调中任务完成、成本、通信、公平性和隐私泄露的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26498 2026-06-09 cs.LG q-bio.QM 版本更新 57%

Do Larger Models Really Win in Drug Discovery? A Benchmark Assessment of Model Scaling in AI-Driven Molecular Property and Activity Prediction

大模型真的在药物发现中胜出吗?AI驱动的分子性质和活性预测中模型规模的基准评估

Jinjiang Guo, Sheng Ding

机构 * Global Health Drug Discovery Institute(全球健康药物发现研究所) School of Pharmaceutical Sciences(药学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文通过26个ADME、毒性及生物活性端点评估,发现传统机器学习在多数任务中表现最佳,大模型在部分困难分割中竞争力有限,模型性能依赖于任务与验证场景的适配性,而非单纯规模。

Comments Improved benchmark design and reproducibility, replaced restricted datasets with public benchmarks in primary analyses, and added sensitivity analyses supporting the interpretation of model scaling and evaluation protocol effects in molecular prediction

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26176 2026-06-09 cs.DB cs.CL 版本更新 57%

CacheRAG: A Semantic Caching System for Retrieval-Augmented Generation in Knowledge Graph Question Answering

CacheRAG:面向知识图谱问答中检索增强生成的语义缓存系统

Yushi Sun, Lei Chen

机构 * HKUST Hong Kong China(香港理工大学(中国)) HKUST(GZ) / HKUST Guangzhou / Hong Kong China (2018)(香港理工大学(广州)/ 香港理工大学(广州)/ 香港中国(2018))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对LLM驱动的KGQA系统作为无状态规划器导致模式幻觉和检索覆盖有限的问题,提出CacheRAG,一种基于缓存的架构,通过模式无关接口、多样性优化缓存检索和有界启发式扩展,将无状态规划器转变为持续学习器,显著提升准确性和真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11238 2026-06-09 cs.CL 版本更新 57%

SurveyLens: A Discipline-Aware Benchmark for Automatic Survey Generation

SurveyLens:一个学科感知的自动综述生成基准

Beichen Guo, Zhiyuan Wen, Jia Gu, Haochen Shi, Jian Wang, Senzhang Wang, Haoyang Li, Ruosong Yang, Shuaiqi Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学) Central South University(中南大学) Alibaba Cloud(阿里巴巴云)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 提出SurveyLens,首个学科感知的自动综述生成基准,包含跨10个学科的1000篇人工撰写综述数据集和双视角评估框架,发现深度研究智能体在跨学科鲁棒性上最优,而所有范式在参考文献质量上仍薄弱。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22859 2026-06-09 cs.SE cs.AI 版本更新 57%

MEnvAgent: Scalable Polyglot Environment Construction for Verifiable Software Engineering

MEnvAgent:可扩展的多语言环境构建用于可验证软件工程

Chuanzhe Guo, Jingjing Wu, Sijun He, Yang Chen, Zhaoqi Kuang, Shilong Fan, Bingjin Chen, Siqi Bao, Jing Liu, Hua Wu, Qingfu Zhu, Wanxiang Che, Haifeng Wang

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 提出MEnvAgent框架,通过多智能体规划-执行-验证架构和环境复用机制,自动构建多语言可执行环境,生成可验证任务实例,在10种语言1000个任务上提升F2P率8.6%并降低时间成本43%。

Comments Accepted as a Spotlight Paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18676 2026-06-09 cs.CV cs.AI 版本更新 57%

MedVision: Benchmarking Quantitative Medical Image Analysis

MedVision:定量医学图像分析的基准测试

Yongcheng Yao, Yongshuo Zong, Raman Dutt, Yongxin Yang, Sotirios A Tsaftaris, Timothy Hospedales

机构 * University of Edinburgh(爱丁堡大学) Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对当前医学视觉语言模型缺乏定量推理能力的问题,提出MedVision数据集和基准,涵盖22个公共数据集、3080万图像-标注对,通过监督和强化微调显著提升检测、肿瘤/病变大小估计和角度/距离测量性能。

Comments 22 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01120 2026-06-08 cs.AI 版本更新 57%

Diagnosing LLM Arbitration Behavior over Pre-evidence Epistemic States in RAG-based Fact-Checking

诊断基于RAG的事实核查中LLM对证据前认知状态的仲裁行为

Yuxi Sun, Wenbo Shang, Wei Gao, Xin Huang, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) Singapore Management University(新加坡 Management 大学)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 提出PAVE测试平台,通过将LLM验证器分为四种认知状态,评估其在检索增强生成事实核查中仲裁参数知识与检索证据的能力,发现不可靠且高度依赖模型的仲裁行为,并提出轻量级JSD测试时仲裁方法。

Comments Accepted to ACL-2026 Findings (voluntarily withdraw)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06600 2026-06-08 cs.CL 版本更新 57%

Probing Multimodal Large Language Models on Cognitive Biases in Chinese Short-Video Misinformation

探究多模态大语言模型在中国短视频虚假信息中的认知偏差

Jen-tse Huang, Chang Chen, Shiyang Lai, Wenxuan Wang, Michelle R. Kaufman, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) Chinese University of Hong Kong(香港中文大学) University of Chicago(芝加哥大学) Renmin University of China(中国人民大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过200个短视频数据集评估8种多模态大语言模型在健康领域虚假信息中的表现,发现Gemini-2.5-Pro表现最佳(信念分数71.5/100),而模型易受权威频道ID等社会线索影响。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22327 2026-06-08 cs.IR cs.AI cs.DL 版本更新 57%

Evaluating AI-based Scientific Knowledge Synthesis with Epidemiological Systematic Reviews

基于流行病学系统评价评估AI科学知识综合

Shreyansh Padarha, Ryan Othniel Kearns, Tristan Naidoo, Lingyi Yang, Łukasz Borchmann, Piotr BŁaszczyk, Christian Morgenstern, Ruth McCabe, Sangeeta Bhatia, Philip H. Torr, Jakob Foerster, Scott A. Hale, Thomas Rawson, Anne Cori, Elizaveta Semenova, Adam Mahdi

机构 * University of Oxford(牛津大学) Imperial College London(伦敦帝国理工学院) University of Nottingham(诺丁汉大学) Snowflake AI Research(Snowflake人工智能研究) Independent(独立)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出AgentSLR评估框架,包含自动化工作流和专家标注数据集,测试LLM在流行病学系统评价各阶段能力,发现无模型全面领先,结构化提取是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11333 2026-06-08 cs.AI 版本更新 57%

LLM-Augmented Digital Twin for Policy Evaluation in Short-Video Platforms

LLM增强的数字孪生用于短视频平台策略评估

Haoting Zhang, Yunduan Lin, Jinghai He, Denglin Jiang, Zuo-Jun Shen, Zeyu Zheng

机构 * University of California, Berkeley(加州大学伯克利分校) The Chinese University of Hong Kong(香港中文大学) New York University(纽约大学) The University of Hong Kong(香港大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 提出一种LLM增强的四模块数字孪生架构(用户、内容、交互、平台),通过事件驱动执行层和可插拔策略组件,支持在闭环动态下对平台策略(含AI策略)进行可复现的仿真评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10687 2026-07-03 cs.MA cs.AI cs.CL cs.GT 版本更新 54%

Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents

谁获得奖励 & 谁受到责备?面向多LLM智能体的评估对齐训练信号

Chih-Hsuan, Yang, Tanwi Mallick, Le Chen, Krishnan Raghavan, Amal Gueroudji, Ian T. Foster, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学)

专题命中 推理评测 :分类 cs.CL、cs.AI;reasoning(comments);planning(comments)

AI总结 提出一个理论框架,结合合作博弈归因与过程奖励建模,将系统级评估转化为智能体信用和消息级信号,用于多LLM智能体训练。

Comments Accepted at the NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models for Reasoning and Planning (LAW 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00162 2026-08-19 eess.IV cs.CV cs.HC 版本更新 50%

GazeXPErT: An Expert Eye-tracking Dataset for Interpretable and Explainable AI in Oncologic FDG-PET/CT Scans

GazeXPErT: 一种用于肿瘤FDG-PET/CT扫描可解释和可解释AI的专家眼动数据集

Joy T Wu, Daniel Beckmann, Sarah Miller, Alexander Lee, Elizabeth Theng, Stephan Altmayer, Ken Chang, David Kersting, Tomoaki Otani, Brittany Z Dashevsky, Hye Lim Park, Matteo Novello, Kip Guja, Curtis Langlotz, Ismini Lourentzou, Daniel Gruhl, Benjamin Risse, Guido A Davidzon

专题命中 推理评测 :reasoning(abstract)

AI总结 GazeXPErT通过专家眼动数据提升肿瘤FDG-PET/CT图像的可解释AI性能,包括病变分割和意图预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04484 2026-08-18 cs.CV 版本更新 50%

TrustCLIP: Learning Private Visual Features via Adversarial Reconstruction

TrustCLIP:通过对抗性重建学习隐私视觉特征

Nikos Athanasiou, Ilya A. Petrov, Angela Yao, Shugao Ma, Eric Sauser, Edoardo Remelli, Shreyas Hampali, Johannes Schönberger, Fadime Sener, Bugra Tekin

机构 * Meta Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tübingen(图宾根大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究视觉和视觉语言模型中视觉特征隐私问题,提出TrustCLIP框架,以特征条件生成器为隐私对手,优化编码器特征与下游模块投影,降低生成式反演保真度并保持下游任务性能。

Comments https://atnikos.github.io/trustclip/ Update affiliations

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03444 2026-08-18 cs.RO cs.SY eess.SY 版本更新 50%

PerFACT: Motion Policy with LLM-Powered Dataset Synthesis and Fusion Action-Chunking Transformers

PerFACT: 基于LLM驱动的数据集合成与融合动作分块变换器的运动策略

Davood Soleymanzadeh, Xiao Liang, Minghui Zheng

机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66机械工程系,德克萨斯A&M大学) Zachry Department of Civil and Environmental Engineering, Texas A&M University(Zachry土木与环境工程系,德克萨斯A&M大学)

专题命中 推理评测 :planning(abstract)

AI总结 PerFACT通过LLM驱动的数据集合成和融合动作分块变换器,提升机械臂运动规划的泛化能力和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21333 2026-08-18 cs.CV 版本更新 50%

MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios

MME-VideoOCR:评估多模态大语言模型在视频场景中基于OCR的能力

Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zhang, Liang Wang, Haoxuan Li, Zhouchen Lin, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Wenjing Yang

机构 * Kling Team(Kling团队) PKU(北京大学) THU(清华大学) CASIA(中国科学院自动化研究所) CUHKSZ(香港科技大学) NTU(国立台湾大学) NJU(南京大学) XJTU(吉林大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文推出MME-VideoOCR视频OCR基准,评估18个最先进MLLMs的视频OCR能力,发现现有模型在需视频整体理解的任务中表现有限,最优模型准确率仅73.7%,明确了高分辨率输入等对视频OCR的重要性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02473 2026-08-18 cs.DB 版本更新 50%

FDABench: A Benchmark for Data Agents on Analytical Queries over Heterogeneous Data

FDABench:异构数据上分析查询的数据代理基准

Ziting Wang, Shize Zhang, Haitao Yuan, Jinwei Zhu, Wei Dong, Gao Cong

专题命中 推理评测 :reasoning(abstract)

AI总结 提出FDABench基准,通过2007个任务覆盖六种数据模态,并设计PUDDING框架自动构建数据集,以评估数据代理在异构数据上的推理能力。

Comments Accepted to KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13024 2026-08-17 cs.CE 版本更新 50%

TIEM: Temporal Integration of Hypergraph Evidence and Skill Memory for Event-Driven Financial Forecasting

TIEM:用于事件驱动金融预测的超图证据与技能记忆的时间整合框架

Wenjin Liu, Shen Pang, Chenxi Wang, Tiesunlong Shen, Zhe Cui, Xiaobao Wu, Anh Tuan Luu, Haoran Luo

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究针对事件驱动金融预测中大型语言模型智能体存在的证据鸿沟问题,提出带时间戳门控的TIEM框架,引入FinPURE基准,经多组金融基准验证其性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08705 2026-08-17 cs.CV 版本更新 50%

HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales

HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准

Wenbo Xu, Zhimin Chen, Xiaojie Liang, Hengrui Liu, Ziqi Sheng, Wei Lu

专题命中 推理评测 :reasoning(abstract)

AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09953 2026-08-17 cs.CV 版本更新 50%

J-RAS: Mutual Adaptation for Medical Image Segmentation via Contrastive Retrieval-Augmented Joint Optimization

J-RAS:基于对比检索增强联合优化的医学图像分割互适应方法

Salma J. Ahmed, Emad A. Mohammed, Azam Asilian Bidgoli

机构 * Laurier University(劳里尔大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出J-RAS框架,通过交替对比学习和监督学习联合优化分割与检索模型,实现检索与分割的互适应,提升医学图像分割的边界描绘、鲁棒性和跨数据集泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18550 2026-08-14 cs.SE 版本更新 50%

Semantic Drift in Bug Resolution: How Behavioral Signals Propagate from Reports to Tests and Patches

错误修复中的语义漂移:行为信号如何从报告传播到测试和补丁

Wendkûuni C. Ouédraogo, Yinghua Li, Xueqi Dang, Paweł Borsukiewicz, Liang Xiao, Lingfeng Bao, Anil Koyuncu, Jacques Klein, David Lo, Tegawendé F. Bissyandé

专题命中 推理评测 :reasoning(abstract)

AI总结 研究错误修复中行为信号跨工件传播的量化问题,核心方法是引入Desc2Fix框架,通过结构化行为锚等实现语义对齐,主要贡献是证明行为对齐可测且非相似性可比,能为测试和补丁相关工作提供可重现信号,助力多项错误修复任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26608 2026-08-13 cs.CV 版本更新 50%

Understanding Knowledge Transfer Mechanism in Heterogeneous MLLM Fusion: A Simple Linear Approach

理解异构多模态大语言模型(MLLM)融合中的知识迁移机制:一种简单线性方法

Yinghao Hou, Jiahe Fan, Yuanhao Pu, Zongyuan Chen, Hong Xie

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究针对异构MLLM跨规模知识迁移机制,提出CDPI线性探针,经多组模型与基准测试发现,融合增益集中于高层推理,且正向迁移多发生在小比率区间。

Comments 17 pages, 6 figures; includes supplementary material. Revised presentation and terminology; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14348 2026-08-11 cs.IR 版本更新 50%

Legal Retrieval for Public Defenders

为公共辩护人设计的法律检索

Dominik Stammbach, Kylie Zhang, Patty Liu, Nimra Nadeem, Inyoung Cheong, Lucia Zheng, Peter Henderson

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种针对公共辩护人工作的法律检索工具,通过引入领域知识提升检索效果,并发布了一个真实辩护人检索查询的分类学和手动标注的数据集,以改进现实中的法律检索基准。

Comments Forthcoming TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16854 2026-08-11 cs.CV 版本更新 50%

Certainty Is Redundant: Token Sparsification for Efficient Camouflaged Object Detection with Vision Foundation Models

CATP:基于置信度的令牌修剪用于伪装目标检测

Yuhan Gao, Shuhao Kang, Xin He, Bing Li, Ming-Ming Cheng, Yun Liu

机构 * VCIP, College of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) Academy for Advanced Interdisciplinary Studies, Nankai University(先进交叉学科研究院,南开大学) School of Computer Science and Engineering, Tianjin University of Technology(计算机科学与工程学院,天津工业大学) School of Information and Communication Engineering, UESTC(信息与通信工程学院,电子科技大学) Nankai International Advanced Research Institute, Shenzhen Futian(南开国际先进研究院,深圳福田)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出CATP框架,通过分层修剪和双路径补偿机制提升伪装目标检测效率,减少计算量并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17504 2026-08-11 cs.CV q-bio.QM 版本更新 50%

BMDS-Net:Deployment-aware multi-modal brain tumor segmentation with adaptive fusion,decoder regularization,and Bayesian calibration

BMDS-Net:一种用于鲁棒脑肿瘤分割的贝叶斯多模态深度监督网络

Yan Zhou, Suncheng Xiang, Zhen Huang, Yue Ouyang, Yingqiu Li, Zehua Wang

机构 * School of Mathematics and Statistics, Changsha University of Science and Technology(数学与统计学学院,长沙理工大学) School of Biomedical Engineering, Shanghai Jiao Tong University(生物医学工程学院,上海交通大学) Shanghai Chest Hospital, Shanghai Jiao Tong University School of Medicine(上海胸科医院,上海交通大学医学院)

专题命中 推理评测 :planning(abstract)

AI总结 BMDS-Net通过贝叶斯方法提升多模态脑肿瘤分割的鲁棒性和可信度,实现更稳定的临床应用。

Comments 21 pages, 6 figures. Manuscript prepared for submission to ACM HEALTH

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09772 2026-08-07 cs.CV 版本更新 50%

SemDINO: Foundation Prior-Guided Cross-Temporal Semantic Alignment Network for Remote Sensing Change Detection

SemDINO: 一种基于DINOv3的跨时间语义对齐变化检测网络

Xinyu Tong, Meihua Zhou, Jinxiao Sun, Zaiyan Zhang, Hongruixuan Chen, Lei Wang

机构 * Xinjiang Institute of Ecology and Geography, Chinese Academy of Sciences(中国科学院新疆生态与地理研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) College of Information and Communication Engineering, Harbin Engineering University(哈尔滨工程大学信息与通信工程学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出SemDINO网络,通过双分支编码器、多尺度时序交互、语义净化与变化增强模块,解决语义变化检测中跨时间对齐不足、多尺度表示弱及伪变化鲁棒性差的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏