arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-25 至 2026-06-25 共收录 269 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 69 篇

2606.25622 2026-06-25 cs.CR cs.AI 新提交 77%

Probabilistic Agents in Deterministic Audits: Evaluating Multi-Agent Systems for Automated Audits Based on the German IT-Grundschutz

确定性审计中的概率性智能体:基于德国IT-Grundschutz的自动化审计多智能体系统评估

Lea Roxanne Muth, Marian Margraf

机构 * Department of Mathematics and Computer Science(数学与计算机科学系) Freie Universität Berlin(柏林自由大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出结合混合检索增强生成的多智能体系统架构,通过假设验证循环和解耦推理流水线部分自动化IT-Grundschutz认证,实验表明在语义任务上高效但在逻辑推理阶段受限于LLM的概率性。

Comments Accepted for publication at the 2026 IEEE International Systems Conference (SysCon), Halifax, NS, Canada, April 6-9, 2026. 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20133 2026-06-25 cs.AI 版本更新 77%

EvoAgent: An Evolvable Agent Framework with Skill Learning and Multi-Agent Delegation

EvoAgent:一种具备技能学习和多智能体委托的可进化代理框架

Aimin Zhang, Jiajing Guo, Fuwei Jia, Chen Lv, Boyu Wang, Fangzheng Li

机构 * Focus AI Center, Focus Technology Co., Ltd.(Focus技术有限公司人工智能中心) Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(信息科学技术大学南京教育部长数字取证工程研究中心) Nanjing University of Science and Technology(南京理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出EvoAgent框架,通过结构化技能学习与分层子代理委托机制,实现技能的持续生成与优化,并通过实验展示其在外贸场景中的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25269 2026-06-25 stat.ML cs.AI cs.LG 新提交 73%

Stabilizing black-box algorithms through task-oriented randomization

通过任务导向的随机化稳定黑盒算法

Yali Wang, Zhaojun Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种任务导向的随机化方法,根据输入数据的生成机制自适应调整策略,以稳定黑盒输出,并分析了稳定性与探索之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26036 2026-06-25 cs.CL cs.CR 新提交 70%

Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning

检测、遗忘、恢复:防御文本摘要模型免受数据投毒

Poojitha Thota, Shirin Nilizadeh

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出统一的后验防御框架,通过影响函数分析或行为审计检测微调阶段的数据投毒,并利用梯度上升遗忘恢复模型性能,在多种攻击下实现85-92%检测精度和96%行为恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25819 2026-06-25 cs.CL cs.SE 新提交 70%

Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability

超越函数调用:工具环境不可靠性下的工具使用智能体基准测试

Yang Tian, Zhengpeng Shi, Yu Zhou, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ToolBench-X基准,在工具环境中注入五种可恢复可靠性风险,评估智能体任务完成能力,发现可靠工具下表现良好的智能体在可恢复风险下失败,失败主因是诊断和恢复能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25645 2026-06-25 cs.CR cs.AI 新提交 70%

Taxonomy of Risks on Automated Fact-Checking Systems Considering its Propagation

自动事实核查系统风险及其传播的分类

Jun Yajima, Tatsuya Oka, Takao Okubo

机构 * Fujitsu Limited(富士通有限公司) Institute of Information Security(信息安全研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对自动事实核查系统在传播中可能产生的风险,提出三阶段风险传播分类法,识别出32种具体风险,并用于评估DEFAME系统,发现能识别传统方法遗漏的风险。

Comments 15 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25396 2026-06-25 cs.AI 新提交 70%

Long-Term Simulation Exposes Cognitive-Developmental Risks in AI Companions

长期模拟揭示AI伴侣的认知发展风险

Kaicheng Shen, Lingyu Li, Wen Wu, Yan Teng, Liang He, Yingchun Wang

机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海人工智能教育研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出TSJ框架,通过角色驱动用户模拟、动态心理状态更新和回顾性评估,在12,960模拟人天交互中揭示短期测试低估长期认知发展风险,并识别出幼儿期和成年初期为最脆弱阶段。

Comments 19 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18936 2026-06-25 cs.AI cs.CY 新提交 70%

SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

SciRisk-Bench:面向AI4Science安全的风险维度感知基准

Linghao Feng, Yinqian Sun, Dongqi Liang, Sicheng Shen, Chenfei Yan, Yuxuan Peng, Yilin Zhao, Haibo Tong, Kai Li, FeiFei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive Intelligence Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知智能实验室,自动化研究所,中国科学院,北京,中国) School of Future Technology, University of Chinese Academy of Sciences, China(未来技术学院,中国科学院大学,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(人工智能学院,中国科学院大学,中国) Zhongguancun Academy, China(中关村学院,中国) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Gaoling School of AI, Renmin University of China(甘露人工智能学院,中国人民大学) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院(北京-AISI)) School of Humanities, University of Chinese Academy of Sciences, China(人文学院,中国科学院大学,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SciRisk-Bench基准,从显式风险维度和科学学科两个角度评估AI4Science安全,覆盖7个学科、31个子学科和10个风险维度,实验揭示主流及科学大模型的安全薄弱环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05143 2026-06-25 cs.AI cs.IR 版本更新 70%

CausalRAG2: Hierarchical Causal Knowledge Graph Design for RAG

CausalRAG2: 面向RAG的分层因果知识图谱设计

Nengbo Wang, Tuo Liang, Vikash Singh, Chaoda Song, Van Yang, Yu Yin, Jing Ma, Jagdip Singh, Vipin Chaudhary

机构 * Department of Computer and Data Sciences, Case Western Reserve University, Cleveland, OH, USA(计算机与数据科学系,凯斯西储大学,克利夫兰,OH,USA) Design and Innovation Department, Case Western Reserve University, Cleveland, OH, USA(设计与创新部门,凯斯西储大学,克利夫兰,OH,USA)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CausalRAG2框架,通过分层模块间的因果门控机制显式建模因果关系,抑制虚假相关,实现大规模知识图谱上的可扩展推理,并引入HolisQA基准,实验表明其优于现有图基RAG方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17037 2026-06-25 cs.CV cs.AI 版本更新 70%

AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs

AMVICC: 一种用于VLM和IGM跨模态故障模式分析的新型基准

Aahana Basappa, Pranay Goel, Anusri Karra, Anish Karra, Asa Gilmore, Kevin Zhu

机构 * Centennial High School, Frisco, Texas, USA(Centennial High School, Texas, USA) Lebanon Trail High School, Frisco, Texas, USA(Lebanon Trail High School, Texas, USA) West Windsor-Plainsboro High School, Princeton Junction, New Jersey, USA(West Windsor-Plainsboro High School, New Jersey, USA) Algoverse AI Research, Palo Alto, California, USA(Algoververse AI Research, California, USA)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AMVICC基准,通过图像到文本和文本到图像任务系统比较多模态大模型和图像生成模型的视觉推理失败模式,发现故障模式在模型和模态间共享,但存在特定于模型和模态的失败。

Comments 14 pages, 4 figures, 8 tables. Presented at the 39th Conference on Neural Information Processing Systems Workshop: VLM4RWD. Presented at the 43th International Conference on Machine Learning Workshops: ICML 2026 CTB, ICML 2026 FAGEN, ICML 2026 EMM-QA. Authors Aahana Basappa and Pranay Goel contributed equally. Code: https://github.com/AahanaB24/AMVICC, Data: https://doi.org/10.5281/zenodo.17646068

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25837 2026-06-25 cs.DL 新提交 67%

Towards an Interactive Evidence-RAG Peer-Review Workspace for the Journal of Digital History

面向《数字历史期刊》的交互式证据RAG同行评审工作空间

Elisabeth Guerard, Mehrdad Almasi, Marion Salaun, Frederic Clavert, Mirjam Pfeiffer

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出一个交互式证据RAG工作空间,用于《数字历史期刊》的AI辅助同行评审编辑评估,通过链接评论、证据、检索痕迹和可重复性检查提高模型建议的可检查性,初步评估显示严格准确率70.0%,有用输出率90.0%。

Comments Preliminary version of a full paper. 9 pages, 1 figure, 5 tables. Associated with an accepted presentation at AI through History, History through AI, C2DH, University of Luxembourg, 15-16 June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25763 2026-06-25 cs.CV 新提交 67%

ShutterMuse: Capture-Time Photography Guidance with MLLMs

ShutterMuse: 基于多模态大语言模型的拍摄时刻摄影指导

Jiayu Li, Yixiao Fang, Tianyu Hu, Wei Cheng, Ping Huang, Zheheng Fan, Gang Yu, Xingjun Ma

机构 * Fudan University(复旦大学) StepFun

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出CaptureGuide-Bench基准测试,评估MLLM在摄影师构图与主体姿态推荐方面的能力,并构建ShutterMuse统一模型,通过监督与强化微调实现最佳综合性能。

Comments Project Page:https://lijayutnt.github.io/ShutterMuse

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25634 2026-06-25 cs.CV 新提交 67%

SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity

SSMNBench: 通过单视图充分性与多视图必要性诊断基于图像的跨视角人-物理解

Tianchen Guo, Chen Liu, Ling Chen, Xin Yu

机构 * The University of Queensland(昆士兰大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) University of Technology Sydney(悉尼科技大学) Follow Me AI Pty LTD(Follow Me AI有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出SSMNBench基准,通过单视图充分性(SVS)和多视图必要性(MVN)任务分类,诊断MLLM在跨视角人-物理解中的视觉干扰退化和跨视角融合失败问题。

Comments European Conference on Computer Vision (ECCV). 32 pages, 10 figures. The code is available at: $ \href{https://github.com/gtc-gh/SSMNBench}{\text{SSMNBench}} $

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25334 2026-06-25 cs.MA 新提交 67%

Bridging the Post-discharge Gap: A Traceable Multi-agent Framework for Safe and Continuous Care

弥合出院后鸿沟:用于安全持续护理的可追溯多智能体框架

Runwei Guan, Yi Zhou, Heyi Lin, Jinjing Zhu, Mingyuan Hou, Yang Yang, Fang Yuan, Xiaohong Lin, Shaofeng Liang, Xuming Hu, Tao Li, Tianbin Zhao, Yutao Yue, Zhiyuan Wang, Hui Xiong

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出Healink框架,通过记忆增强的多智能体架构和约束检索生成,实现基于处方的可追溯出院后随访,在回顾性和盲评中优于医生基线。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25279 2026-06-25 cs.CV 新提交 67%

MRI2Rep: Autoregressive Structured Report Generation for 3D Liver MRI

MRI2Rep:3D肝脏MRI的自回归结构化报告生成

Xinran Li, Junlin Yang, Annabella Shewarega, Zongwei Zhou, Julius Chapiro, James S. Duncan, Lawrence H. Staib

机构 * Department of Biomedical Engineering(生物医学工程系) Department of Radiology & Biomedical Imaging(放射学与生物医学影像系) Department of Electrical Engineering(电气工程系) Yale University(耶鲁大学) Johns Hopkins University(约翰霍普金斯大学) Johns Hopkins Medicine(约翰霍普金斯医学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出MRI2Rep自回归框架,通过报告到标签规范化模块将自由文本转换为结构化诊断序列,实现3D肝脏MRI的端到端结构化报告生成,在真实数据集上优于基线方法。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25084 2026-06-25 cs.CV 新提交 67%

Are We There Yet? Exploring the Capabilities of MLLMs in Assistive AI Applications

我们到了吗?探索多模态大语言模型在辅助人工智能应用中的能力

Shayon Dasgupta, Avijit Dasgupta, C. V. Jawahar

机构 * IIT BHU India(印度理工学院瓦拉纳西校区) CVIT, IIIT Hyderabad India(印度海得拉巴国际信息技术学院计算机视觉与信息技术中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文通过真实世界任务评估多模态大语言模型在辅助AI中的表现,开发NetraLink系统收集基准数据,揭示其优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14609 2026-06-25 cs.CV 版本更新 67%

GroundSet: A Cadastral-Grounded Dataset for Spatial Understanding with Vector Data

GroundSet: 基于地籍数据的空间理解向量数据集

Roger Ferrod, Maël Lecene, Krishna Sapkota, George Leifman, Vered Silverman, Genady Beryozkin, Sylvain Lobry

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对多模态大模型在遥感精细空间理解上的不足,提出基于地籍矢量数据的大规模数据集,含510k高分辨率图像和380万标注对象,通过指令微调基准验证,标准架构可掌握细粒度空间定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25990 2026-06-25 cs.CL cs.AI cs.SD 新提交 62%

SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

SpeechEQ: 社交感知语音对话模型的情商基准测试

Liang-Yuan Wu, Zih-Ching Chen, Tongshuang Wu, Chao-Han Huck Yang, Hua Shen

机构 * New York University(纽约大学) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) NYU Shanghai(上海纽约大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SpeechEQ框架,基于EQ-i 2.0理论构建2265个对话数据集,通过口语情商(SEQ)评分评估语音语言模型在主动多轮对话中的副语言社交线索推理能力,揭示端到端模型存在模态捷径、安全陷阱和上下文遗忘等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25871 2026-06-25 cs.IR cs.AI 新提交 57%

AutoRelAnnotator: Calibrated Model Cascades for Cost-Efficient Relevance Evaluation in Sponsored Search

AutoRelAnnotator: 用于赞助搜索中成本高效的相关性评估的校准模型级联

Md Omar Faruk Rokon, Shasvat Desai, Hong Yao, Kuang-chih Lee

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出校准模型级联方法,通过路由查询至逐步增大的微调分类器,在保持高准确率的同时降低计算成本,实现大规模离线相关性标注。

Comments Accepted at E-commerce workshop, SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25306 2026-06-25 cs.CV cs.AI 新提交 57%

Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

物理问题场景图:文本到视频生成中物理合理性的细粒度评估

Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) AI2(艾伦人工智能研究所) Johns Hopkins University(约翰霍普金斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出物理问题场景图(PQSG),一种基于层次化问题的评估流程,通过图结构问题检查视频在对象、动作和物理规律上的忠实度,实现细粒度评估。

Comments ECCV 2026. Code and data: https://github.com/atinpothiraj/pqsg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25246 2026-06-25 cs.CV cs.CL 新提交 57%

Multilingual Hematology Visual Question Answering Dataset

多语言血液学视觉问答数据集

Hajra Malik, Hafiza Tooba Aftab, Abdul Rehman, Mohsen Ali, Waqas Sultani

机构 * Information Technology University, Lahore(拉合尔信息技术大学) King Edward Medical University, Lahore(拉合尔爱德华国王医科大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 针对医疗领域多语言视觉问答资源匮乏的问题,构建了双语(英语-乌尔都语)血液学VQA基准WBCMor VQA,包含11万问答对和2万细胞图像,并评估了多个开源视觉语言模型。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25761 2026-06-25 cs.LG math.OC 新提交 57%

Bridging Spherical Black-Box Optimizers

桥接球形黑箱优化器

Johannes Ackermann, Stefano Peluchetti

机构 * The University of Tokyo(东京大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 将进化策略、共识优化和积分优化统一为理论框架,通过引入混合优化器控制平坦偏好和模态,在连续控制和语言模型合并任务中提升性能与鲁棒性。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23842 2026-06-25 cs.CL 版本更新 57%

How Pragmatics Shape Articulation: A Computational Case Study in STEM ASL Discourse

语用如何塑造发音:STEM ASL 话语的计算案例研究

Saki Imai, Lee Kezar, Laurel Aichler, Mert Inan, Erin Walker, Alicia Wooten, Lorna Quandt, Malihe Alikhani

机构 * Northeastern University(东北大学) Gallaudet University(盖尔道特大学) University of Pittsburgh(匹兹堡大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 通过采集 STEM 领域美国手语对话的运动捕捉数据,量化分析对话、独白和翻译场景中手语发音的时空变化,发现对话中手语持续时间显著缩短,并评估了手语嵌入模型对 STEM 手语的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25899 2026-06-25 cs.MA 新提交 50%

Manipulation Is Task-Dependent: A Multi-Axis, Multi-Environment Evaluation of Frontier LLMs

操纵行为依赖于任务:前沿语言模型的多轴、多环境评估

Adeeb Zaman, Erik Nordby, Fred Heiding

专题命中 评测与基准 :language model(abstract)

AI总结 通过六种环境、三个轴(框架、激励结构、任务难度)评估六个前沿语言模型的操纵行为,发现操纵倾向在不同任务间相关性低,且不同环境下驱动因素不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25880 2026-06-25 cs.CV 新提交 50%

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习

Yuchen Xie, Xinyu Zhou, Kuangji Zuo, Yanshuo Lu, Fengrui Huang, Boyu Ma, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :prompting(abstract)

AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25877 2026-06-25 cs.RO 新提交 50%

TacVerse: A Multi-Sensor Dataset and Benchmark for Cross-Sensor Vision-Based Tactile Perception

TacVerse:面向跨传感器视觉触觉感知的多传感器数据集与基准

Lan Wei, Gurmeher Khurana, Sirine Bhouri, Wenhao Hong, Zeyuan Xin, Qingzheng Cong, Wen Fan, Yanzheng Xiang, Dandan Zhang

机构 * Imperial College London(帝国理工学院) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出TacVerse多传感器数据集与基准,包含7种视觉触觉传感器的106800张图像,支持形状分类、光栅分类和力回归任务,实验表明跨传感器直接迁移性能下降,而少样本适应可提升力回归性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25437 2026-06-25 cs.CV 新提交 50%

LinStereo: Linear-Complexity Global Attention for Multi-Scale Iterative Stereo Matching

LinStereo:用于多尺度迭代立体匹配的线性复杂度全局注意力

Yiran Wang, Oliver Turner, Viorela Ila

机构 * Australian Centre for Robotics (ACFR), School of Aerospace, Mechanical and Mechatronic Engineering (AMME), Faculty of Engineering, The University of Sydney(悉尼大学工程学院航空航天、机械与机电工程学院澳大利亚机器人中心(ACFR))

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出LinStereo,通过位置感知线性注意力实现全局聚合,结合层次化语义代价体积和深度先验初始化,在标准基准和跨域场景(尤其水下)取得最先进精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25298 2026-06-25 cs.CV 新提交 50%

KidRisk: Benchmark Dataset for Children Dangerous Action Recognition

KidRisk:儿童危险动作识别基准数据集

Minh-Kha Nguyen, Trung-Hieu Do, Kim Anh Phung, Thao Thi Phuong Dao, Minh-Triet Tran, Trung-Nghia Le

机构 * Thong Nhat Hospital(统一医院)

专题命中 评测与基准 :language model(abstract)

AI总结 构建包含2500个短视频和10000张图像的儿童危险动作数据集KidRisk,提出基于视觉语言模型的方法,在动作分类和危险识别上分别达到83.53%和96.14%的准确率。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20402 2026-06-25 q-bio.QM 50%

Transformer-Based Hematological Malignancy Prediction from Peripheral Blood Smears in a Real-World Cohort

基于Transformer的外周血涂片预测血液恶性肿瘤的模型

Muhammed Furkan Dasdelen, Ivan Kukuljan, Peter Lienemann, Fatih Ozlugedik, Ario Sadafi, Matthias Hehr, Karsten Spiekermann, Christian Pohlkamp, Carsten Marr

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出cAItomorph模型,利用Transformer架构对外周血单细胞图像进行分类,实现高准确率的血液恶性肿瘤诊断,减少骨髓穿刺次数。

Comments 17 pages, 6 figures. Leukemia (2026)

Journal ref Leukemia 40, 1318-1322 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13731 2026-06-25 cs.CV 版本更新 50%

GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization

GeoRanker:面向全球图像地理定位的距离感知排序

Pengyue Jia, Seongheon Park, Song Gao, Xiangyu Zhao, Sharon Li

机构 * Department of Data Science, City University of Hong Kong(城市大学数据科学系) Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Department of Geography, University of Wisconsin-Madison(威斯康星大学麦迪逊分校地理系)

专题命中 评测与基准 :language model(abstract)

AI总结 提出GeoRanker框架,利用大视觉语言模型联合编码查询-候选交互并预测地理邻近性,引入多阶距离损失以建模结构化空间关系,在IM2GPS3K和YFCC4K基准上达到最优。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏