arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-24 至 2026-07-24 共收录 297 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 80 篇

2607.20589 2026-07-24 cs.CL 新提交 70%

Evaluating the Effectiveness of Persona Simulation in Opinion Prediction with GPT-4.1

用GPT-4.1评估角色模拟在观点预测中的有效性

Sarah Y. Li, Ziyu Yao

机构 * Columbia University(哥伦比亚大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究用GPT-4.1测试角色模拟在观点预测中的有效性,利用相关数据集进行实验,在选举结果和医学观点预测上取得一定成果,生成对话符合角色特点,解决偏差后角色模拟在多领域观点分析等应用前景广阔。

Comments ICDM 2025 Undergraduate and High School Symposium

Journal ref Proceedings of the 2025 IEEE International Conference on Data Mining Workshops (ICDMW), pp. 2938-2942

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20452 2026-07-24 cs.AI 新提交 70%

AINTMA: Agentic AI Architecture for Autonomous Test Management with Generative Intelligence, Secure Cloud Communication and Adaptive Quality Analytics

AINTMA:用于自主测试管理的智能AI架构,具备生成式智能、安全云通信和自适应质量分析

Vinil Pasupuleti, Shyalendar Reddy Allala, Siva Rama Krishna Varma Bayyavarapu, Shrey Tyagi, Srinivasateja Songa

机构 * International Business Machines (IBM)(国际商业机器公司(IBM)) Global Atlantic Financial(全球大西洋金融公司) Docusign(DocuSign公司) Salesforce Inc(Salesforce公司) The Home Depot(家得宝公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对现代软件质量保证需求,提出AINTMA多智能体AI系统。通过六个专门智能体及安全通信框架协调,结合生成式智能等技术。经实验评估,该系统在测试优先级、周期时间、缺陷逃逸率等方面表现出色,推进了云环境下软件质量管理。

Comments 11 pages, 2 figures, 4 tables, Submitted to AICCONS (AIP Conference Proceedings format)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20439 2026-07-24 cs.CL 新提交 70%

AsymVerify at SemEval-2026 Task 6: Asymmetric Confidence-Gated Verification for Political Evasion Detection

SemEval-2026任务6中的AsymVerify:用于政治逃避检测的非对称置信门控验证

Sebastien Kawada

机构 * Kaons 𝑲 ∗

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究针对政治逃避检测难题,提出AsymVerify系统用于SemEval-2026任务6的三元分类。核心方法是对问答对分类后对低置信预测进行非对称验证,主要贡献是取得高排名,在不同数据集上提升宏F1分数,且降低推理成本。

Comments Accepted to SemEval-2026 Task 6 (CLARITY) at ACL 2026. Team AsymVerify placed 2nd of 41 teams on the official Subtask 1 leaderboard. Task: https://konstantinosftw.github.io/CLARITY-SemEval-2026/. Code: https://github.com/kaons-research/AsymVerify-ACL. Website: https://kaons.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20437 2026-07-24 cs.CL cs.CR cs.IR 新提交 70%

TopoGuard: Graph Theory Based Defenses Against Split-Knowledge Attacks on RAG

TopoGuard:基于图论的针对RAG分裂知识攻击的防御方法

Chahana Dahal, Zuobin Xiong

机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对RAG系统分裂知识攻击的防御,提出基于图论的TopoGuard方法,通过构建语义相似性图检测恶意拓扑。实验表明其在捕获攻击、运行效率和对抗性方面优于现有方法,有效防御分裂知识攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19747 2026-07-24 cs.CL 版本更新 70%

Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking

超越以相关性为中心的检索:面向评分标准的文档集选择与排序

Kailin Jiang, Lei Liu, Jian Xi, Hui Xu, Junlin Liu, Baochen Fu, Bin Li, Vichwang, Yu Lu, Haibo Shi

机构 * University of Science and Technology of China(中国科学技术大学) Yuanbao Team, Tencent(腾讯元宝团队) University of Chinese Academy of Sciences(中国科学院大学) Shandong University(山东大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对大语言模型和人工智能代理对搜索结果质量需求,提出评估-诊断-优化框架。设计SetwiseEvalKit评估基准,评估多种重排器。在此基础上提出Rubric4Setwise方法,无需训练,能以更少文档和搜索轮次实现最佳下游生成性能,验证了闭环有效性。

Comments Project Page: https://rubric4setwise.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22057 2026-07-24 cs.CL 版本更新 70%

FlyRoute: Self-Evolving Agent Profiling via Data Flywheel for Adaptive Task Routing

FlyRoute: 通过数据飞轮实现自进化代理配置以实现适应性任务路由

Rongjun Li, Ziyu Zhou, Yihang Wu

机构 * IT Innovation and Research Center, Huawei Technologies(华为技术有限公司信息技术创新与研究中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出FlyRoute,一种自进化配置框架,通过真实流量增长能力证据,提高适应性任务路由的性能。

Comments 13 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21061 2026-07-24 cs.CV 新提交 67%

MVEI & EmObserver: Empowering MLLM-Oriented Visual Emotional Intelligence via Emotion Statement Judgement

MVEI与EmObserver:通过情感陈述判断增强面向MLLM的视觉情商

Daiqing Wu, Dongbao Yang, Jiashu Yao, Hongrui Zhang, Can Ma, Yu Zhou, Sicheng Zhao

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) Chinese Academy of Sciences(中国科学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对多模态大语言模型视觉情商评估缺失问题,引入情感陈述判断公式ESJ,开发INSETS及MVEI基准,构建EmObserver模型。通过实验评估,确立了ESJ、MVEI和EmObserver在推进面向MLLM的视觉情商方面的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20868 2026-07-24 cs.CV 新提交 67%

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

ViSTR-Bench:多模态大语言模型能否从动态场景中的连续视觉线索进行推理?

Han Li, Si Liu, Zehao Huang, Dongxin Lyu, Longfei Xu, Jiahui Fu, Daxin Tian, Yuliang Xiu, Naiyan Wang

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村科学城) School of Engineering, Westlake University(西湖大学工学院) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究聚焦多模态大语言模型在动态场景中从连续视觉线索推理的能力,提出ViSTR-Bench评估套件,基于相关原则建立四维评估,含15个子任务和1340个问答对,经评估发现当前模型在复杂时空推理上有瓶颈,远不及人类。

Comments 37 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20866 2026-07-24 cs.CV 新提交 67%

Agentic Designer: Progressive Multi-Agent Collaboration for Structure-Aware Interior Layout Generation

智能设计师:用于结构感知室内布局生成的渐进式多智能体协作

Zhijing Yang, Haocheng Lin, Zhihua Xu, Haojie Li, Keze Wang, Liang Lin, Tianshui Chen

机构 * Guangdong University of Technology(广东工业大学) South China University of Technology(华南理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对室内布局生成难题,提出智能设计师这一渐进式多智能体框架,将布局生成视为迭代约束验证决策过程,通过渐进共识机制协调三个智能体,经实验验证其显著优于现有方法,提升了结构遵循和功能设计连贯性。

Comments TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20536 2026-07-24 cs.AI cs.CL cs.LG cs.MA 新提交 67%

AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use

AppWorld-UL:用于工具使用的多样化智能体-用户交互基准测试

Junzhi Chen, Harsh Trivedi, Jane Pan, Michael JQ Zhang, Tejas Srinivasan, Niranjan Balasubramanian, Ashish Sabharwal

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对当前智能体-用户交互基准测试不足,引入 AppWorld-UL 基准测试,基于 AppWorld 框架及模拟应用构建多样任务,用大型语言模型模拟用户行为,评估显示其难度大,能推动回路中工具使用智能体研究。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06642 2026-07-24 cs.LG cs.AI cs.CL 版本更新 67%

SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training

SR-TTT: 基于惊奇度的残差测试时间训练

Swamynathan V P

机构 * Swamynathan V P Department of Computer Science and Engineering Amrita School of Computing Amrita Vishwa Vidyapeetham Chennai, Tamil Nadu, India(斯瓦米纳坦·V·P 计算机科学与工程系 阿米塔学校 阿米塔大学 芬治, 印度泰米尔纳德邦)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SR-TTT通过引入损失门控稀疏记忆机制,解决纯TTT在精确回忆任务中的失败问题,利用精确注意力处理关键信息,同时保持低内存占用。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16742 2026-07-24 cs.SE 版本更新 67%

Can Automated Feedback Turn Students into Happy Prologians?

自动反馈能让学生成为快乐的Prolog程序员吗?

Ricardo Brancas, Pedro Orvalho, Carolina Carreira, Vasco Manquinho, Ruben Martins

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究在大规模课程中及时提供个性化反馈的挑战,核心方法是构建Prolog自动评估平台ProHelp并调查学生。主要贡献为得出多种反馈的有用性排名及学生对未来反馈功能的偏好,且发现学生兴趣等因素对反馈有用性感知无显著影响。

Comments In Proceedings ICLP 2026, arXiv:2607.17707

Journal ref EPTCS 450, 2026, pp. 179-195

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21324 2026-07-24 cs.CL cs.AI 新提交 62%

GRADRAG: Cross-Component Prompt Adaptation for Coordinated Multi-Agent RAG

GRADRAG:用于协调多智能体RAG的跨组件提示适应

Paolo Pedinotti, Enrico Santus

机构 * Bloomberg(彭博社)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对多智能体RAG系统各组件孤立优化问题,提出GRADRAG框架,通过将RAG流程建模为计算图,传播评估反馈更新上游智能体,在两种检索范式基准测试中优于单步细化基线,提升了系统性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20510 2026-07-24 cs.AI cs.CL 新提交 62%

Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain

电信-GAIA:电信领域智能体的双语基准测试

Dmitrii Khizbullin, Zaid Alyafeai, Abdelrahman Eldesokey, Nourah AlSultan, Raghad Alshalan, David R. Pugh, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) stc(沙特电信公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 介绍电信-GAIA双语多模态基准测试,含100个人工验证问答任务,需多跳推理,跨越多种异构源。以沙盒化Docker环境提供,通过规范化精确字符串匹配评分。评估发现其具有挑战性,为企业智能体提供测试平台和构建基准测试的模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21561 2026-07-24 cs.LG q-bio.BM 新提交 61%

Graph Learning on Ensembles of Cyclic Peptides: An Investigation of Molecular Ensemble Modeling

环肽集合上的图学习:分子集合建模研究

Aaron Feller, Kris Deibler, Maxim Secor

专题命中 评测与基准 :foundation model(abstract,comments);分类 cs.LG

AI总结 研究针对分子构象集合预测性质的问题,提出EnsembleEGNN模型,先以EGNN层编码各构象,再用集合注意力块汇集表示,经多任务自监督预训练,在环肽数据集上取得良好效果,联合BERT编码器进一步提升预测性能。

Comments Accepted to Graph Foundation Models workshop at ICML '26. Contains 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21173 2026-07-24 cs.LG 新提交 57%

Automated Synthesis and Adversarial Validation of Executable Causal Research Pipelines

可执行因果研究管道的自动合成与对抗验证

Irena Girshovitz, Dan Zeltzer, Ran Gilad-Bachrach

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 研究聚焦自动化研究系统隐性失败问题,核心方法是提出ARA框架,集成多环节到统一管道,将自然语言问题转化为可执行代码并评估。主要贡献是改变失败模式,强调有效性优先的自动化科学系统评估应综合考量答案准确性及因果声明合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21155 2026-07-24 cs.CV cs.AI 新提交 57%

CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

CRAG-MM诊断:实现对知识密集型视觉问答的逐阶段分析

Hanseok Oh, Parishad BehnamGhader, Benno Krojer, Hyunji Lee, Paul Liang, Siva Reddy, Verna Dankers

机构 * New York University(纽约大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) UNC Chapel Hill(北卡罗来纳大学教堂山分校) MIT(麻省理工学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究知识密集型视觉问答流程,引入CRAG-MM-Diagnostics诊断基准,通过逐阶段数据注释分离子问题,评估VLM并进行细粒度分析,指出知识检索和推理是主要瓶颈,还提出改进流程提升准确率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20767 2026-07-24 cs.CL 新提交 57%

Rushes: A Human Preference Dataset for Pluralistic Alignment

Rushes:用于多元对齐的人类偏好数据集

Michael Xu, Jorge Leandro, Sudha Rao, Weijia Xu, Nebojsa Jojic, Gabriel DesGarennes, Chris Quirk, Bill Dolan

机构 * Microsoft Research(微软研究院)

专题命中 评测与基准 :RLHF(abstract);分类 cs.CL

AI总结 该研究引入Rushes数据集,通过游戏界面收集用户与AI叙事交互数据。核心方法是分析用户选择模式,以量化非随机偏好。主要贡献是定位其为多元对齐诊断基准,揭示现有模型在捕捉个性化参与信号上的不足,助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20759 2026-07-24 cs.CR cs.AI cs.SE 新提交 57%

IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests

IssueTrojanBench:针对恶意问题请求对人工智能编码代理进行基准测试

Ankur Singh, Jinqiu Yang, Tse-Hsun Chen

机构 * Concordia University(康科德大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究针对恶意问题请求对人工智能编码代理进行基准测试,通过构建包含多种攻击类别和交付向量的新型基准IssueTrojanBench,发现现代编码代理存在关键漏洞,强调需更强安全机制保护。

Comments 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20121 2026-07-24 cs.CL 版本更新 57%

OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills

开放技能风险:使用现实世界中的危险第三方技能时对智能体安全性进行基准测试

Qiyuan Liu, Tingfeng Hui, Kun Zhan, Kaike Zhang, Ning Miao

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究基于语言模型的智能体使用第三方危险技能时的安全问题,构建OpenSkillRisk基准测试,涵盖多种不安全场景并能细粒度分析。实验发现当前系统处理危险技能能力不足,揭示三种失败模式,强调需改进语言模型风险推理和智能体框架执行控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23706 2026-07-24 eess.SP cs.HC cs.LG 版本更新 57%

Zero-Shot Neural Priors for Generalizable Cross-Subject and Cross-Task EEG Decoding

零样本神经先验用于可泛化的跨被试和跨任务脑电解码

Baimam Boukar Jean Jacques, Brandone Fonya, Nchofon Tagha Ghogomu, Pauline Nyaboe, Kipngeno Koech

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 针对脑电信号跨被试和跨任务泛化难题,提出零样本解码框架,采用渐进解冻策略微调Transformer,在大型数据集上实现优于基线的性能。

Comments EEG Decoding research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20114 2026-07-24 cs.CV cs.AI 版本更新 57%

Benchmarking Unlearning for Vision Transformers

对视觉变换器的去学习进行基准测试

Kairan Zhao, Iurie Luca, Peter Triantafillou

机构 * University of Warwick, United Kingdom(沃里克大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 本研究首次对视觉变换器的去学习算法进行基准测试,评估不同数据集、算法和协议的影响,揭示了VTs在记忆训练数据方面的特性及性能基线。

Comments Accepted at CoLLAs 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00945 2026-07-24 q-bio.GN cs.CV cs.LG 版本更新 57%

Evaluation and Prognostic Validation of Deep Regression Models for WSI-Based Gene-Expression Prediction

基于全切片图像的基因表达预测的深度回归模型的评估与预后验证

Fredrik K. Gustafsson, Constance Boissin, Johan Vallon-Christersson, Mattias Rantalainen

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 研究对基于全切片图像的基因表达预测的深度回归模型进行评估与验证,采用基于注意力的多实例学习与PFM特征提取器的直接回归,在多个数据集及队列中验证,证明该方法可泛化并恢复有意义分子结构,支持其用于转录组表型分析和风险分层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21588 2026-07-24 cs.RO 新提交 50%

AXIS: A Growable Community-Driven Data Engine for Scalable Robot Manipulation

AXIS:用于可扩展机器人操作的可增长社区驱动数据引擎

Mengfei Zhao, Dihong Huang, Yikai Tang, Peihao Li, Mingxuan Yan, Ruiqi Zhuang, Yanjia Huang, Jie Wang, Hai Zhai, Tony Zhou, Rui Zhang, Zhexi Luo, Yuchen Huang, Jianfei Yang, Jiachen Li

机构 * Axis Robotics(轴机器人公司) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院) Texas A&M University(德州农工大学) Johns Hopkins University(约翰·霍普金斯大学) University of Pennsylvania(宾夕法尼亚大学) University of Michigan(密歇根大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 研究针对机器人操作策略学习中数据管道难扩展的问题,提出AXIS这一可增长社区驱动数据引擎,它能收集、处理数据并组织成任务快照,通过实验表明其能提升模型性能且随数据量增加有一致扩展性。

Comments Project Website: https://axisaiorg.github.io/AXIS-V1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21564 2026-07-24 cs.CR 新提交 50%

Where You Tap Matters: A Probe-and-Model Benchmark for Open-Set RF Fingerprinting

你点击的位置很重要:开放集射频指纹识别的探测与建模基准

Gabriele Oligeri, Savio Sciancalepore, Ingrid Huso, Fatima Al-Mousawi

专题命中 评测与基准 :LLM(abstract)

AI总结 研究射频指纹识别中样本收集位置对性能的影响,通过在五个探测点收集数据评估开放集、重建误差RFFI,发现其强烈依赖探测点,定时恢复等效果好,还通过基准测试验证,表明探测点选择比自动编码器复杂性更主导性能。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21462 2026-07-24 cs.CY 新提交 50%

White Box Evidence Packages for Policy Audit Reports

政策审计报告的白盒证据包

Seunghyun Yoo

专题命中 评测与基准 :LLM(abstract)

AI总结 研究在政策审计中评审者如何判断报告有无证据支持,引入可控评估框架,在多种证据条件下生成报告让评审员评估。结果显示内部证据影响报告引用推理方式,混合接口最有用,随机控制揭示风险,还将内部模型访问重构为证据设计问题。

Comments 16 pages, 5 figures. Presented at the Second Workshop on Technical AI Governance Research (TAIGR) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21193 2026-07-24 cs.LO cs.SE 新提交 50%

What Bugs Do Prolog Students Write? An Empirical Taxonomy and Data-Driven Mutation Framework

Prolog学生编写的错误类型有哪些?实证分类法和数据驱动的变异框架

Ricardo Brancas, Pedro Orvalho, Carolina Carreira, Vasco Manquinho, Ruben Martins

专题命中 评测与基准 :language model(abstract)

AI总结 研究Prolog学生编写的错误类型,通过对7201份提交人工分类得出细粒度分类法,据此开发数据驱动的LogMorph变异工具,其操作符加权,评估显示合成错误分布与学生分布匹配,指出残留差异来源及改进方向。

Comments In Proceedings ICLP 2026, arXiv:2607.17707

Journal ref EPTCS 450, 2026, pp. 163-178

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21071 2026-07-24 cs.CV cs.MM cs.RO 新提交 50%

TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects

TransBiolab:一个杂乱透明生物医学物体的真实世界多视图数据集

Ke Ma, Yifei Wang, Meng Wang, Tian Xia

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) College of Design and Innovation, Tongji University(同济大学设计创意学院) Shanghai Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能无人系统研究院) School of Software and Engineering, Huazhong University of Science and Technology(华中科技大学软件学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对自主生物医学实验室透明物体视觉感知数据稀缺问题,提出TrainsBiolab真实世界多视图数据集,含多物体杂乱、遮挡场景数据及多种注释,定义相关基准并评估,为自主实验室操作视觉任务提供资源。

Comments 9 pages, 10 figures, accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21022 2026-07-24 cs.CV 新提交 50%

ProCap: Prominence-guided Object Rectification for Faithful and Comprehensive Video Captioning

ProCap:用于忠实和全面视频字幕的突出引导对象校正

Debjyoti Das Adhikary, Aritra Hazra, Partha Pratim Chakrabarti

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Kharagpur(印度理工学院卡拉格布尔分校计算机科学与工程系)

专题命中 评测与基准 :language model(abstract)

AI总结 研究针对视频字幕质量提升问题,提出突出感知的迭代事后校正框架。通过轻量级评分机制排序对象,经提示驱动细化循环多轮注入相关对象。在多数据集验证,相比基线提升完整性、减少幻觉,提供了轻量级且模型无关的视频字幕优化途径。

Comments 10 pages, 7 figures, 5 tables. Submitted to IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20780 2026-07-24 cs.CV 新提交 50%

Rethinking Open-World Video Anomaly Detection: Diagnosing Definition Blindness

重新思考开放世界视频异常检测:诊断定义盲目性

Inpyo Song, Jangwon Lee

专题命中 评测与基准 :language model(abstract)

AI总结 研究开放世界视频异常检测中定义盲目性问题,分解动态定义评估,引入三个定义条件评估指标及DeCoS,指出OWVAD应按定义条件异常评分评估,改进了多个基线模型的定义跟随能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏