arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1356 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1356 篇

2605.21930 2026-08-04 cs.SE 版本更新 50%

PITMuS: A Tool for Automated Bug Dataset Generation via Source-Level Mutant Reconstruction

PITMuS: 通过源级变异体重建实现自动化bug数据集生成工具

Tasfia Tasnim, Soneya Binta Hossain

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出PITMuS工具,通过源级变异体重建生成自动化bug数据集,解决现有工具生成的变异体难以复现和利用的问题,为bug定位和修复技术提供结构化数据支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05637 2026-08-04 cs.SE 版本更新 50%

Real Faults in Model Context Protocol (MCP) Software: a Comprehensive Taxonomy

模型上下文协议(MCP)软件中的真实故障:一种全面的分类

Mina Taraghi, Mohammad Mehdi Morovati, Foutse Khomh

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文首次提出MCP服务器故障的分类,通过实证研究识别出五个高层故障类别,揭示MCP特定故障与非MCP故障的区别,为提升AI软件系统的可靠性提供依据。

Comments Revised version following peer review. Expanded methodological details, practitioner-survey validation, statistical analyses, and discussion; main conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14546 2026-08-04 cs.RO 版本更新 50%

QuASH: Using Natural-Language Heuristics to Query Visual-Language Robotic Maps

QuASH:使用自然语言启发式方法查询视觉语言机器人地图

Matti Pekkanen, Francesco Verdoja, Ville Kyrki

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出QuASH方法,利用自然语言启发式处理查询相关的语言空间,训练分类器划分环境,提升地图和图像的可查询性,该方法与表示及编码器无关且训练量有限。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13415 2026-08-03 cs.CV 版本更新 50%

Distance-aware Soft Prompt Guidance for Multimodal Valence-Arousal Estimation

面向距离的软提示学习用于多模态愉悦-唤醒估计

Byeongjin Jung, Chanyeong Park, Sejoon Lim

机构 * Graduate School of Automobile and Mobility(汽车与移动研究生院) Department of Automobile and IT Convergence(汽车与IT融合系)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出一种多模态框架,通过引入距离感知的软提示学习,提升多模态愉悦-唤醒估计的精度,在无约束场景中取得良好效果。

Comments 8pages

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026, pp. 5294-5301

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27011 2026-07-31 eess.AS 版本更新 50%

Qwen-Audio-3.0-Gen-Preview Technical Report

Qwen-Audio-3.0-Gen-Preview 技术报告

Junyu Dai, Xiaoyue Duan, Xinyue Fan, Yihan Feng, Jingbei Li, Xiangang Li, Yunjia Li, Lejun Min, Yufei Shi, Xingchen Song, Yiran Wang, Cheng Wen, Menglin Wu, Bajian Xiang, Huaicheng Zhang, Han Zhao, Ruichen Zheng

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有音频系统难以组织多类型音频形成长时场景的问题,提出 Qwen-Audio-3.0-Gen-Preview 框架,采用 DiT 与共享 VAE 实现统一多域音频生成,在多个基准上展现出性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26518 2026-07-31 cs.CV 版本更新 50%

EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding

EgoSafe:用于视觉安全理解的第一人称移动采集基准

Yuyun Chen, Tianao Li, TianQuan Feng, Cen Chen, Huiping Zhuang, Hao Peng, Ziqian Zeng

机构 * South China University of Technology(华南理工大学) Beihang University(北京航空航天大学)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究推出第一人称移动采集的视觉安全理解基准 EgoSafe-Bench,含12000个样本,用分层推理评估(HRE)协议测试,发现现有大视觉语言模型存在感知-推理解耦问题,为逻辑鲁棒视频理解系统提供评估框架

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25946 2026-07-31 cs.SE 版本更新 50%

A Low-Cost Human-in-the-Loop Investigation of Toxicity on GitHub at Scale

大规模低成本的 GitHub 毒性人工参与调查

Rahat Rizvi Rahman, Mia Mohammad Imran, Kostadin Damevski

专题命中 评测与基准 :LLM(abstract)

AI总结 研究 GitHub 毒性标注问题,提出人工参与注释方法,通过小型本地语言模型预测及随机森林验证器筛选,降低标注成本,应用此流程处理大量对话,评估先前研究发现并给出新见解。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21076 2026-07-31 cs.CV 版本更新 50%

PoseMaster: A Unified 3D Native Framework for Stylized Pose Generation

PoseMaster: 一个统一的3D原生框架用于风格化姿态生成

Hongyu Yan, Kunming Luo, Weiyu Li, Kaiyi Zhang, Yixun Liang, Jingwei Huang, Chunchao Guo, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Hunyuan(腾讯文脉)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出PoseMaster框架,通过统一姿态风格化与3D生成,提升3D姿态风格化的精度和多样性,采用3D骨架直接指导生成,增强模型在姿态风格化中的表现。

Comments Accepted by CVPR 2026, Code: https://github.com/hanryyan/PoseMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21007 2026-07-31 cs.CV 版本更新 50%

MetaRank: Task-Aware Metric Selection for Model Transferability Estimation

MetaRank: 为模型可迁移性估计的任务感知度量选择

Yuhang Liu, Wenjie Zhao, Xin Wang, Yunhui Guo

机构 * Fudan University(复旦大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 评测与基准 :language model(abstract)

AI总结 MetaRank通过元学习框架实现任务感知的MTE度量选择,提升模型迁移性估计的准确性。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23704 2026-07-30 cs.RO cs.CV 版本更新 50%

LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratory

LabRobFail:化学自动驾驶实验室中机器人故障分析的基准

Haobo Wang, Baoli Sun, Anqi Zou, Dongsheng Huang, Zelin Lv, Ning Wang, Rui Li, Dongzhan Zhou, Weiyu Guo, Zhihui Wang, Wanli Ouyang

专题命中 评测与基准 :language model(abstract)

AI总结 针对化学自动驾驶实验室中机器人可靠性受化学实验特性限制、故障数据稀缺及评估协议缺乏等问题,引入LabRobFail框架,通过注入故障构建数据集,开发专门模型,提升故障检测等能力及下游任务成功率。

Comments Under review. Haobo Wang and Baoli Sun contributed equally. Code and data: https://github.com/Su-ISE-2001/SciRobo

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21534 2026-07-29 cs.CY econ.GN q-fin.EC 版本更新 50%

Generative AI Availability, Grades, and Student Satisfaction at a Large University

大型大学中生成式人工智能的可用性、成绩与学生满意度

James M. Zumel Dumlao, Meng Wang, Zhonghan Xie, Junyao Hu, Ivan Bar, George Chaney, Henry Gold, Misha Teplitskiy

专题命中 评测与基准 :LLM(abstract)

AI总结 研究大型大学中GenAI对学生成绩和满意度的影响,通过教学大纲和行政数据,用差异中的差异设计及人工验证的大语言模型管道衡量课程GenAI易感性,发现GenAI对成绩和自我报告理解无显著差异影响,仅在特定假设下对兴趣有显著影响,缓解相关担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06020 2026-07-29 cs.CV 版本更新 50%

ReSAGE-PAR: Representational Similarity Assessment for Generative Expansion in Pedestrian Attribute Recognition

ReSAGE-PAR:行人属性识别中生成式扩展的表征相似性评估

Pablo Ayuso-Albizu, Pablo Carballeira, Juan C. SanMiguel, Paula Moral

机构 * Universidad Autónoma de Madrid(阿隆托纳大学马德里分校)

专题命中 评测与基准 :prompting(abstract)

AI总结 针对行人属性识别数据稀缺问题,提出ReSAGE-PAR管道,通过扩散模型生成图像并利用贝叶斯分类器验证属性,实现可扩展的高保真数据集扩展,在标准骨干网络上提升高达8.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16618 2026-07-29 cs.CV eess.IV q-bio.TO 版本更新 50%

SurgSLOT: Segment Anything in Surgical Videos via Semantic Long-term Tracking

通过语义长期跟踪实现手术视频的分割:SAM2S

Haofeng Liu, Ziyue Wang, Sudhanshu Mishra, Mingqi Gao, Guanyi Qin, Chang Han Low, Alex Y. W. Kong, Zhu Zhuo, Huazhu Fu, Joseph S. Ng, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 SAM2S通过语义长期跟踪提升手术视频分割性能,实现更准确的零样本泛化和实时推理

Comments 19 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21050 2026-07-28 cs.CV 版本更新 50%

HyperImageNet: A Large-Scale High-Spatial Resolution Hyperspectral Imagery Classification Benchmark

HyperImageNet:一个用于细粒度高光谱土地覆盖理解的大规模基准

Chuguang Zeng, Jingtao Li, Yinhe Liu, Yanfei Zhong

专题命中 评测与基准 :foundation model(abstract)

AI总结 介绍用于细粒度高光谱土地覆盖理解的HyperImageNet基准,含原始图像等数据,支持语义和实例分割,建立开放环境基准评估方法和模型,实验证明其在相关研究中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19535 2026-07-28 cs.CV 版本更新 50%

Synthetic and Derived Training Images for Campus Waste Detection: A Multi-Seed Evaluation with YOLOv8n

用于校园垃圾检测的合成与派生训练图像:基于YOLOv8n的多种子评估

Ali Behbahani, Newsha Javanmardi, Shahriar Ahmed, Phouvadeth Vathana

机构 * University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校)

专题命中 评测与基准 :pretraining(abstract)

AI总结 研究校园垃圾检测中合成与派生图像对YOLOv8n检测器的作用,通过多种子实验设置不同联合训练配置,对比不同图像来源及处理方式下的检测效果,发现各配置未超真实图像基线,测试集小难得出特定类别有力结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10577 2026-07-28 cs.RO 版本更新 50%

AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness

AgenticNav:零样本视觉与语言导航作为工具调用框架

Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 评测与基准 :language model(abstract)

AI总结 提出AgenticNav,通过将动作、深度和记忆作为可调用工具暴露给VLM,实现零样本连续环境导航,在R2R-CE基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12351 2026-07-28 cs.CV 版本更新 50%

Fundus Image-based Glaucoma Screening via Retinal Knowledge-Oriented Dynamic Multi-Level Feature Integration

基于视网膜图像的青光眼筛查:面向视网膜知识的动态多级特征整合

Chi Liu, Yuzhuo Zhou, Sheng Shen, Zongyuan Ge, Fengshi Jing, Shiran Zhang, Yu Jiang, Anli Wang, Wenjian Liu, Feilong Yang, Tianqing Zhu, Xiaotong Han

机构 * State Key Laboratory of Ophthalmology, Zhongshan Ophthalmic Center, Sun Yat-sen University, Guangdong Provincial Key Laboratory of Ophthalmology and Vision Science, Guangdong Provincial Clinical Research Center for Ocular Diseases(眼科学国家重点实验室、中山眼科中心、中山大学、广东省眼科学重点实验室和视觉科学、广东省眼科临床研究中心) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Hainan International College, Minzu University of China(海南国际学院,中国民族大学) School of Information Technology, Faculty of Business and Hospitality, Torrens University Australia(澳大利亚托伦斯大学信息科技学院,商业与酒店管理学院) AIM for Health Lab, Faculty of IT, Monash University, Australia(健康AIM实验室,墨尔本大学IT学院,澳大利亚) Department of Ophthalmology, Guangzhou First People’s Hospital, the Second Affiliated Hospital of South China University of Technology(广州第一人民医院,华南理工大学第二附属医院) The Third Xiangya Hospital of Central South University(中南大学湘雅医学院第三医院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出基于视网膜知识的动态多级特征整合框架,通过动态窗口机制和知识增强卷积注意力模块提升青光眼筛查的鲁棒性,实验表明其在AIROGS数据集上达到98.5%的AUC和94.6%的准确率。

Comments 15 pages. Published in Knowledge-based System

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08521 2026-07-28 cs.CV cs.RO eess.IV 版本更新 50%

OccTrack360: 4D Panoptic Occupancy Tracking from Surround-View Fisheye Cameras

OccTrack360: 从环视鱼眼相机实现4D全景占用跟踪

Yongzhi Lin, Kai Luo, Yuanfan Zheng, Hao Shi, Mengfei Duan, Yang Liu, Kailun Yang

机构 * School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(极端光子学与仪器国家重点实验室,浙江大学) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学)

专题命中 评测与基准 :SLM(abstract_cn)

AI总结 OccTrack360提出新的4D全景占用跟踪基准及FoSOcc框架,解决鱼眼成像中的球面投影和体素定位问题,提升占用跟踪性能。

Comments Accepted to IEEE/RSJ IROS 2026. The benchmark and source code will be made publicly available at https://github.com/YouthZest-Lin/OccTrack360

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12291 2026-07-27 cs.RO cs.CV 版本更新 50%

OpenNavMap: Multi-Session Appearance-Based Topometric Mapping for Scalable Visual Navigation

OpenNavMap: 无需结构的拓扑制图通过大规模协作定位

Jianhao Jiao, Changkun Liu, Jingwen Yu, Boyi Liu, Qianyi Zhang, Yue Wang, Dimitrios Kanoulas

机构 * Robot Perception and Learning Lab, Intelligent Robotics, Department of Computer Science, University College London(机器人感知与学习实验室,智能机器人,计算机科学系,伦敦大学学院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) Institute of Robotics and Automatic Information System, Nankai University(机器人与自动信息系统研究所,南开大学) College of control science and engineering, Zhejiang University(控制科学与工程学院,浙江大学) AI Centre, Department of Computer Science, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 OpenNavMap通过大规模协作定位实现无需结构的拓扑制图,利用3D几何模型进行按需重建,实现高精度的子图对齐和全局一致性。

Comments 21 pages, 20 figures, https://rpl-cs-ucl.github.io/OpenNavMap_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00713 2026-07-27 cs.CV 版本更新 50%

RAD: A Dataset and Benchmark for Real-Life Anomaly Detection with Robotic Observations

RAD:面向机器人观测的真实异常检测数据集与基准

Kaichen Zhou, Xinhai Chang, Taewhan Kim, Jiadong Zhang, Yang Cao, Chufei Peng, Fangneng Zhan, Hao Zhao, Hao Dong, Kai Ming Ting, Ye Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Great Bay University(大湾大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Nanjing University(南京大学) Deakin University(德克萨斯大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出RAD数据集,包含13类日常物体和4种缺陷,从60多个机器人视角在非受控光照下采集,用于评估2D特征、3D重建和视觉语言模型在姿态无关的异常检测中的表现,发现2D方法优于3D和VLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18336 2026-07-24 cs.RO cs.CV 版本更新 50%

Enhancing Glass Surface Reconstruction via Depth Prior for Robot Navigation

通过深度先验增强玻璃表面重建以提升机器人导航

Jiamin Zheng, Jingwen Yu, Guangcheng Chen, Hong Zhang

机构 * Shenzhen Key Laboratory of Robotics and Computer Vision(机器人与计算机视觉深圳重点实验室) Southern University of Science and Technology(南方科技大学) CKS Robotics Institute(CKS机器人研究院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出一种无需训练的框架,利用深度基础模型作为结构先验,结合鲁棒的局部RANSAC对齐方法,融合原始传感器深度数据,从而避免错误的玻璃测量污染,恢复准确的度量尺度,并引入新的RGB-D数据集用于玻璃区域的几何真实值。

Comments 9 pages, 8 figures, Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20509 2026-07-24 cs.CV 版本更新 50%

Lessons and Open Questions from a Unified Study of Camera-Trap Species Recognition Over Time

从时间维度上统一研究相机陷阱物种识别的启示与开放问题

Sooyoung Jeon, Hongjie Tian, Lemeng Wang, Zheda Mai, Vidhi Bakshi, Jiacheng Hou, Ping Zhang, Arpita Chowdhury, Jianyang Gu, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Boston University(波士顿大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文通过统一研究相机陷阱物种识别的时间变化,揭示了生态实践中维持可靠识别的挑战,提出了一种真实场景的基准测试,并发现生物基础模型在多个站点表现不佳,适应性困难,以及类不平衡和时间偏移是主要因素。

Comments The first three authors contribute equally. Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17820 2026-07-23 cs.CV 版本更新 50%

PRiSM: Prototype Regularization for Few-Shot VLMs

PRiSM:少样本视觉语言模型的原型正则化

Ghassen Baklouti, Omprakash Chakraborty, Jose Dolz, Ismail Ben Ayed

机构 * ÉTS Montreal(蒙特利尔高等商学院)

专题命中 评测与基准 :language model(abstract)

AI总结 研究针对视觉语言模型少样本适应方法,质疑现有基准假设,引入新基准。提出PRiSM类原型正则化方法,优化多术语损失,结合有效优化器,提升性能,尤其在处理类不平衡和大量类时效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08075 2026-07-23 cs.CV 版本更新 50%

UAV-OVVIS: Unmanned Aerial Vehicles Also Need Open-Vocabulary Video Instance Segmentation

无人机-开放词汇视频实例分割:无人机也需要开放词汇视频实例分割

Mingyu Dou, Shi Qiu, Ming Hu, Yifan Chen, Zhe Sun

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对无人机视频感知在开放场景中支持灵活查询和细粒度实例级动态理解不足的问题,提出无需训练的AeroTrack统一框架,构建AeroVIS评估基准,其实例化变体在无人机场景表现优异,还发布框架和基准以支持后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15403 2026-07-23 cs.CV 版本更新 50%

Pointing-Based Object Recognition

基于指目标识的对象识别

Lukáš Hajdúch, Viktor Kocur

机构 * Comenius University, Bratislava, Slovakia(科门纽斯大学,布拉迪斯拉发,斯洛伐克)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出了一种识别人类指目标识的综合流程,结合物体检测、姿态估计和视觉语言模型等方法,通过单张图像重建3D空间信息提升目标识别精度。

Comments Submitted to InnovAIte conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28884 2026-07-22 eess.AS 版本更新 50%

GigaSpeechBench: A Real-World Multilingual Speech-to-Text Benchmark

GigaSpeechBench:一个真实世界的多语言语音到文本基准

Yujie Tu, Yifan Yang, Tianrui Wang, Yanqiao Zhu, Guodong Lin, Mingchen Shao, Haoran Wang, Junzhe Liu, Yuxiang Fu, Yizhou Peng, Changsong Liu, Peng Wang, Zhikang Niu, Yunchong Xiao, Haolong Zheng, Xiuwen Zheng, Xulin Fan, Wei-Qiang Zhang, Lei Xie, Longbiao Wang, Eng-Siong Chng, Jiajun Zhang, Kele Xu, Jianwei Yu, Binbin Zhang, Jiayu Du, Wupeng Wang, Zhigao Chen, Yuzhong Wu, Zhendong Peng, Bin Ma, Guoguo Chen, Xipeng Qiu, Mark Hasegawa-Johnson, Kai Yu, Zhifu Gao, Xiangang Li, Xie Chen

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出GigaSpeechBench,一个包含680小时人工标注语音的多语言多维度ASR和AST基准,覆盖低资源语言、方言、口音、专业术语和年龄变化,揭示现有模型在挑战场景下的性能退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23670 2026-07-22 cs.CV 版本更新 50%

Zero-Shot DINOv3-Based Image Matching via Many-to-Many Association

在多对多关联中部署DINO

Haodong Jiang, Mingzhe Li, Junfeng Wu

专题命中 评测与基准 :prompting(abstract)

AI总结 为解决监督图像匹配模型在未见图像领域泛化能力有限的问题,本文探索了DINO特征的零样本部署。通过多对多匹配范式提升鲁棒性,并提出更高效的Harmonic Consensus Maximization机制,展示了其在相机姿态估计中的有效性。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14830 2026-07-21 cs.SE 版本更新 50%

AI Prototyper: A Figma Plugin for Decomposition-Based GUI Prototyping with LLMs

AI原型制作器:一个用于基于分解的GUI原型制作的Figma插件

Tawatchai Salangsingha, Ashkan Sami, Md Zia Ullah, Iain McGregor

专题命中 评测与基准 :LLM(abstract)

AI总结 研究针对GUI原型制作耗时问题,提出AI Prototyper插件,通过分解和检索增强生成管道,结合特定技术栈与大语言模型,经人工参与编辑步骤,能多语言输入,在时间和质量维度上表现良好。

Comments Accepted at the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), Tool Demonstration and Data Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12428 2026-07-21 cs.CR 版本更新 50%

Trust but Verify? Uncovering the Security Debt of Autonomous Coding Agents

信任但要验证?揭示自主编码代理的安全债务

A H M Nazmus Sakib, Dipayan Banik, Murtuza Jadliwala

专题命中 评测与基准 :LLM(abstract)

AI总结 本文利用AIDev数据集,通过大语言模型评判框架和人工分析,研究自主编码代理生成拉取请求中的安全代码异味。发现38.9%的请求含安全异味,供应链问题和硬编码凭证占比高,揭示了安全风险及开发者警惕性降低问题,强调需实施上下文感知安全护栏。

Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09249 2026-07-21 cs.CV 版本更新 50%

DECIS: Dual-Evidence Corrective Verification for Interpretable Strabismus Diagnostic Decision-Making

MAGIS:基于证据的多智能体推理用于可解释的斜视临床决策

Xikai Tang, Yifan Wang, Jiafan Zhuang, Li Luo, Jinming Guo, Xiaoling Xie, Jiacheng Liu, Peiwei Wei, Lihao Zhong, Xiaoli Kang, Jie Cen, Guangqiang Yin, Kunliang Qiu, Ce Zheng, Zhun Fan

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院) Joint Shantou International Eye Center of Shantou University and The Chinese University of Hong Kong(汕头大学·香港中文大学联合汕头国际眼科中心) School of Artificial Intelligence, Guangzhou City Polytechnic(广州城市职业学院人工智能学院) Medical College, Shantou University(汕头大学医学院) College of Engineering, Shantou University(汕头大学工学院) Department of Ophthalmology, Xinhua Hospital Affiliated to Shanghai Jiaotong University School of Medicine(上海交通大学医学院附属新华医院眼科) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :language model(abstract)

AI总结 提出MAGIS框架,通过多智能体协作、双重证据约束上下文和基于证据的纠正验证机制,将斜视诊断从黑箱生成转变为结构化推理,在细粒度斜视基准上将加权F1分数从72.0%提升至91.3%,并显著提高诊断报告的临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏