arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2606.10525 2026-06-10 cs.CR cs.AI 新提交 70%

Assessing Automated Prompt Injection Attacks in Agentic Environments

评估智能体环境中的自动化提示注入攻击

David Hofer, Edoardo Debenedetti, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究在智能体环境中,黑盒优化方法(TAP)比梯度方法(GCG)更有效,且攻击效果依赖于攻击者模型,任务通用攻击可迁移但跨模型迁移受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10489 2026-06-10 cs.AI 新提交 70%

A complementary study on PlanGPT: Evaluation with defined Performance Metrics and comparison with a planner

PlanGPT的补充研究:使用定义性能指标评估并与规划器比较

Youssef Abdelkader, Humbert Fiorino, Damien Pellier

机构 * Univ. Grenoble Alpes - LIG(格勒诺布尔阿尔卑斯大学 - 信息学实验室(LIG))

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文对大型语言模型PlanGPT进行补充实验,使用规划成本和生成时间两个指标评估其性能,并与传统规划器比较,发现PlanGPT并不优于贪心搜索策略。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10394 2026-06-10 cs.AI 新提交 70%

STAGE-Claw: Automated State-based Agent Benchmarking for Realistic Scenarios

STAGE-Claw:面向真实场景的基于状态的智能体自动化基准测试

Sirui Liang, Bohan Yu, Peiyu Wang, Shiguang Guo, Wenxing Hu, Pengfei Cao, Jian Zhao, Cao Liu, Ke Zeng, Xunliang Cai, Kang Liu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院) Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出STAGE-Claw框架,自动构建基于状态的个人计算环境中的真实场景任务,通过最终系统状态而非文本响应评估智能体性能,创建40个挑战性任务并分析11个前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09800 2026-06-09 cs.SE cs.AI cs.MA 新提交 70%

FASE: Fast Adaptive Semantic Entropy for Code Quality

FASE: 用于代码质量的快速自适应语义熵

Shizhe Lin, Ladan Tahvildari

机构 * University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出快速自适应语义熵(FASE),通过最小生成树近似功能正确性,在HumanEval和BigCodeBench上相比现有语义熵方法在Spearman相关性和ROCAUC上分别提升25%和19%,且计算开销仅为传统方法的0.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09411 2026-06-09 cs.CR cs.IT cs.LG math.IT 新提交 70%

Now You (Still) See Me: Detecting Evasive Steganographic Payloads in LLMs

现在你(仍然)能看到我:检测大语言模型中的隐蔽隐写载荷

Charles Westphal, Timothy Douglas, Keivan Navaie, Tiago Pimentel, Fernando E. Rosas

机构 * UCL Centre for AI(UCL人工智能中心) University College London(伦敦大学学院) ML Alignment Theory Scholars(机器学习对齐理论学者) Department of Computer Science(计算机科学系) School of Computing and Communications(计算与通讯学院) ETH Zürich(苏黎世联邦理工学院) University of Sussex(Sussex大学) Imperial College London & University of Oxford(伦敦帝国学院与牛津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对大语言模型隐写外泄风险,提出一种基于非线性MLP探针的对抗性微调方法可系统规避现有线性探针检测,但通过信息论指导的数据级干预可恢复检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08800 2026-06-09 cs.AI 新提交 70%

Bridging Expert Knowledge and Automated Feature Engineering via Self-Evolution

通过自进化桥接专家知识与自动化特征工程

Varun Khurana, Vijval Ekbote, Vashu Chauhan, Yaman Kumar Singla, Rajiv Ratn Shah, Balaji Krishnamurthy

机构 * Adobe Media and Data Science Research(Adobe媒体与数据科学研究) IIIT-Delhi(德里印度理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出FEST方法,结合双流特征生成、语义去重和树引导迭代进化,从原始文本和图像中发现可审计特征,在品牌分类等任务中平均提升4.2个百分点,并实现60-80%的专家特征覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08790 2026-06-09 cs.AI cs.CR cs.MA 新提交 70%

RAILS: Verification-Native Clearing For Agentic Commerce

RAILS: 面向代理商务的验证原生清算

Adrian de Valois-Franklin, Alex Bogdan

机构 * Evolutionairy AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对自主代理在商务活动中缺乏中立清算机制的问题,提出RAILS协议,通过可靠性评分、记录和清算函数实现验证原生清算,确保财务结算基于充分证据。

Comments 49 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07805 2026-06-09 cs.AI cs.MA 新提交 70%

Beyond Goodhart's Law: A Dynamic Benchmark for Evaluating Compliance in Multi-Agent Systems

超越古德哈特定律:多智能体系统中合规性评估的动态基准

Yiyang Zhao, Zhuo Zhang, Qingxuan Le, Lizhen Qu, Zenglin Xu

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Monash University(莫纳什大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多智能体系统在压力下可能违反安全规则的问题,提出MAC-Bench动态对抗基准,通过SERV流水线生成无污染场景,并引入CSR和MG指标评估前沿模型的合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07783 2026-06-09 cs.CL 新提交 70%

Evaluating RAG Reliability under Clean, Misleading, and Mixed Retrieval

评估RAG在干净、误导和混合检索下的可靠性

Sevgi Yigit-Sert

机构 * Ankara University(安卡拉大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出评估协议,通过参数覆盖和置信度指标,系统测试RAG系统在干净、有毒和混合证据下处理参数知识与检索证据冲突的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07643 2026-06-09 cs.CV cs.AI cs.SD eess.AS 新提交 70%

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

AVI-Bench:迈向全模态大语言模型的人类级视听智能

Yaoting Wang, Ziyi Zhang, Wenming Tu, Shaoxuan Xu, Wenjie Du, Cheng Liang, Weijun Wang, Yuanchao Li, Guangyao Li, Hao Fei, Yuanchun Li, Henghui Ding, Yunxin Liu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AVI-Bench基准,通过感知、理解、推理三阶段跨模态任务评估全模态大语言模型的视听智能,并引入AVI-Bench-PriSe测试原始视听感知,揭示当前模型局限,构建四级AVI分类体系。

Comments 31 pages, 8 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07219 2026-06-08 cs.CL cs.SI 新提交 70%

Adversarial Creation and Detection of AI-Generated Social Bot Content

AI生成的社交机器人内容的对抗性创建与检测

Mykola Trokhymovych, Ricardo Baeza-Yates, Alessandro Flammini, Diego Saez-Trumper, Filippo Menczer

机构 * Universitat Pompeu Fabra(庞培法拉大学) Observatory on Social Media, Indiana University(社交媒体观测站,印第安纳大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出对抗性方法模拟恶意用户冒充真人,构建多语言跨平台配对数据集,训练检测模型显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07032 2026-06-08 cs.CV cs.AI 新提交 70%

Never Seen Before: Benchmarking Genuine Zero-Shot Composed Image Retrieval with Consistent Video-Sourced Datasets

前所未见:基于一致视频源数据集的真正零样本组合图像检索基准测试

Zhenyu Yang, Zemin Du, Shengsheng Qian, Changsheng Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对现有零样本组合图像检索数据集存在参考与目标图像不相关、非真正零样本的问题,提出ZeroSight基准,包含来自视频的一致参考-目标对和训练无关的MLLM驱动方法SC4CIR,通过三重对称一致性检查识别难负样本,实验表明现有方法性能被高估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06754 2026-06-08 cs.MA cs.CL 新提交 70%

MADRAG: Multi-Agent Debate with Retrieval-Augmented Generation for Training-Free Analytic Essay Scoring

MADRAG: 基于检索增强生成的多智能体辩论用于免训练分析性论文评分

Ali Keramati, Shiyuan Zhou, Sharad Mehrotra, Mark Warschauer

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出MADRAG框架,结合多智能体辩论与检索增强,通过倡导者、批评者和法官的交互以及检索示例校准,实现无需训练的论文评分,性能接近监督系统。

Comments 21 pages, 7 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08634 2026-08-11 cs.AI cs.CL cs.IR q-fin.GN 新提交 68%

Can Open-Weight Models Compete on Financial Text Comprehension?

开源权重模型能在金融文本理解领域与(闭源)模型竞争吗?

Jan Spörer

机构 * University of St. Gallen(圣加仑大学)

专题命中 评测与基准 :language model(abstract,comments);分类 cs.CL、cs.AI;large language model(comments)

AI总结 该研究更新了Financial Touchstone金融文本理解基准,测试了20款模型,发现开源权重模型Kimi K2.6准确率排第三,挑战了推理架构或闭源权重是金融理解前提的假设,还发现中国模型存在地缘政治内容过滤器拒绝合法金融问题的现象。

Comments To be presented at the workshop International Symposium on Large Language Models for Financial Services (FinLLM@IJCAI2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17852 2026-08-19 cs.SD cs.MM 新提交 67%

UniVerse: Benchmarking and Enhancing LALMs on Culturally Inclusive Low-Resource Music Understanding

UniVerse:针对文化包容性低资源音乐理解的基准测试与增强

Ziya Zhou, Shangda Wu, Shenyang Xu, Yutong Zheng, Dafang Liang, Suin Chung, Danbinaerin Han, Junyan Jiang, Yongyi Zang, Ruibin Yuan, Rongxiu Zhong, Shilei Zhang, Junlan Feng, Jinglei Liu, Haotian Zhou, Zijin Li, Dasaem Jeong, Wei Xue, Yike Guo

机构 * Sogang University(西江大学) KAIST(韩国科学技术院) NYU Shanghai(上海纽约大学) JIUTIAN Research, China Mobile(中国移动九天研究院) The State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) Central Conservatory of Music(中央音乐学院)

专题命中 评测与基准 :language model(abstract,abstract_cn)

AI总结 该研究针对低资源音乐理解问题,推出UniVerse基准与数据集,训练LALMs并研究多模态不平衡学习策略,实现性能提升但仍存在深层音乐理解的差距。

Comments 21 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17700 2026-08-19 cs.CV 新提交 67%

Environment-Invariant Subspace Learning for Generalizable Deepfake Detection

面向通用深度伪造检测的环境不变子空间学习

Shenghao Chen, Hao Jia, Chen Li, Chunjie Ma, Zan Gao, Shengyong Chen

机构 * Tianjin University of Technology(天津理工大学) Shandong Artificial Intelligence Institute(山东人工智能研究院) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))

专题命中 评测与基准 :foundation model(abstract,abstract_cn)

AI总结 该研究针对深度伪造检测中跨分布泛化瓶颈,提出EISL框架,通过低秩投影解耦特征并设计环境干预模块,在多设置实验中提升了对未见伪造类型和环境变化的鲁棒性。

Comments 12 pages, 4 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17386 2026-08-19 cs.RO 新提交 67%

MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation

MANIGUARD:用于基于规范的机器人操作安全评估与改进的基准及数据集套件

Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xinyu Cao, Huajie Shao, Manling Li, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) William & Mary(威廉玛丽学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究提出ManiGuard基准与数据集套件,针对机器人操作基础模型策略,通过含23000余次滚动的实验证实安全需独立于任务成功评估,微调可提升安全表现但仍存差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17018 2026-08-19 cs.SE 新提交 67%

ORCA: Observability-Grounded Program Repair for Microservice Incidents

ORCA:基于可观测性的微服务故障程序修复

Yuanchen Gao, Yifang Tian, Yiran Li, Charles Zhang, Hans-Arno Jacobsen

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14757 2026-08-18 eess.IV cs.CV q-bio.QM 新提交 67%

KHiM-Mamba: Injecting Pathology Knowledge into Mamba via Hidden-State Modulation for Whole Slide Image Analysis

KHiM-Mamba:通过隐藏状态调制将病理知识注入Mamba以用于 whole slide image(WSI)分析

Qixiang Zhang, Yi Li, Tianqi Xiang, Haonan Wang, Mengjiao Wei, Bo Xu, Xiaomeng Li

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究提出KHiM-Mamba架构,通过将病理知识注入Mamba的选择性状态空间机制,解决纯视觉驱动的WSI分析问题,在4类任务的11个公共基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16690 2026-08-18 cs.CV 新提交 67%

AnchorScore: A CLIP-Based Diagnostic of MLLM Annotation Difficulty

AnchorScore:一种基于CLIP的多模态大语言模型(MLLM)标注难度诊断方法

Yan Ma, Lizhuo Zhang

机构 * School of Foreign Studies, Changsha University of Science and Technology(长沙理工大学外国语学院) School of Education, Hunan Agricultural University(湖南农业大学教育学院) School of Information and Intelligence, Hunan Agricultural University(湖南农业大学信息与智能科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出基于CLIP的AnchorScore,可低成本预先对类别按MLLM标注难度排名,在课堂行为、动作识别等数据上与MLLM准确率相关性高,可用于混合路由、提示消歧等场景。

Comments 37 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16603 2026-08-18 cs.CY 新提交 67%

Characterizing Agentic Flooding of Government Services

刻画政府服务的智能体泛滥问题

Chris Schmitz, Lewis Hammond, Alan Chan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究定义了政府服务的智能体泛滥问题,基于84起案例数据集分析其广泛存在性,开发风险矩阵评估高风险服务,梳理政府应对措施并推荐兼顾公平的缓解方案。

Comments To appear in the proceedings of the 9th AAAI Conference on AI, Ethics, and Society (AIES), October 12-14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16574 2026-08-18 cs.HC cs.CY 新提交 67%

The User Side of AI Model Lifecycles: Evidence from the Keep4o Movement

AI模型生命周期的用户侧:来自Keep4o运动的证据

Yiwen Wu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究以Keep4o运动为案例,通过分析X平台6万余条帖子,发现AI模型技术更迭未必是用户侧的有效替换,用户体验应纳入AI模型生命周期管理。

Comments 32 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15595 2026-08-18 cs.SE 新提交 67%

AutoSQL: Extracting SQL Templates from Imperative ORM Code in Large-Scale Repositories

AutoSQL:从大规模代码仓库中的命令式ORM代码提取SQL模板

Junsong Pu, Yichen Li, Zhuangbin Chen, Zhihan Jiang, Zibin Zheng

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 AutoSQL是从大规模Go仓库的命令式ORM代码提取SQL模板的系统,采用代码索引、混合上下文检索策略,在基准测试中召回率优于现有方法。

Comments Accepted to ASE '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15163 2026-08-18 cs.CV cs.HC 新提交 67%

From "What-If" to "What-Is": Counterfactual Thinking-Inspired Semantic Alignment for Visual Brain Decoding

从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐

Kaitao Yan, Chi Liu, Congcong Zhu, Huajie Chen, Gengshen Wu, Minghao Wang, Xiaotong Han, Tianqing Zhu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15058 2026-08-18 cs.CV 新提交 67%

MEDR: Query-Independent Frame Selection via Multi-Signal Event Modeling and Dynamic Rescoring

MEDR:基于多信号事件建模与动态重评分的查询无关帧选择

Xinlei Pu, Weijie Shi, Wen Yang, Yi Cao, Hao Chen, Yuanjun Liu, Wenwei Ding, Jia Zhu, Jiajie Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出无需训练的MEDR帧选择方法,通过多信号事件建模与动态重评分实现查询无关,在Video-MME等基准上提升了多模态大语言模型的长视频处理准确率,且帧集可跨问题复用。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14418 2026-08-17 cs.CR 新提交 67%

STINER: Automated Extraction of Strategic Cyber Threat Intelligence from X

STINER:从X平台自动提取战略网络威胁情报

Yasir Ech-Chammakhy, Oussama Azrara, Jaafar Chbili, Anas Motii

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对社交媒体CTI提取难题,提出STINER分类体系与语料库,经测试DarkBERT等领域适配编码器表现最优,还利用STINER-DarkBERT完成了2025年上半年欧洲威胁态势分析。

Comments Accepted at RAID 2026 (29th International Symposium on Research in Attacks, Intrusions and Defenses)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14315 2026-08-17 cs.SE 新提交 67%

Breaking Models to Test the Judge: A Mutation Testing Approach for Semantic Evaluators of Domain Class Diagrams

破坏模型以测试评判器:面向领域类图语义评估器的变异测试方法

Kevin Delcourt, Meriem Ben Chaaben, Abdelhamid Rouatbi, Luciano Marchezan, Houari Sahraoui

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对领域类图语义评估器,提出一种变异测试方法,通过注入语义缺陷生成变体并评估评判器检测缺陷的能力,其结果与人工评估基本一致,可作为语义评判器分析的可扩展替代方案。

Comments Paper accepted at the ACM/IEEE 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14131 2026-08-17 cs.SE 新提交 67%

LegacyWorld: Atomicity-Aware Evaluation of GUI Agents for Legacy Workflows

LegacyWorld:面向遗留工作流的GUI智能体的原子性感知评估

Thilo Reintjes, Sivajeet Chand, Derui Zhu, Sushant Kumar Pandey, Alexander Pretschner

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究开发LegacyUse框架以自动化遗留工作流,构建含28个Windows GUI工作流的基准,采用原子性评估6款计算机使用智能体,发现不同操作特征并提出相关首要要求。

Comments Accepted for publication in the Industry Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13783 2026-08-17 cs.CV 新提交 67%

Doomed to Re-Annotate, Forever: The ImageNet Story

注定要反复标注:ImageNet的故事

Illia Volkov, Nikita Kisel, Tetiana Mishkina, Klara Janouskova, Jiri Matas

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文针对ImageNet-1k数据集的标签噪声问题,构建ReImageNet数据集,采用人机协作反复优化的标注流程,使模型准确率显著提升,相关资源已公开。

Comments 25 pages, 16 figures, 8 tables. Project page: https://vrg.fel.cvut.cz/reimagenet

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13583 2026-08-17 cs.HC cs.MA 新提交 67%

Beyond Simplification: DFT-GEN for Fidelity-Preserving Visual Accessibility in Dyslexia-Friendly Educational Texts

超越简化:用于阅读障碍友好型教育文本中保真视觉可访问性的DFT-GEN

Jiaqian Yu, Chen Jason Zhang, Haoyang Li, Guoqiong Ivanka Huang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究针对阅读障碍人群的教育文本,提出DFT-GEN框架,通过专属可访问性层兼顾信息保真与视觉可访问性,在双语考试条目上取得显著效果。

Comments Preprint. Code available at https://github.com/MorrisYUJQ/DFT-GEN

详情

展开后加载摘要…

URL PDF HTML 收藏