arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2607.23340 2026-07-28 cs.DB 新提交 67%

ABISS: Evaluating Text-to-SQL Systems Through Agent Interaction

ABISS:通过代理交互评估文本到SQL系统

Giovanni Sullutrone, Luca Sala, Sania Aftar, Georgia Koutrika, Sonia Bergamaschi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对文本到SQL系统在处理现实模糊问题的不足,提出统一分类法、多代理生成管道及动态模拟环境ABISS。通过实验揭示模型在子类别分类和澄清条件下SQL生成的瓶颈,提供真实类别虽有收益,但模糊问题执行率仍低,且发布相关代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23132 2026-07-28 cs.CV 新提交 67%

DispatchRAG: Grounding Emergency Dispatch Decisions in Real-World Protocols from Traffic Accident Video

DispatchRAG:基于交通事故视频中的现实世界协议进行应急调度决策

Muhammad Sulthan Adhipradhana, Ehsan Javanmardi, Naren Bao, Manabu Tsukada

机构 * Graduate School of Information Science and Technology, University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 评测与基准 :LLM(abstract);language model(abstract)

AI总结 研究旨在通过DispatchRAG框架,利用基于RAG的检索机制和大型语言模型驱动的推理器,根据日本现实交通事故响应协议进行事故评估和调度,引入事故调度数据集验证框架,为自动驾驶车辆事故报告提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22293 2026-07-27 cs.CV 新提交 67%

RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding

RadSight:迈向感知可靠的多模态放射学图像理解

Jianqin Liu, Weiwei Cao, Wanxing Chang, Ruifeng Yuan, Bowen Shi, Zhilin Zheng, Xianjie Zhang, Ling Zhang, Peng Wang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对医学多模态大语言模型视觉解释可靠性低的问题,引入Perception-Bench基准分析问题。提出基于双2D/3D编码器架构的RadSight模型,经渐进课程学习训练,在多维度评估中优于现有模型,凸显低级视觉感知对可靠临床理解的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21061 2026-07-24 cs.CV 新提交 67%

MVEI & EmObserver: Empowering MLLM-Oriented Visual Emotional Intelligence via Emotion Statement Judgement

MVEI与EmObserver:通过情感陈述判断增强面向MLLM的视觉情商

Daiqing Wu, Dongbao Yang, Jiashu Yao, Hongrui Zhang, Can Ma, Yu Zhou, Sicheng Zhao

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) Chinese Academy of Sciences(中国科学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对多模态大语言模型视觉情商评估缺失问题,引入情感陈述判断公式ESJ,开发INSETS及MVEI基准,构建EmObserver模型。通过实验评估,确立了ESJ、MVEI和EmObserver在推进面向MLLM的视觉情商方面的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20868 2026-07-24 cs.CV 新提交 67%

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

ViSTR-Bench:多模态大语言模型能否从动态场景中的连续视觉线索进行推理?

Han Li, Si Liu, Zehao Huang, Dongxin Lyu, Longfei Xu, Jiahui Fu, Daxin Tian, Yuliang Xiu, Naiyan Wang

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村科学城) School of Engineering, Westlake University(西湖大学工学院) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究聚焦多模态大语言模型在动态场景中从连续视觉线索推理的能力,提出ViSTR-Bench评估套件,基于相关原则建立四维评估,含15个子任务和1340个问答对,经评估发现当前模型在复杂时空推理上有瓶颈,远不及人类。

Comments 37 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20866 2026-07-24 cs.CV 新提交 67%

Agentic Designer: Progressive Multi-Agent Collaboration for Structure-Aware Interior Layout Generation

智能设计师:用于结构感知室内布局生成的渐进式多智能体协作

Zhijing Yang, Haocheng Lin, Zhihua Xu, Haojie Li, Keze Wang, Liang Lin, Tianshui Chen

机构 * Guangdong University of Technology(广东工业大学) South China University of Technology(华南理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对室内布局生成难题,提出智能设计师这一渐进式多智能体框架,将布局生成视为迭代约束验证决策过程,通过渐进共识机制协调三个智能体,经实验验证其显著优于现有方法,提升了结构遵循和功能设计连贯性。

Comments TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20536 2026-07-24 cs.AI cs.CL cs.LG cs.MA 新提交 67%

AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use

AppWorld-UL:用于工具使用的多样化智能体-用户交互基准测试

Junzhi Chen, Harsh Trivedi, Jane Pan, Michael JQ Zhang, Tejas Srinivasan, Niranjan Balasubramanian, Ashish Sabharwal

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对当前智能体-用户交互基准测试不足,引入 AppWorld-UL 基准测试,基于 AppWorld 框架及模拟应用构建多样任务,用大型语言模型模拟用户行为,评估显示其难度大,能推动回路中工具使用智能体研究。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19678 2026-07-23 cs.CL cs.AI cs.LG 新提交 67%

Reference-Free Evaluation of Reasoning in Open-Ended Question Answering

开放式问答中推理的无参考评估

Guneet Singh Kohli, Yuxiang Zhou, Michael Sejr Schlichtkrull, Gregory E Dean, Maria Liakata

机构 * Queen Mary University of London(伦敦大学玛丽皇后学院) Temple University(天普大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对高风险领域人工智能生成答案难验证问题,提出基于推理的无参考框架审核大语言模型输出,通过分解推理轨迹、标记关系并组织成超图等方法评估,在数学和医学推理设置下比直接以大语言模型为基线更可靠,强调问答评估应考虑推理关系组合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19291 2026-07-22 cs.SE 新提交 67%

EmbeddedKittens: An Evaluation of Code Embeddings for Scratch

EmbeddedKittens:对Scratch代码嵌入的评估

Benedikt Fein, Gordon Fraser

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究探讨哪种代码嵌入方法适用于Scratch编程教育。实例化四个LLMs和五种嵌入方法,创建任务及数据集进行评估,结果表明在开放Scratch数据集上训练的嵌入模型可捕获代码信息用于学习分析,无需特定任务微调。

Comments Submitted to ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17423 2026-07-21 cs.CV 新提交 67%

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

TimeLens2:使用多模态大语言模型进行通用视频时间定位

Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li, Jun Zhang, Tianxiang Jiang, Yuandong Yang, Ziang Yan, Zikang Wang, Xinyu Chen, Haoran Chen, Shaowei Zhang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究通用视频时间定位问题,TimeLens2将时间证据视为区间集,通过多种策略构建多跨度监督,其时间瓦瑟斯坦奖励等方法提供反馈,在多个基准测试中表现出色,不同变体均有性能提升。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17112 2026-07-21 cs.CE 新提交 67%

Learning Dispute Structure for Settlement Prediction in Financial ADR: A Multi-Task and Cross-Institutional Approach

学习金融 ADR 中和解预测的争议结构:一种多任务和跨机构方法

Koutarou Tamura

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对金融 ADR 案例,提出统一数据集和建模框架,引入功能标记方案表示争议结构,构建多任务模型联合进行争议分类与和解预测,实验显示该方法能提升预测性能,发现争议结构在 ADR 领域部分共享。

Comments 4th International Conference on Computational and Data Sciences in Economics and Finance (CDEF 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16742 2026-07-21 cs.CV 新提交 67%

Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model

人工智能生成的以人为中心的视频的多维质量评估:数据集与模型

Sijing Wu, Yunhao Li, Huiyu Duan, Yucheng Zhu, Xiongkuo Min, Patrick Le Callet, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学南加州大学文化创意产业学院) Polytech Nantes, Université de Nantes(法国南特大学高等理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对AI生成的以人为中心的视频质量评估问题,提出扩展数据集HVEval+并构建MoE-Rater模型,该模型采用专家混合及三阶段训练策略,能统一多种任务,在相关数据集上性能优越,推动了视频质量评估及T2V模型优化。

Comments Accepted for publication in IEEE TCSVT, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16193 2026-07-20 cs.CV 新提交 67%

Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs

认识自我,理解世界:用于基于多模态大语言模型的无人机时空推理的双认知基准测试

Like Liu, Zhengzheng Xu, Haitao He, Hongzhe Li, Shuchang Zhang, Dian Shao

机构 * Northwestern Polytechnical University(西北工业大学) China University of Petroleum(中国石油大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对多模态大语言模型在无人机场景双认知能力评估不足的问题,提出UAV-DualCog基准测试,涵盖图像和视频任务,通过自动化管道构建数据,评估发现现有模型存在瓶颈,该基准测试有价值。

Comments 11 pages, 4 figures, 7 tables. Project website: https://uav-dualcog.lozumi.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15752 2026-07-20 cs.CV 新提交 67%

Personalized Image Aesthetic Assessment via Preference-rich Sample Mining and Cohort Merging

通过偏好丰富样本挖掘和群组合并进行个性化图像美学评估

Zhichao Yang, Tianjiao Gu, Zhixianhe Zhang, Xiangfei Sheng, Pengfei Chen, Leida Li

机构 * Xidian University(西安电子科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究个性化图像美学评估问题,提出基于多模态大语言模型的PRAC方法,通过偏好丰富样本挖掘和美学共鸣群组合并建模个体美学偏好,经实验验证该方法优于现有技术。

Comments The paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15615 2026-07-20 cs.CV 新提交 67%

Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification

用于检测引导的乳腺钼靶病变分类的区域基础视觉语言学习

Zhengbo Zhou, Jiren Li, Dooman Arefan, Margarita Zuley, Shandong Wu

专题命中 评测与基准 :language model(abstract);pretraining(abstract)

AI总结 针对乳腺钼靶病变分类,提出区域基础视觉语言学习方法,先通过区域-文本对比预训练对齐特征,引入多组件目标减轻偏差,再联合优化辅助病变检测头,实验表明该方法在多设置下性能优于相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14754 2026-07-17 cs.CR 新提交 67%

FlowGuard: From Signals to Evidence for MCP Security Detection

FlowGuard:从信号到MCP安全检测的证据

Baichao An, Pei Chen, Geng Hong, Yueyue Chen, Mengying Wu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究针对现有MCP安全扫描器不足,提出FlowGuard系统,结合语义风险分类等方法,通过运行时证据验证执行风险、检测语义风险,在基准测试和实际评估中取得良好效果,能有效评估MCP交互中的多种风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14660 2026-07-17 cs.CV 新提交 67%

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

VIABench:一个从视障人士收集的用于视障辅助的综合视频基准测试

Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对视障人士视觉信息获取难及多模态大语言模型在视障辅助中实用价值待探索的问题,引入VIABench视频基准测试,定义三个核心任务,提出严格测试流程,实验表明当前模型对视障人士支持不足,有望推动定制模型开发以改善其体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14479 2026-07-17 cs.CY 新提交 67%

BioTIER: A Refusal Benchmark for Targeted Biological Risk Mitigation

BioTIER:用于针对性生物风险缓解的拒绝基准

Eleanor M. Marshall, Pedro Medeiros, Peter Peneder, Nelly Mak, Jacob Kaffey, Faith Rovenolt, Mac Walker, Seth Donoughe, Jasper Götting

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对大语言模型生物滥用问题,引入BioTIER基准,将生物内容分三个风险集,含542个专家策划提示及元数据,可隔离控制灾难性风险信息,确保生物科学知识获取,助力针对性生物风险缓解。

Comments 52 pages, 9 main figures, 9 supplementary figures, 1 main table, 9 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14075 2026-07-16 cs.SE 新提交 67%

VisualRepair: Dynamic Tool Calling and Region Focusing for Visual Software Issue Repair

VisualRepair:用于视觉软件问题修复的动态工具调用和区域聚焦

Jingyu Xiao, Zhongyi Zhang, Haoran Hou, Yuxuan Wan, Yuan Jiang, Yintong Huo, Michael R. Lyu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对现代软件视觉信息利用难题,提出VisualRepair框架,通过图像类型感知工具调用和动态测试时区域聚焦两模块,在SWE-bench基准测试中性能超现有方法,有效提升自动视觉软件问题修复能力。

Comments The paper was completed in March 2026 and is currently under review. The code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13179 2026-07-16 cs.HC cs.SE 新提交 67%

SoftBoard: A Multi-Agent Tool for the Creation and Evaluation of Low-Fidelity Prototypes

SoftBoard:用于创建和评估低保真原型的多智能体工具

Gabriel R. S. Scapim, Gislaine C. L. Leal, Guilherme C. Guerino

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对软件初创公司环境下数字产品用户体验问题,介绍SoftBoard工具,它集成原型编辑器、团队项目组织和基于大语言模型的多智能体系统,可支持需求获取、自动生成原型及评估界面质量,助力构建符合用户需求的MVP。

Comments Paper accepted for publication at CBSoft 2026 (SBES-Tools)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13104 2026-07-16 cs.AI cs.CL cs.LG 新提交 67%

Self-Improvements in Modern Agentic Systems: A Survey

现代智能系统中的自我改进:一项综述

Zhe Ren, Yimeng Chen, Dandan Guo, Guowei Rong, Tonghui Li, R. B. Xiong, Qingfeng Lan, Wenyi Wang, Li Nanbo, Yibo Yang, Mingchen Zhuge, Jürgen Schmidhuber

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) University of Alberta(阿尔伯塔大学) The Swiss AI Lab IDSIA/USI/SUPSI(瑞士人工智能实验室IDSIA/USI/SUPSI)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 综述现代自我改进智能体从研究走向部署,目标是经验驱动的可控进化。提出系统级框架,将智能体视为基础模型与操作支架的耦合配置,自我改进形式化为更新算子,还组织回顾了相关工作、应用、评估等内容并展望未来。

Comments 97 pages, 12 figures. Project page: https://selfimproving-agent.github.io/ Repository: https://github.com/selfimproving-agent/awesome-Self-Improving-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12911 2026-07-15 cs.CV 新提交 67%

Open-KNEAD: Knowledge-grounded Nutrition Estimation via Agentic Decomposition

Open-KNEAD:通过智能分解实现基于知识的营养估计

Bruce Coburn, Jingbo Yue, Jinge Ma, Siddeshwar Raghavan, Gautham Vinod, Fengqing Zhu

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究探讨多模态大语言模型用于膳食评估时检索增强基础方法是否仍有价值。提出无需训练、可本地部署的Open-KNEAD框架,通过营养感知检索关联食物项与FNDDS代码,提高份量估计,还能恢复非美国烹饪风格估计偏差,优势显著并开源相关框架与知识库。

Comments 10 pages main paper, 5 pages supplementary

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12541 2026-07-15 cs.SE 新提交 67%

Taming the Drift: Context-aware Repair of Dockerfile Drift during Software Evolution

驯服漂移:软件演化过程中Dockerfile漂移的上下文感知修复

Chengjie Wang, Jingzheng Wu, Xiang Ling, Tianyue Luo, Chen Zhao

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究针对软件演化中Dockerfile漂移致CI/CD构建失败的问题,提出上下文感知框架Cadre,通过构建CDG并结合两步工作流程来修复,在$D^3$基准上修复率高,相比基线优势明显,还避免提示溢出故障,提升了上下文感知基础设施即代码维护能力。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12497 2026-07-15 cs.CV 新提交 67%

TerraLogic: A Benchmark for Hierarchical Geospatial Reasoning in Earth Observation

TerraLogic:地球观测中分层地理空间推理的基准

Yuhang Yan, Linchao Mou, Bokang Yang, Qingyu Li

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Technical University of Munich(慕尼黑工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对遥感中认知地理空间推理研究不足的问题,引入TerraLogic基准及HieraPlan工具增强智能体,通过545个任务推动评估向认知级发展,实验显示HieraPlan在分层地理空间推理上表现出色,为相关研究提供强大基线。

Comments 8 pages, 3 figures, and 7 tables. Dataset and agent code are available at https://github.com/Ireliya/TerraLogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10790 2026-07-14 eess.AS 新提交 67%

Data Augmentation for L2 English Speaking Assessment using TTS

使用文本转语音技术进行第二语言英语口语评估的数据增强

Stefano Bannò, Penny Karanasou, Mengjie Qian, Kate M. Knill, Mark J. F. Gales

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对第二语言英语口语评估数据稀缺问题,利用文本转语音技术,通过分析说话者-文本关系,提出先将书面回答语音化,再转为语音,并研究配对策略的数据增强框架,经评估可提升评分性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11044 2026-07-14 cs.MM 新提交 67%

RetroHolmes: When Semantic Plausibility Fails Retrospective Physical Process Reasoning

RetroHolmes:当语义合理性失效时的回顾性物理过程推理

Ruoxuan Zhang, Qiyun Zheng, Siyu Wu, Ling Zou, Hongxia Xie, Zhiyu Zhou, Jian-Yu Jiang-Lin, Zihan Li, Zhengguang Wang, Bin Wen, Ling Lo, Jianlong Fu, Meibao Yao, Juncheng Hu, Wen-Huang Cheng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对视觉语言模型物理推理评估不足问题,引入回顾性物理过程推理范式,提出RetroHolmes基准,通过它分析模型,发现失败模式,还展示综合分析实例,验证其诊断价值,凸显物理基础中间表示对物理推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09970 2026-07-14 cs.CR cs.CY 新提交 67%

Evaluating AI Models' Capability to Automate Voice Phishing Attacks

评估人工智能模型自动实施语音网络钓鱼攻击的能力

Fred Heiding, Claudio Mayrink Verdun, Simon Lermen, Andrew Kao, Vitor Albiero, Lauren Deason, Irina-Elena Veliche, Christine Lehane

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究评估美国成年人对人工智能驱动语音网络钓鱼攻击的易感性,通过大规模调查实验和定性访谈,让参与者接触多种语音模型及人类基线生成的诈骗场景,发现高合规率,分析得出人工智能驱动的vishing在经济上可行,其风险在于自动化经济性,引发相关政策担忧。

Comments Accepted for publication in Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08152 2026-07-10 cs.CL cs.AI cs.HC cs.LG 新提交 67%

LEXIC: Lightweight Eye-tracking eXtension via Injected Complexity

LEXIC:通过注入复杂度实现轻量级眼动追踪扩展

Sumin Lee, Kyeonghun Kim, Subeen Lee, Jiwon Yang, Tien Nguyen, Ken Ying-Kai Liao, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) NVIDIA(英伟达)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究从眼动预测阅读理解中仅注视模型的提升,基于LEXIC-Base提出两种机制注入难度信号,在一站式阅读理解任务中实验,两种机制使未见文本AUROC增益,LEXIC-Concat提升未见读者表现,LEXIC-Res存在架构边界问题。

Comments Accepted to APCCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07907 2026-07-10 cs.LG cs.AI cs.CL cs.CR cs.MM 新提交 67%

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

跨视觉、语言、视频和音频的多模态遗忘:方法、数据集和基准的综述

Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 综述跨视觉、语言、音频和视频的多模态遗忘,基于相关进展等提供统一视角,通过分类法系统比较模型架构和模态,阐明权衡,强调开放问题与实际考虑,支持未来研究与部署,并发布存储库。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06149 2026-07-09 cs.HC 新提交 67%

BlossomPsy: A User-Centric AI System for Adaptive and Engaging MBTI Personality Assessments

BlossomPsy:一个用于自适应且引人入胜的MBTI人格评估的以用户为中心的人工智能系统

Bingjia Huang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对现有MBTI评估工具的不足,BlossomPsy引入多轮对话与基于照片的问题,结合深度学习等算法,动态适应并提升用户参与度,实验证明其预测稳定,用户满意度高,在保持一致性的同时改进了MBTI评估。

Comments 23 pages,20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏