arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-29 至 2026-06-29 共收录 235 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 53 篇

2606.22902 2026-06-29 cs.AI 新提交 81%

Agent-as-a-Router: Agentic Model Routing for Coding Tasks

Agent-as-a-Router: 面向编码任务的智能体模型路由

Pengfei Zhou, Zhiwei Tang, Yixing Ma, Jiasheng Tang, Yizeng Han, Zhenglin Wan, Fanqing Meng, Wei Wang, Bohan Zhuang, Wangbo Zhao, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) University of California, Berkeley(加州大学伯克利分校) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Agent-as-a-Router框架,通过C-A-F循环积累执行经验,实现编码任务的动态模型路由,ACRouter在分布内任务上取得最低累积遗憾并泛化到分布外任务。

Comments 39 pages, 21 figures, a living technical report with a living benchmark that continuously updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04564 2026-06-29 cs.LG 版本更新 80%

SurvPFN: Towards Foundation Models for Survival Predictions

SurvPFN:面向生存预测的基础模型

Samuel Böhm, Lennart Purucker, Frank Hutter, Pascal Schlosser

机构 * University of Freiburg(弗赖堡大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 提出SurvPFN,一种基于先验数据拟合网络(PFN)的生存预测模型,通过合成数据预训练和删失负对数似然损失,无需逐数据集拟合即可在真实任务中与经典和深度生存基线竞争。

Comments 10 pages, 1 figure. Accepted to "Foundation Models for Structured Data" Workshop at the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28237 2026-06-29 cs.RO 新提交 80%

Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors

释放无限运动:通过生成式视频先验扩展富有表现力的四足运动

Youzhi Liu, Li Gao, Yifei Qian, Liu Liu, Yang Cai, Ziqiao Li

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出Uni-Mo全自动流水线,利用LLM和视频扩散模型生成四足机器人运动数据,通过身份一致性损失提取3D轨迹,训练真实机器人跟踪策略,并发布包含7488个语言标注运动的数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13890 2026-06-29 cs.HC 版本更新 80%

Workshop Paper: An empirical study to understand how students use ChatGPT for writing essays and how it affects their ownership

研讨会论文:一项关于学生如何使用ChatGPT撰写论文及其如何影响论文所有权的实证研究

Andrew Jelson, Sang Won Lee

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 通过用户研究记录学生与ChatGPT的交互过程,分析查询与回复,探讨AI辅助写作对写作教育和评估的影响。

Comments 5 pages, 2 figures, submitted and accepted to ACM CHI Workshop In2Writing in 2024, Please see full paper at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19652 2026-06-29 cs.CR 版本更新 80%

A Plug-and-Play Method for Improving Imperceptibility and Capacity in Practical Generative Text Steganography

一种提高实用生成式文本隐写术不可感知性和容量的即插即用方法

Kaiyi Pang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出FreStega方法,通过重构语言模型概率分布,在自回归生成隐写文本时动态调整token概率,同时提升不可感知性和容量(容量提升15.41%),无需牺牲文本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27672 2026-06-29 cs.LG 新提交 79%

Are Time-Series Foundation Models Ready for E-Nose Data? An Empirical Assessment of Their Embeddings

时间序列基础模型是否准备好处理电子鼻数据?对其嵌入的经验评估

Taeyeong Choi, Mohammed Kamruzzaman

机构 * Department of Information Technology(信息科技系) Department of Agricultural and Biological Engineering(农业与生物工程系) Kennesaw State University(凯斯沃州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文系统评估了Chronos-2和MOMENT等时间序列基础模型在电子鼻数据上的嵌入表示,发现微调是必要步骤,且融合专用模型表示可提升气体识别和浓度预测性能。

Comments Submitted to IEEE SENSORS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27500 2026-06-29 cs.CV cs.CL 新提交 79%

Aloe-Vision: Robust Vision-Language Models for Healthcare

Aloe-Vision: 面向医疗保健的鲁棒视觉-语言模型

Jaume Guasch-Martí, Enrique Lopez-Cuena, Martín Suárez-Fernández, Jordi Bayarri-Planas, Anna Arias-Duart, Dario Garcia-Gasulla

机构 * Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心(BSC))

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 提出Aloe-Vision系列医疗LVLM,通过大规模高质量多模态数据微调,在保持通用能力的同时提升医疗任务性能,并引入低污染基准CareQA-Vision,揭示当前模型在临床环境中的鲁棒性挑战。

Comments MIDL 2026

Journal ref Proceedings of Machine Learning Research, Vol. 315, pp. 2404-2426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18610 2026-06-29 cs.RO cs.CV 新提交 78%

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

SC3-Eval: 通过自洽视频生成评估机器人基础模型

Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z. Ren, Lucy X. Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, Ming-Yu Liu, Quan Vuong

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA(英伟达) Physical Intelligence Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Allen Institute for AI(艾伦人工智能研究所)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10764 2026-06-29 cs.CV 版本更新 78%

SurgXBench: Explainable Vision-Language Model Benchmark for Surgery

SurgXBench: 可解释的视觉-语言模型手术基准

Jiajun Cheng, Xianwu Zhao, Sainan Liu, Xiaofan Yu, Ravi Prakash, Patrick J. Codd, Jonathan Elliott Katz, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) Intel Labs(英特尔实验室) Duke University(杜克大学) University of Miami(迈阿密大学) University of California, Merced(加州大学默塞德分校)

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对手术视觉-语言模型(VLM)泛化能力不足的问题,提出SurgXBench基准,在零样本设置下评估多个先进VLM在器械与动作分类任务上的表现,并集成可解释AI分析模型注意力与因果解释,揭示模型依赖弱上下文线索而非临床相关证据的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27981 2026-06-29 cs.CL 新提交 77%

ToxiREX: A Dataset on Toxic REasoning in ConteXt

ToxiREX: 上下文中的有毒推理数据集

Stefan F. Schouten, Ilia Markov, Piek Vossen

机构 * Vrije Universiteit Amsterdam(瓦赫宁海姆自由大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出ToxiREX多语言数据集,基于有毒推理模式标注Reddit评论的隐式上下文毒性,并建立基线模型评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27738 2026-06-29 cs.HC 新提交 71%

HandMade: Spatial Prompting for Generative 3D Creation with Part-Labeled VR Sketches

HandMade: 基于部分标注的VR草图的空间提示生成式3D创作

Jialin Huang, Rana Hanocka, Ariel Shamir, Yotam Gingold

专题命中 评测与基准 :prompting(title)

AI总结 提出HandMade工作流,结合VR 3D草图和语言进行开放域3D资产生成,将粗粒度部分标注的3D草图作为空间提示,通过多视图部分引导和结构化提示实现空间布局与语言描述的协同创作。

Comments 15 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27936 2026-06-29 cs.CR cs.AI stat.AP 新提交 70%

Agentic AI-Powered Re-Identification: An Emerging, Scalable Threat to Mobility Microdata Privacy

基于智能体AI的重识别:对移动微数据隐私的新兴可扩展威胁

Oscar Thees, Roman Müller, Matthias Templ

机构 * University of Applied Sciences and Arts Northwestern Switzerland (FHNW)(西北瑞士应用科学和艺术大学(FHNW))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究利用智能体AI自动从公开网络搜索并交叉引用数据,实现从时空轨迹中重识别个体,实验成功率达72%,揭示了大规模重识别威胁。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05950 2026-06-29 cs.AI 版本更新 70%

Edit-R2: Context-Aware Reinforcement Learning for Multi-Turn Image Editing

Edit-R2:面向多轮图像编辑的上下文感知强化学习

Yuxiao Ye, Haoran He, Fangyuan Kong, Xintao Wang, Pengfei Wan, Kun Gai, Ling Pan

机构 * Hong Kong University of Science and Technology(香港理工大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :foundation model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出Edit-R2框架,通过重构会话意图和联合优化推理与生成的强化学习,解决多轮图像编辑中的长上下文稀释和状态污染问题,并在MICE-Bench基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22536 2026-06-29 cs.CV cs.CL 版本更新 70%

SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation

SpaceDG: 在视觉退化下评估空间智能的基准测试

Xiaolong Zhou, Yifei Liu, Ziyang Gong, Jiarui Li, Qiyue Zhao, Muyao Niu, Yuanyuan Gao, Le Ma, Xue Yang, Hongjie Zhang, Zhihang Zhong

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Electronic Science and Technology of China(电子科技大学) Chongqing University(重庆大学) The University of Tokyo(东京大学) Beihang University(北航) Northwestern Polytechnical University(西北工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SpaceDG,首个针对退化感知空间理解的大型数据集,通过物理基础的退化合成引擎生成9种退化类型,评估多模态大语言模型在视觉退化下的空间推理能力,并展示在退化条件下微调可提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17642 2026-06-29 cs.AI 版本更新 70%

Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context

Health-ORSC-Bench:衡量健康领域过度拒绝与安全完成的基准

Zhihao Zhang, Liting Huang, Guanghao Wu, Preslav Nakov, Heng Ji, Usman Naseem

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型在健康场景中过度拒绝良性查询或对有害查询不安全遵从的问题,提出Health-ORSC-Bench基准,通过31,920个边界提示评估模型在意图模糊下的过度拒绝与安全完成质量,揭示安全优化模型过度拒绝率达80%。

Comments Accepted by ACL'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28049 2026-06-29 cs.CV 新提交 67%

AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration

AirGroundBench: 异构多视角具身协作下多模态大模型的空间智能探测

Haotian Li, Yida Wang, Leyuan Wang, Jinshan Lai, Keyang Wang, Zonghao Guo, Qiang Ma, Liuyu Xiang, Jianwei Hu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) QiYuanLab(启元实验室) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出AirGroundBench基准,通过异构无人机-无人车协作的多视角任务(10类、约6.2万道视觉问答和115个导航任务),系统评估多模态大模型在空间感知、跨视角对齐、空间变换推理和具身决策中的几何一致性,发现模型在跨视角对齐和变换推理上存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27999 2026-06-29 cs.CV 新提交 67%

HumanMoveVQA: Can Video MLLMs reason about human movement in videos?

HumanMoveVQA:视频多模态大语言模型能否推理视频中的人类运动?

Pulkit Gera, Faegheh Sardari, Asmar Nadeem, Valentina Bono, Padraig Boulton, Adrian Hilton, Armin Mustafa

机构 * CVSSP, University of Surrey, Guildford, UK(萨里大学视觉、语音与信号处理中心,英国吉尔福德) Tesco, UK(乐购,英国)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出HumanMoveVQA基准,通过世界坐标系下的3D运动轨迹生成问答对,评估视频MLLM在全局轨迹和方向推理上的能力,发现现有模型存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27828 2026-06-29 cs.CV 新提交 67%

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

Video-MME-Logical: 面向视频时序逻辑推理的受控诊断基准

Hohin Kwan, Hongyu Li, Ray Zhang, Manyuan Zhang, Xianghao Kong, Anyi Rao, Jiahao Xie, Si Liu

机构 * HKUST(香港科技大学) Colab, Beihang University(北京航空航天大学合作实验室) CUHK(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 为隔离评估多模态大模型在视频中的时序逻辑推理能力,提出包含五种时序逻辑操作和25个细粒度任务类别的受控基准,通过控制时间跨度和推理复杂度进行难度可控评估,并支持中间状态诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26176 2026-06-29 cs.AR 新提交 67%

Toward Mitigating Process-Induced Performance Degradation in 3.5D Heterogeneous Packages via Pre-Silicon Firmware Co-Optimization

通过预硅固件协同优化减轻3.5D异构封装中工艺引起的性能退化

Chi Fei Chung

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出一种物理感知的预测性固件调度层XRM-SSD V24/V7.0,通过热-电协同仿真和负载密度驱动的热提示,实现3.5D封装中电压轨预置,显著降低热漂移和泄漏电流,释放20-30%计算能力并减少65-68% EDA保护带。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17994 2026-06-29 stat.ME 版本更新 67%

Assessing Monotone Dependence: Area Under the Curve Meets Rank Correlation

评估单调依赖性:曲线下面积与秩相关的结合

Eva-Maria Walz, Andreas Eberl, Tilmann Gneiting

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文统一了连续和二分结果下单调依赖性的度量,引入非对称等级相关(AGC)和单调关联系数(CMA),连接了AUC与Spearman's Rho,并建立了中心极限定理和DeLong型检验。

Comments Substantially expanded and revised

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27539 2026-06-29 cs.SI cs.AI cs.LG 新提交 62%

Benchmarking Multi-Modal Graph-based Social Media Popularity Prediction

基于多模态图的社交媒体流行度预测基准测试

Utkarsh Sahu, Zhisheng Qi, Li Zhu, Yizhao Yang, Jun Li, Ryan Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) University of Georgia(佐治亚大学) Adobe Research(Adobe研究)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 提出统一的多模态图基准MMG-Pop和模型MMG-PopNet,联合建模文本、视觉、时间与社交交互信号,在Bluesky和Reddit数据集上验证了跨平台泛化与多模态贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16682 2026-06-29 cs.LG cs.CL 新提交 62%

Multimodal Evaluator Preference Collapse: Cross-Modal Coupling in Self-Evolving Agents

多模态评估者偏好坍缩:自进化智能体中的跨模态传染

Zewen Liu

机构 * Qilu Institute of Technology, School of Software Engineering(齐鲁理工学院软件工程学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究多模态自评估中偏好坍缩的加剧现象,发现跨模态传染导致策略选择扭曲,并引入传染矩阵量化风险。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11585 2026-06-29 cs.LG cs.CL nlin.AO 新提交 62%

Kuramoto Attention: Synchronizing Self-Attention on the Torus

Kuramoto注意力:在环面上同步自注意力

Joshua Nunley

机构 * Department of Informatics, Luddy School of Informatics, Computing, and Engineering, Cognitive Science Program, Indiana University Bloomington(印第安纳大学伯明顿分校信息学系,卢迪信息学、计算与工程学院,认知科学项目)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出Kuramoto注意力层,将隐藏坐标视为角度,通过门控余弦相似度和环形均值更新实现自注意力,等价于Kuramoto耦合项,在字符级语言建模中达到与强基线相近的性能。

Comments 15 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27474 2026-06-29 cs.SE cs.AI 新提交 57%

Speculative Refinement: A Hybrid Autoregressive Diffusion Decoding Strategy and Its Behavior Across Benchmarks

推测性精炼:一种混合自回归扩散解码策略及其跨基准测试的行为

Aditi Gupta, Neel Mishra, Kushagra Trivedi, Pawan Kumar

机构 * IIIT Hyderabad

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出推测性精炼(SpecRef),一种无需训练的混合解码方法,通过熵引导选择性掩码从自回归草稿启动掩码扩散模型,并在六个基准上揭示代码基准的结构性混淆、精炼张力现象、似然与生成评估排名差异及后处理问题。

Comments 7 pages + 2 pages References

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27438 2026-06-29 cs.LG 新提交 57%

Unified Zero-Shot Time Series Forecasting: A Darts Foundation

统一零样本时间序列预测:Darts 基础模型

Zhihao Dai, Dennis Bader, Alain Gysi

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 针对基础模型接口碎片化问题,Darts 开发了统一 FoundationModel 类集合,提供标准化全周期预测接口,实现零样本或微调预测、不确定性估计和回测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24320 2026-06-29 cs.SD cs.AI 新提交 57%

ZONOS2 Technical Report

ZONOS2 技术报告

Gabriel Clark, Sofian Mejjoute, Mohamed Osman, George Close, Beren Millidge

机构 * Zyphra

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 提出ZONOS2 8B TTS模型,通过MoE架构、6M小时训练数据和简化后训练配方,在自然度、韵律和声音克隆保真度上达到最先进水平。

Comments 15 pages, 7 figures, 7 tables. Technical report. Model weights, inference code, and the ZTTS1-Eval benchmark released under Apache 2.0. Code: https://github.com/Zyphra/ZONOS2 ; weights: https://huggingface.co/Zyphra/ZONOS2 ; benchmark: https://github.com/Zyphra/ZTTS1-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18197 2026-06-29 cs.AI 版本更新 57%

GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models

GAIA: 用于训练GUI测试时缩放评论模型的数据飞轮系统

Shaokang Wang, Pei Fu, Ruoceng Zhang, Shaojie Zhang, Xiuwen Xi, Jiahui Yang, Bin Qin, Ying Huang, Zhenbo Luo, Jian Luan

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出GAIA数据飞轮系统,通过训练直觉评论模型(ICM)评估GUI代理动作的正确性,利用正负样本迭代提升代理测试时性能,实验表明该方法能持续改进多种模型。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02340 2026-06-29 cs.AI q-bio.OT 版本更新 57%

Chronic Kidney Disease Prognosis Prediction Using Transformer

使用Transformer进行慢性肾脏病预后预测

Yohan Lee, Dong Gyun Kang, SeHoon Park, Sa-Yoon Park, Kwangsoo Kim

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出基于Transformer的ProQ-BERT框架,利用多模态电子健康记录预测CKD进展,在9万余名患者数据上实现高达0.995的ROC-AUC。

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28202 2026-06-29 eess.SP 新提交 50%

An Enhanced Source-Free Unsupervised Domain Adaptation Framework for Cross-Dataset EEG Emotion Recognition via Predictive Coding and Test-Time Training

一种增强的无源无监督域适应框架:基于预测编码和测试时训练的跨数据集脑电情感识别

Md Niaz Imtiaz, Naimul Khan

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出一种无源无监督域适应框架,通过非对比预测编码自监督预训练和双阶段自适应优化(多损失自适应正则化与局部一致性学习),结合轻量测试时训练,解决跨数据集脑电情感识别中的域偏移和噪声伪标签问题。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26729 2026-06-29 cs.HC 新提交 50%

'A bit of chaos and madness': The AI Assessment Scale and the work of assessment reform

“一丝混乱与疯狂”:AI评估量表与评估改革工作

Mike Perkins, Darius Postma, Jasper Roe, Susan Sisay, Craig Holdcroft

专题命中 评测与基准 :prompting(abstract)

AI总结 本研究通过越南和英国两所大学的焦点小组,探讨AI评估量表(AIAS)的实施经验,发现其能促进真实评估设计,但若脱离学习成果和学科背景可能沦为合规工具。

Comments V2: Corrections of errata, additional limitations

详情

展开后加载摘要…

URL PDF HTML 收藏