EUDAIMONIA: Evaluating Undesirable Dynamics in AI
EUDAIMONIA: 评估AI中的不良动态
机构 * University of Southern California(南加州大学)
AI总结 提出Social AI Design Code框架,并通过EUDAIMONIA基准测试评估22个最新LLM在社交互动中对用户福祉的符合程度,发现即使最强模型也违反约30%的设计要求。
高校专区
EUDAIMONIA: 评估AI中的不良动态
机构 * University of Southern California(南加州大学)
AI总结 提出Social AI Design Code框架,并通过EUDAIMONIA基准测试评估22个最新LLM在社交互动中对用户福祉的符合程度,发现即使最强模型也违反约30%的设计要求。
COFT: 用于大语言模型中公平思维链推理的反事实-保形解码
机构 * Department of Electrical and Computer Engineering, University of Southern California, Los Angeles, California, USA(电气与计算机工程系,南加州大学,洛杉矶,加利福尼亚州,美国)
AI总结 提出COFT,一种无需训练的解码方法,通过反事实提示和保形校准在解码时实现token级公平性控制,显著减少思维链生成中的社会偏见,同时保持任务效用和语言质量。
Comments Proceeding of ICML 2026
子图解释能否被武器化以窃取图神经网络?
机构 * University of Southern California(南加州大学) ; Florida State University(佛罗里达州立大学)
AI总结 本文提出首个针对图分类的黑盒模型提取攻击,利用模型解释输出引导蒙特卡洛边敏感性估计,并利用解释子图缩小边界搜索空间,实验表明该方法优于现有基线。
Comments 28 pages, 8 figures, 10 tables. Under review at NeurIPS 2026
LLM Agent技能的反事实痕迹审计
机构 * Arizona State University(亚利桑那州立大学) ; University of Southern California(南加州大学) ; Adobe Research(Adobe研究)
AI总结 提出反事实痕迹审计(CTA)框架,通过配对有无技能的Agent轨迹并生成结构化技能影响模式(SIP)注释,揭示技能对行为的重塑效应,弥补仅通过通过率评估的不足。
Comments Code and data are available at https://github.com/WillChow66/CTA.git
零样本文本转语音中的目标说话人投毒框架
机构 * Thomas Lord Department of Computer Science, University of Southern California, USA(汤姆斯·劳德计算机科学系,美国南加州大学) ; Signal Analysis and Interpretation Lab, University of Southern California, USA(信号分析与解释实验室,美国南加州大学)
AI总结 针对零样本TTS语音克隆的隐私风险,提出说话人生成投毒(SGSP)任务,通过修改训练模型阻止特定身份生成,并评估了推理时过滤和参数修改基线在1、15和100个遗忘说话人上的隐私-效用权衡。
Comments Submitted to Interspeech2026
L2G-Net:通过柯西分解的局部到全局谱图神经网络
机构 * University of Southern California(南加州大学)
AI总结 提出L2G-Net,通过将图傅里叶变换精确分解为作用于子图的算子并利用柯西矩阵组合,实现局部到全局的谱图神经网络,避免全特征分解,在长程依赖任务上以极少的可学习参数达到竞争性能。
Comments Accepted to ICML 2026
使用图曲率的训练后神经网络剪枝
机构 * Rensselaer Polytechnic Institute(新罕布什尔理工学院) ; University of Southern California(南加州大学)
AI总结 提出基于Ollivier-Ricci曲率(ORC)的神经曲率(NC)概念,通过计算激活模式下的边曲率来识别神经网络中不重要的连接,实现高效剪枝。
RL2ML: 从强化学习到最大似然的有限rollout替代目标
机构 * University of Southern California(南加州大学)
AI总结 本文提出RL2ML系列有限rollout替代目标,具有闭式无偏梯度估计,连接标准强化学习、类最大似然训练及超越最大似然目标,并揭示群体级更新尺度相变,将剩余自由度转化为一维优化问题。
AV-EMO-Reasoning: 在具有视听线索的全模态大语言模型中基准测试情感推理能力
机构 * UC Berkeley(加州大学伯克利分校) ; South China University of Technology(华南理工大学) ; Zhejiang University(浙江大学) ; National Taiwan University(台湾大学) ; University of Southern California(美国南加州大学)
AI总结 提出AV-EMO-Reasoning基准,通过合成和真实世界的视听对话数据集及情感感知与交互推理指标,系统评估全模态大语言模型的情感推理能力。
ChildVox:理解与表征儿童期声音的语音、音频及大型音频语言模型基准
机构 * University of Southern California(南加州大学) ; The Ohio State University(俄亥俄州立大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Harvard University(哈佛大学) ; Boston University(波士顿大学) ; University of Miami(迈阿密大学)
AI总结 提出ChildVox基准,整合17个儿童音频数据集和20多个子任务,评估多种基础模型在儿童生理声、非语言发声、规范音节和口语识别上的性能。
Comments preprint under review
GTA:大规模生成面向Web智能体的长程任务
机构 * University of Southern California(南加州大学) ; Salesforce AI Research(Salesforce人工智能研究) ; University of California, Davis(加州大学戴维斯分校)
AI总结 提出GTA框架,通过集成爬取、检索式种子生成、上下文内生成和自动质量控制,为Web智能体生成带可执行轨迹的真实长程任务,解决现有基准缺乏过程监督和可扩展性问题。
Comments Published at Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics
ClinicBot:基于指南的临床聊天机器人,具有优先证据RAG和可验证引用
机构 * USC Information Sciences Institute(USC信息科学研究所)
AI总结 提出ClinicBot系统,通过结构化提取指南、按临床重要性排序证据和多智能体协作,生成准确、可验证的临床回答。
OmniVerifier-M1: 具有显式结构化重校准的多模态元验证器
机构 * Tsinghua University(清华大学) ; Pennsylvania State University(宾夕法尼亚州立大学) ; University of Southern California(南加州大学) ; Microcyto ; Princeton University(普林斯顿大学)
AI总结 提出OmniVerifier-M1,通过符号化元验证(如边界框)和解耦强化学习,实现多模态大模型的可靠细粒度验证与动态区域级自校正。
Comments ICML 2026. Project: https://github.com/Cominclip/OmniVerifier
音频大语言模型是听还是读?使用VoxParadox分析和缓解副语言失败
机构 * Institute for Creative Technologies, University of Southern California, Los Angeles, USA(创意技术研究所,南加州大学,洛杉矶,美国)
AI总结 针对音频大语言模型在副语言理解上的不足,提出对抗性基准VoxParadox和Prompt-Conditioned Layer Mixer方法,显著提升模型对副语言线索的利用能力。
Comments Accepted as a conference paper at ICML 2026. Project page: https://voxparadox.github.io/
Colosseum V2:视觉语言动作模型的泛化能力基准测试
机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) ; Department of Electrical Engineering, Indian Institute of Technology Madras(印度理工学院Madras分校电子工程系) ; Fu Foundation School of Engineering and Applied Science, Columbia University(哥伦比亚大学工程与应用科学学院)
AI总结 提出Colosseum V2大规模仿真基准,通过28个任务和两种机器人形态,系统评估VLA模型在分布偏移下的泛化能力,揭示其在高层次理解与鲁棒行为之间的差距。
用口袋大小的机器人诱导平静:通过手持触觉交互降低儿童的心率和运动
机构 * Data Systems and Robotics, IT-University of Copenhagen(数据系统与机器人,丹麦IT大学) ; Interaction Lab, University of Southern California(交互实验室,南加州大学)
AI总结 本研究通过手持触觉设备上的节奏振动匹配游戏,发现触觉交互能显著降低儿童的生理唤醒(心率下降3.56 bpm)和身体躁动(整体运动减少38%),从而促进平静和专注状态。
Comments 34 pages, 2 tables, 7 figures
通过反应语气建模社区态度:评估LLM与在线社区语言行为对齐的人机协作框架
机构 * Information Sciences Institute University of Southern California(南加州大学信息科学研究所)
AI总结 提出CARE框架,通过细粒度言语气势分析,评估LLM模拟社区对真实新闻的反应,揭示其存在“现实主义差距”,表明当前对齐策略不足以捕捉在线群体的社会语言动态。
Comments Preprint
VLMs 是在看还是只是在说?揭示视觉重新检查的幻觉
机构 * University of Southern California(南加州大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 通过图像交换探测框架 VisualSwap 和 800 对图像基准 VS-Bench,发现视觉语言模型在推理时声称的“重新检查图像”多为文本模式,而非真正的视觉重新检查,且思考模型更易受影响,用户指令可恢复视觉基础但自我反思无效。
Comments ICML 2026 Oral
重新思考层冗余:校准比搜索在LLM深度剪枝中更重要
机构 * Neural Superintelligence Lab, MODULABS(神经超智能实验室,MODULABS) ; University of Southern California(南加州大学) ; Boston University(波士顿大学) ; Seoul National University(首尔国立大学) ; Inha University(inha大学)
AI总结 本文通过实验发现,在大型语言模型深度剪枝中,校准配置对剪枝模式和性能的影响远大于搜索算法的选择。
Comments Preprint
COOP$^2$: 定义、观察和修复LLM多智能体系统中的合作
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Southern California(南加州大学) ; Singapore University of Technology and Design(新加坡科技设计大学) ; University of Arizona(亚利桑那大学)
AI总结 提出COOP$^2$框架,通过将高层合作动态与任务进度关联,定义可验证的合作任务,并开发COOP$^2$-Repair方法预测约束失败并引导修复,提升LLM多智能体系统的任务成功率和约束满足度。
Tournament-GRPO:面向开放式长文本生成强化学习的群组锦标赛奖励
机构 * Renmin University of China(中国人民大学) ; University of Southern California(南加州大学) ; Zhejiang University(浙江大学) ; Xiaohongshu Inc.(小红书公司)
AI总结 针对开放式长文本生成中缺乏可靠参考答案和自动评估指标的问题,提出Tournament-GRPO框架,通过同一查询生成结果间的多轮锦标赛比较将基于规则的LLM评判转化为相对奖励,在Deep Research Bench上取得4.52分提升。
CART随机森林作为随机机会集上的序贯分配:集成风险的随机控制理论
机构 * Faculty of Business, Lingnan University(岭南大学商学院) ; Data Sciences and Operations Department, University of Southern California(南加州大学数据科学与运营部门)
AI总结 本文从随机控制视角将CART随机森林建模为随机机会集上的序贯分配过程,通过分离特征子采样和信息分裂策略两个设计杠杆,揭示了森林均方误差的构成,并证明了CART策略的局部稳定性与全局次优性。
Comments 69 pages, 1 figure
概念隐写术
机构 * University of Southern California Information Sciences Institute(南加州大学信息科学研究所)
AI总结 提出概念隐写术,通过思维链中的高级推理行为模式而非词汇选择嵌入信息,实验表明其对释义防御比标准关键词方法更鲁棒,且不影响推理效用。
基于重建的脑电图基础模型中的非周期和低频谱偏差
机构 * University of Southern California(美国南加州大学) ; Aalborg University(奥尔堡大学)
AI总结 研究揭示基于重建预训练的脑电图基础模型存在非周期和低频成分偏差,导致低资源场景下性能不佳,并提出通过辅助损失关注高频振荡结构来改进。
Comments 18 pages, 13 figures, 3 tables
NeuroMambaLLM:使用Mamba和语言模型推理的自闭症大脑fMRI功能连接的动态图学习
机构 * Department of Electrical and Computer Engineering, McMaster University(麦基尔大学电气与计算机工程系) ; Department of Biomedical Engineering, University of Southern California(南加州大学生物医学工程系) ; Department of Electrical and Computer Engineering, University of Rochester(罗切斯特大学电气与计算机工程系) ; BIOSEN Group(BIOSEN集团)
AI总结 提出NeuroMambaLLM框架,结合动态潜在图学习、选择性状态空间时序建模与冻结的大语言模型,通过低秩适应实现fMRI动态功能连接的诊断分类与临床文本报告生成。
EVIDENT: 通过实体锚定的视觉证据路由MLLM适配用于跨域视频时间定位
机构 * Kyung Hee University(庆尚大学) ; University of Southern California(南加州大学) ; Seoul National University(首尔国立大学)
AI总结 针对视频时间定位中域迁移导致性能下降的问题,提出EVIDENT框架,通过实体瓶颈适配器、实体绑定蒸馏损失和实体到证据门控机制,利用预训练MLLM的实体注意力实现参数高效的跨域鲁棒时间定位。
过马路前左右看:从2D视觉先验中提取交叉场
机构 * University of Chicago(芝加哥大学) ; University of Southern California(南加州大学) ; University of Edinburgh(爱丁堡大学)
AI总结 提出CrossLift方法,利用文本到图像先验从2D图像中提取方向信号,通过两次平滑插值将其反投影到网格表面,生成语义对齐的交叉场和四边形网格。
Comments Project page at: https://crosslift.github.io/
用于评估手术反馈质量的多智能体LLM框架
机构 * Computing + Mathematical Sciences, California Institute of Technology(加州理工学院计算与数学科学系) ; Department of Urology, Cedars-Sinai(塞斯医疗中心泌尿科) ; Keck School of Medicine, University of Southern California(美国南加州大学凯克医学院)
AI总结 提出一个两阶段LLM框架,通过多智能体提示和手术领域知识注入发现可解释的反馈质量标准,并利用LLM作为评判者自动评分,在预测反馈有效性上优于先前方法。
Comments 25 pages, 3 figures
Second Guess: 通过弃权和答案稳定性检测小型语言模型的不确定性
机构 * University of Southern California(南加州大学) ; Information Sciences Institute(信息科学研究所)
AI总结 提出一种轻量级、无参数的提示技术Second Guess,通过添加“我不知道”选项并观察答案稳定性,在多项选择问答中实现弃权,有效检测小型语言模型的不确定性。
可解释且无需反向传播的绿色学习用于高效多任务超声心动图分割与分类
机构 * Harvard Medical School and Massachusetts General Hospital(哈佛医学院和麻省总医院) ; Graduate Institute of Biomedical Electronics and Bioinformatics(生物医学电子与生物信息学研究生院) ; University of Southern California(南加州大学)
AI总结 提出一种无需反向传播的多任务绿色学习框架,通过无监督VoxelHop编码器与多级回归解码器及XG-Boost分类器,在EchoNet-Dynamic数据集上实现左心室分割与射血分数分类,以极低参数量达到高精度。
Comments Accepted for publication in APSIPA Transactions on Signal and Information Processing. Jyun-Ping Kao and Jiaxing Yang contributed equally to this work. C.-C. Jay Kuo and Jonghye Woo are the senior authors