Increasing Computation Resolves Conflicts in Vision Language Models
提升计算能力缓解视觉语言模型中的冲突
专题命中 评测与基准 :language model(title,abstract)
AI总结 本研究发现视觉语言模型通过增加计算资源能更有效解决冲突,展示了大规模神经网络中的优化动态如何产生类人认知控制。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
提升计算能力缓解视觉语言模型中的冲突
专题命中 评测与基准 :language model(title,abstract)
AI总结 本研究发现视觉语言模型通过增加计算资源能更有效解决冲突,展示了大规模神经网络中的优化动态如何产生类人认知控制。
OPTIAGENT:一种基于物理的代理框架用于自动光学设计
机构 * Zhejiang University(浙江大学) ; INSAIT, Sofia University(INSAIT,索菲亚大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 OPTIAGENT通过结合LLM与物理驱动的优化方法,首次实现了无需专业光学知识即可自动设计光学系统,提升了光学设计的自动化水平和精度。
解锁认知能力并分析感知-逻辑权衡
机构 * Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息与通信研究 institute(I 2 R),A*STAR,新加坡)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 MERaLiON2-Omni(Alpha)通过解耦感知与推理能力,针对东南亚地区提出多语言全方位感知模型,揭示感知与逻辑之间的效率-稳定性权衡问题。
Resp-Agent:一种基于代理的多模态呼吸声生成与疾病诊断系统
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 Resp-Agent是一种基于代理的多模态系统,通过主动对抗课程代理和模态编织器提升呼吸声生成与疾病诊断的鲁棒性。
Comments 24 pages, 3 figures. Published as a conference paper at ICLR 2026
Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)
通过令牌级奖励学习生成安全代码
机构 * Fuyao University of Science and Technology(福耀科技大学) ; Xiamen University(厦门大学) ; Peking University(北京大学) ; Huawei(华为)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出Vul2Safe和SRCode框架,通过令牌级奖励提升代码安全性,有效减少生成代码中的安全漏洞并提高代码质量。
Comments 18 pages, 3 figures
立体说话者:基于优先级的混合专家引导的音频驱动3D人类合成
机构 * Department of Automation, Tsinghua University(自动化系,清华大学) ; Bytedance Inc.(字节跳动公司) ; State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) ; School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 Stereo-Talker通过优先级引导的混合专家机制实现音频驱动的3D人类合成,生成具有精确唇同步和逼真质量的视频。
Journal ref TPAMI 2025
CMT-Benchmark:由专家研究人员构建的凝聚态理论基准
机构 * Rutgers University(罗格斯大学) ; Harvard University(哈佛大学) ; Weizmann Institute of Science(魏茨曼科学研究所) ; ETH Zürich(苏黎世联邦理工学院) ; Cornell University(康奈尔大学) ; Stanford University(斯坦福大学) ; University of Zürich(苏黎世大学) ; Stanford Institute for Materials and Energy Sciences(斯坦福材料与能源科学研究所) ; SLAC National Accelerator Laboratory(斯坦福直线加速器实验室) ; University of California, Los Angeles(加州大学洛杉矶分校) ; National Taiwan University(台湾大学) ; San José State University(圣何塞州立大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 CMT-Benchmark通过专家设计的50个凝聚态理论问题评估LLM在物理推理能力上的不足,揭示当前模型在复杂科学问题上的局限性。
Comments CMT-Benchmark dataset is available at https://huggingface.co/datasets/JVRoggeveen/cmt_benchmark. CMT-Benchmark was referenced in the Gemini 3 Deep Think (February 2026) release at https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-deep-think/
Journal ref International Conference on Learning Representations (ICLR) main conference 2026
单株的主观性
机构 * MIT, Cambridge, USA(麻省理工学院,剑桥,美国)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文探讨了机器学习模型间高度一致性的主观性,指出评估单株现象需依赖基线模型和情境选择,通过实验验证不同假设下的推断差异。
统一的生成与理解模型能否在不同输出模态间保持语义等价性?
机构 * Tencent Youtu Lab(腾讯云图实验室) ; Xiamen University(厦门大学) ; Computing Lab, Department of Artificial Intelligence, School of Informatics(计算实验室,人工智能系,信息学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本研究探讨统一生成与理解模型在不同输出模态间保持语义等价性的能力,发现其在视觉回答任务中存在性能下降问题,原因在于跨模态语义对齐的失效。
Comments Equal contribution by Jie Li
LFQA-HP-1M:一个大规模的人类偏好数据集用于长形式问答
专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 LFQA-HP-1M是一个大规模的人类偏好数据集,用于长形式问答的评估,提出了九个评估准则并展示了其在评估性能上的有效性。
Comments LREC 2026 Accepted. https://huggingface.co/datasets/nlpatunt/LFQA-HP-1M
Hello-Chat: 向真实社交音频交互迈进
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI
AI总结 Hello-Chat通过大规模真实对话数据和模态交错训练策略,实现了在拟人化生成和情感一致性方面的突破,推动 empathetic AI 的发展。
结构感知对比学习用于多模态模型的图表理解
机构 * The Japan Research Institute, Limited(日本研究机构)
专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出结构感知对比学习方法,通过专门的损失函数提升多模态模型对图表图像的理解能力,在图像-文本匹配和视觉问答任务中取得显著改进。
Comments 10 pages, 8 figures
Journal ref ICCVW (2025) 7463-7472
AudioCapBench: 音频描述能力的快速评估:涵盖声音、音乐和语音
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 AudioCapBench通过对比不同模型在环境声音、音乐和语音描述任务中的表现,评估了大模型的音频描述能力,揭示Gemini模型在整体质量上优于OpenAI模型。
PTEB: 通过在评估时利用大语言模型进行随机改写实现稳健的文本嵌入评估
机构 * Department of Computer Science Munster Technological University(计算机科学系穆斯特技术大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL
AI总结 PTEB通过在评估时利用大语言模型进行随机改写,提出了一种动态评估方法,以评估文本嵌入的鲁棒性。
Comments EACL 2026 (Main)
以人类为中心的多模态融合用于表情包中性别歧视检测:结合眼动追踪、心率和EEG信号
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出了一种结合眼动追踪、心率和EEG信号的多模态融合模型,用于更准确地检测表情包中的性别歧视。
Comments Accepted to appear in the Proceedings of LREC 2026
基于3D几何先验的双臂操作动作预测
机构 * College of Computer Science, Sichuan University, China(四川大学计算机学院) ; University of Electronic Science and Technology of China, China(电子科技大学) ; Dexmal ; The Chinese University of Hong Kong, HK SAR, China(香港中文大学(HK SAR))
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文提出基于3D几何先验的双臂操作预测框架,通过融合几何特征与2D语义信息,实现高效动作预测与空间理解。
Comments Accepted by CVPR 2026
SPATIALALIGN: 视频生成中动态空间关系的对齐
机构 * College of Computing(计算学院) ; Data Science, Nanyang Technological University, 50 Nanyang Avenue, Singapore 639798(数据科学,南洋理工大学,50 Nanyang Avenue,新加坡639798)
专题命中 评测与基准 :preference optimization(abstract)
AI总结 SPATIALALIGN通过引入DSR-SCORE和DPO方法,提升文本到视频生成中动态空间关系的对齐能力。
Comments Project page: https://fengming001ntu.github.io/SpatialAlign/
Q-Save:迈向生成视频评估的评分与归因
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 评测与基准 :SFT(abstract)
AI总结 Q-Save提出一个统一的生成视频评估模型和数据集,通过三阶段训练策略实现质量评分与归因生成,提升AIGV质量预测的准确性和可解释性。
Comments 20 pages, 11 figures
AutoDebias:文本到图像模型的自动化去偏框架
机构 * Universiti Malaya(马来大学) ; Monash University(莫纳什大学) ; United Arab Emirates University(阿拉伯联合酋长国大学) ; University of Science and Technology Beijing(北京科技大学) ; Nanyang Technological University (NTU)(南洋理工大学) ; City St George’s, University of London(伦敦大学圣乔治学院) ; Augusta University(奥古斯塔大学) ; Squirrel Ai Learning
专题命中 评测与基准 :language model(abstract)
AI总结 AutoDebias提出了一种自动化框架,用于检测和减轻文本到图像模型中的恶意偏见,通过视觉语言模型和CLIP引导的训练过程,有效应对隐秘注入的刻板印象和多重攻击。
Comments Accepted to CVPR 2026
FinBloom:基于实时金融数据的知识引导大型语言模型
机构 * Indian Institute of Management Ahmedabad(印度管理学院阿赫迈德亚德分校) ; Aalto University School of Business(阿尔托大学商学院)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 FinBloom通过实时金融数据增强LLMs能力,实现高效金融任务处理。
Comments 39 pages, 10 tables
针对大型语言模型中成员推断在目标数据提取中的有效性研究
机构 * American University of Beirut(贝鲁特美国大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG
AI总结 本研究通过整合多种成员推断技术评估其在大型语言模型目标数据提取中的有效性,并与传统基准测试进行比较以评估实际应用价值。
Comments This work has been accepted for publication at the IEEE Conference on Secure and Trustworthy Machine Learning (SaTML). The final version will be available on IEEE Xplore
RCPU: 结构化剪枝中旋转约束的误差补偿
机构 * AI Division, KDDI Research, Inc.(KDDI研究公司人工智能部门)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本文提出RCPU方法,通过旋转约束更新和方差感知评分,有效补偿结构化剪枝中的误差,提升LLM的性能。
Comments Accepted as ICLR2026
面向任务的小型语言模型加速
机构 * Amazon(亚马逊)
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);small language model(abstract);SLM(abstract)
AI总结 本文提出TASC框架,通过任务自适应序列压缩方法提升小型语言模型的推理效率,同时保持任务性能。
RF-Agent: 通过语言代理树搜索实现自动奖励函数设计
机构 * Beihang University(北航大学)
专题命中 效率与部署 :language agent(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 RF-Agent通过语言代理树搜索实现自动奖励函数设计,利用蒙特卡洛树搜索和LLMs的上下文推理能力,提升低层控制任务的奖励函数设计效率和效果。
Comments 39 pages, 9 tables, 11 figures, Project page see https://github.com/deng-ai-lab/RF-Agent
GreenServ: 多模型LLM推理中的节能上下文感知动态路由
机构 * University of Amsterdam(阿姆斯特丹大学) ; University of Milano-Bicocca(米兰-比科卡大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 GreenServ通过动态上下文感知路由优化多模型LLM推理的能耗与准确率平衡。
Comments Paper under submisison
FineScope:基于SAE的 数据选择 使 得领域特定 LLM 剪枝 和 微调
机构 * POSTECH ; DGIST ; COGA Robotics(COGA机器人)
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 FineScope通过SAE指导的数据选择,实现领域特定LLM的高效剪枝与微调,提升领域任务性能。
量化专家:基于专家混合的令牌感知自适应误差重建用于大视觉-语言模型量化
机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) ; Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) ; Xi’an Jiaotong University(西安交通大学)
专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.AI
AI总结 本文提出Quant Experts,通过令牌感知的专家混合方法,提升大视觉-语言模型在量化过程中的任务准确性,保持与全精度模型相当的性能。
Comments 13 pages, 6 figures, including appendix, Accepted at CVPR 2026
DUET:基于高效上下文化教师的蒸馏式大语言模型去学习
机构 * George Mason University(乔治·玛森大学)
专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 DUET通过结合上下文化和蒸馏方法,实现高效大语言模型去学习,提升遗忘控制与数据效率。
语言模型作为信使:增强异质图学习中的信息传递
机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) ; School of Information and Intelligent Science, Donghua University(东华大学信息与智能科学学院)
专题命中 效率与部署 :language model(title,abstract);分类 cs.AI
AI总结 LEMP4HG通过语言模型增强信息传递,提升异质图学习性能,同时保持同质图的鲁棒性。
R2GenCSR: 为基于大语言模型的放射学报告生成挖掘上下文和残差信息
机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) ; First Affiliated Hospital of Anhui University of Chinese Medicine(安徽中医药大学第一附属医院)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 R2GenCSR通过引入Mamba和上下文检索提升基于LLM的放射学报告生成性能
Comments R2GenCSR is accepted by IEEE Journal of Biomedical and Health Informatics (JBHI) 2026