MasonTigers at SemEval-2024 Task 9: Solving Puzzles with an Ensemble of Chain-of-Thoughts
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments Accepted as Shared Track Paper at 7th FinNLP Workshop @ LREC-COLING 2024
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL
Comments LREC-COLING 2024, Long Paper
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments Accepted by LREC-COLING'2024
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
Comments preprint. Library is available at https://github.com/SalesforceAIResearch/AgentLite
专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract);分类 cs.CL
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments 19 pages, 11 figures, accepted by EMNLP2023
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL
Comments Accepted at Findings of EMNLP 2023
专题命中 复杂问题求解 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
Comments Accepted by AAAI 2023
Journal ref AAAI 2023
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments Conference on Robot Learning (CoRL) 2023, Oral Presentation
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract);分类 cs.AI
专题命中 复杂问题求解 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
Comments 16 pages
迈向更可靠的人工智能:减少视觉-语言模型中的幻觉
机构 * Department of CS AI and Data Science(计算机科学与数据科学系) ; ESEO Engineering School(ESEO工程学院) ; Faculty of Law, Economy, Management(法学院、经济与管理学院)
专题命中 复杂问题求解 :self-correction(abstract,comments);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出无需训练的自我纠正框架,通过不确定性引导的视觉再注意力减少视觉-语言模型中的幻觉,提升响应准确性。
Comments 24 pages, 3 figures, 2 tables. Training-free self-correction framework for vision-language models. Code and implementation details will be released at: https://github.com/kassoumsanogo1/self-correcting-vlm-re-Attention.git
Journal ref The 4th National and International Academic Conference Celebrating the 20th Anniversary of Rajapruk University (2026)
DART-SD:面向多轮工具调用智能体自蒸馏的钻石拓扑感知检索与微调
机构 * ByteDance(字节跳动) ; University of Science and Technology of China(中国科学技术大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文针对多轮工具调用智能体训练中的拓扑崩溃问题,提出DART-SD框架,通过建模拓扑、检索恢复参考与渐进自蒸馏提升策略多样性,性能优于传统全轨迹基线。
智能体事务:面向ACID兼容的智能体系统
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出ACID兼容的智能体事务框架,开发对应数据智能体,在基准测试中较含Claude Code的现有智能体提升10.6%,为构建可信可扩展AI智能体开辟新方向。
TraceSafe: 对LLM在多步骤工具调用轨迹上的安全护栏的系统评估
机构 * CyCraft AI Lab, Taiwan(CyCraft AI实验室(台湾)) ; National Taiwan University(国立台湾大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出TraceSafe-Bench,首个评估中间轨迹安全的综合基准,发现安全护栏效果更依赖结构数据能力而非语义安全对齐,通用模型在轨迹分析中表现更优,且准确性随执行步骤增加而提升。
Comments Accepted to Conference on Language Modeling (COLM) 2026
Kimi K2.5:视觉代理智能
机构 * Kimi Team(Kimi 团队)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Kimi K2.5通过联合优化文本和视觉模态,提出Agent Swarm框架,实现多模态代理智能的先进性能和高效任务处理。
Comments Kimi K2.5 tech report
DeepImagine: 通过连续反事实想象学习生物医学推理
机构 * Laboratory for Emerging Intelligence, University of California, San Diego(新兴智能实验室,加州大学圣地亚哥分校) ; Department of Dermatology, University of California, San Diego(皮肤科系,加州大学圣地亚哥分校) ; University of Chicago(芝加哥大学) ; Elsevier(艾尔斯特出版社)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出DeepImagine框架,通过连续反事实想象训练语言模型进行生物医学推理,利用反事实对偶和强化学习提升临床试验预测性能,展示模型在生物医学领域的可解释性改进。
Comments Preprint
大型语言模型中层级情感组织的涌现
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; University of Tokyo(东京大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 受情感轮理论启发,分析大型语言模型输出中情感状态间的概率依赖关系,发现模型自然形成与人类心理模型一致的层级情感树,且更大模型发展出更复杂的层级结构,同时揭示社会经济角色在情感识别中的系统性偏差。
Comments ICML 2026
并非双关:结合对比学习与音义嵌入的多智能体双关语翻译方法,用于CLEF JOKER 2025任务2
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Peoples' Friendship University of Russia (RUDN University)(俄罗斯人民友谊大学) ; Joint Institute for Nuclear Research(联合核子研究中心) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; University of Skövde(斯德哥尔摩大学)
专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究针对跨语言双关语翻译难题,提出结合对比学习、音义嵌入与多智能体生成器-判别器框架的三阶段方法,在CLEF JOKER 2025任务2竞赛中获第一、第二名,推动了双关语翻译研究。
Journal ref CEUR Workshop Proceedings, Vol-4038, pp. 2870-2888, 2025
Remember-R1:通过强化学习缓解长上下文视觉遗忘
机构 * Northwestern Polytechnical University(西北工业大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University(浙江大学)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)
AI总结 该研究针对多模态大语言模型的长上下文视觉遗忘问题,提出强化学习框架Remember-R1,通过过程级监督优化视觉依赖与注意力,提升了多模态推理性能。
Comments Accepted by ACM Multimedia 2026
Lil: 在长解码阶段应用后训练稀疏注意力算法时,少即是少
机构 * SCS, Peking University, Beijing, China(北京大学信息科学与技术学院,北京,中国) ; Key Lab of HCST (PKU), MOE, Beijing, China(高等教育出版社HCST重点实验室(PKU),北京,中国) ; State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国) ; Tencent, Shenzhen, China(腾讯,深圳,中国) ; Beijing Tongming Lake Information Technology Application Innovation Center, Beijing, China(北京 Tongming Lake 信息技术应用创新中心,北京,中国)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了在长解码阶段应用稀疏注意力算法时,信息丢失导致序列变长的问题,提出早停算法减少token消耗并降低精度损失。
STAC:当无害工具形成危险链以劫持LLM代理
机构 * AWS AI Labs(AWS人工智能实验室) ; UC Berkeley(伯克利大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 STAC通过多轮工具链攻击揭示LLM代理的安全漏洞,提出基于推理的防御策略,显著降低攻击成功率。
Comments Long version with 15 pages in main draft and a total of 39 pages including references and appendix. Data and code \url{https://github.com/amazon-science/MultiTurnAgentAttack}
视听火烈鸟:用于长而复杂视频的开放视听智能
机构 * NVIDIA, USA(美国NVIDIA公司) ; University of Maryland, USA(美国马里兰大学)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)
AI总结 研究提出视听火烈鸟,用于长复杂视频的联合理解与推理。贡献包括构建大规模视频集、设计三阶段课程及推理框架。实验显示其在多基准测试中表现优异,超越同类开放模型,在长复杂视听理解推理任务中竞争力强,有现实应用价值和泛化能力。
Comments Project Page: https://avflamingo.pages.dev/