9月16日,B站「AI无限竞技场」正式上线,首期大模型测评榜单同步揭晓。在10位UP主的实测对比中,GPT-6 Astra凭借综合实力摘得桂冠,击败GLM-5.3成为榜单首位冠军。值得注意的是,在排名前五的模型中,有三款为中国国产大模型,表现亮眼。
「AI无限竞技场」是一个汇聚了B站UP主真实测评数据的竞技广场。与传统跑分评测不同,这里打破了主题与维度的限制。各领域的UP主将基于真实工作流、专业应用及趣味脑洞等自主命题,对上百个大模型进行同题PK。这种开放式的实测方式,能够直观呈现各模型在实际场景中的表现差异,涵盖代码、推理、协作、知识等多种核心主题。
首期榜单现已囊括DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax等众多主流大模型的对比测评。
过去一年,B站AI生态迎来了爆发式增长。数据显示,AI知识内容消费时长同比增长72%,月均观看AI内容的用户已突破1.9亿。B站特有的直播、视频及弹幕生态,天然契合了AI科技爱好者的交流与获取需求。从产品发布、用户讨论,到测评、求助与共建,社区内的活跃氛围促使大量高质量测评内容不断沉淀。在此背景下,「AI无限竞技场」应运而生。
该竞技场排名将实时更新,并持续面向全站UP主开放报名。随着更多真实场景测试案例的加入,榜单将不断丰富,不仅能让大模型能力得到更充分的检验,也能为用户提供更全面了解AI能力边界的视角。
榜单链接:https://www.bilibili.com/blackboard/era/aiarena.html?bsource=market_aiarena_sns_02
