全球首个英伟达含量为0的万亿模型,成了海外开发者的抢手货

火博体育玩法的规则

火博体育玩法的规则
你的位置:火博体育玩法的规则 > 新闻动态 > 全球首个英伟达含量为0的万亿模型,成了海外开发者的抢手货
全球首个英伟达含量为0的万亿模型,成了海外开发者的抢手货
发布日期:2026-07-13 00:10    点击次数:91

国产算力能不能撑起万亿参数大模型?

终于有人交卷了!美团 LongCat-2.0登场。

模型采用自研 MoE 混合专家架构,总参数达 1.6 万亿,每 token 激活约 48B 参数,原生支持 1M 超长上下文。

从训练到推理,英伟达含量为 0 ——

成为首个在国产算力上实现全链路训推闭环的万亿参数模型。

从多项专业评测数据来看,LongCat-2.0 在代码、工具调用和多步逻辑推理等任务上具备较强综合性能。

不过,这位倒也不算开发者的"新朋友",因为人家早就披着马甲"不小心"成为了全球 Agent 开发者的最爱~

没错,最近在 OpenRouter 上挺火热的Owl Alpha,正是 LongCat-2.0(面具版)。

月调用量在 Hermes、Claude Code 和 OpenClaw 分列全球第一、第二和第三位,成为开发者首选的开源模型。

所以说,这位不仅第一个在国产卡上跑通了万亿级训推,还提前通过了市场的真实流量验证??

有意思有意思,等不及了,咱也来上手测一波!

体验方式: https://longcat.chat/platform/product

新用户认证送 1000 万 token

技术报告: https://longcat.ai/blog/longcat-2.0/

把 LongCat-2.0 扔进三个坑里

既然 Hermes 榜单它稳坐第一,那咱也就接入 Hermes 看看实力~

先拿长上下文开刀。

为了验证它是不是真的把信息读进去了,我特意没用公开的论文或者技术白皮书。

自己手动拼了一份语料,把几份不同行业的研报、不同领域的几篇论文拼到一起,中英混杂凑了好几万字,be like:

我先问了一个藏在文档中前段的信息,是一份跨境电商进出口报告。

对比一下回答,信息完全正确!

还有被我特意拆分的完整统计报告,LongCat-2.0 也能准确找到,而且感觉速度挺快,就 1 秒……

它做分析推理也挺清晰,扛住了几万字攻击!

好,胆子大一点,让它干一件程序员最烦的事情:接盘。

我找了一个开源代码仓库,GitHub 上 13k star 的原版 2048,纯 HTML+CSS+JavaScript 架构的项目。

把它丢给 LongCat-2.0,然后提了两个具体需求:

视觉类修改:把整个游戏的配色方案改成赛博朋克风格,要深色背景、霓虹色的方块、发光效果的数字。

功能类修改:把 4x4 的棋盘改成 5x5,同时增加一个计步器显示在棋盘下方,记录玩家一共滑了多少步。

拿到任务后它先把关键文件挨个过了一遍,自己拆出了一个 7 步的修改计划。

剩下的完全不用我管,LongCat-2.0 自己跑了 12 分钟,交付了一个完整的结果。

那咱就来试玩一把!

从效果上看,我要的计步器和 5x5 方格都有,而且改完配色 ok。

改个颜色加个计步器当然不算难活儿,我又加了一道题。

让它把整个项目从原生 JavaScript 迁移到 React。

跑出来的游戏看着一样,功能全部保留,但底层代码已经完全重写了。

LongCat-2.0 官宣后的这两天,看到不少朋友说它和 Claude Code 搭配也很香。

好好好,那咱接入 Claude Code 再试一局。

这次我给了一个研究主题让它帮忙调研。虽然 Claude Code 自带 deep-research,但咱先不用,看看 LongCat-2.0 的实力如何。

通过 Agent 原生能力自主连网搜索,LongCat-2.0 独立完成了整篇结构化报告。

当然了,代码能力也不能落下,那就来个「只有一道门」魔性小游戏吧。

拿到任务后,LongCat-2.0 开启了统筹能力,先把项目架构一列,然后就开始哐哐写代码。

中间的架构设计、模块拆分、技术选型,全是它自己定的。关卡逻辑、交互细节、通关动画一个没落,并主动加了个 Web Audio 音效。

然后我还顺手接入 LongCat-2.0 的 API 做了个代码分析师,输入任意 GitHub 仓库,就能定制一份专属分析报告。

什么项目结构、核心模块、接管的潜在问题、优化建议,全被它给读懂了。

在测试的过程中,咱还发现了一个"彩蛋":给 LongCat-2.0、GPT5.5、Opus 4.6、Opus 4.8 同一段提示词让四个模型生成一套物理仿真代码。

肉眼看上去,各选手呈现效果接近。

但 token 用量 LongCat 明显是最少的,9004tokens,按美团的计费算下来都不到 1 毛钱。

这或许就是官方所说 Cache 命中不计费,Token Plan 不算消耗的结果。

要说"省钱",美团确实是一把好手。

反正这么体验一圈下来,我感觉这 LongCat-2.0 和主流编程工具的适配度确实挺高。

当然了,支撑这些能力的背后,是 LongCat-2.0 在架构层面的一系列原创设计。

并且这些设计诞生在一个特殊的背景下:

LongCat-2.0 从训练到推理,全程基于国产芯片完成。

那么问题来了:国产卡集群是怎么 hold 住万亿参数模型的?

5 万张国产卡撑起一个万亿模型

说到国产芯片跑 AI,其实推理这一步行业里已经有所验证。

过去几年,确实有大模型和线上服务能跑在国产算力平台上运行。

训练方面,行业也陆续有模型完成了百亿、甚至千亿级的训练探索。

但仔细看这些成果,本质上都还是某个环节的单点能力验证。

万亿参数级别,从预训练的第一天就跑在国产卡上的训推全链路闭环,在 LongCat-2.0 之前还没有出现过。

并且这么大规模跑完全流程,考验的是整个系统工程能力,国产芯片的硬件条件又让这件事难上加难。

单卡显存更小,1.6 万亿参数只能拆到成千上万张卡上一起跑;

可通信带宽又不像 NVLink 那么充裕,跨节点通信延迟更高,大规模并行训练中计算与通信容易出现不对齐,拖慢整体吞吐。

图片 AI 生成

硬件差距之外,软件生态也是个坎儿。

在英伟达平台上,很多算子、调试工具、确定性计算能力都已经非常成熟,换到国产芯片之后,很多东西都得自己重写、自己优化。

比如 FlashAttention 的反向梯度算子,国产原有确定性实现只能单核串行,速度慢 20-70 倍,无法落地生产。

所以,LongCat-2.0 的意义并不只是又多了一个 1.6 万亿参数模型。

对于国产 AI 生态来说,它首次证明了国产算力已经具备了支撑先进大模型持续训练、持续部署和持续迭代的能力。

另外一个值得关注的点,就是针对 Agent 时代重新设计的 LongCat Sparse Attention(LSA)。

Agent 意味着模型一次要处理大量上下文,1M 上下文带来的最大压力就在注意力计算。

DeepSeek 之前提出过一套稀疏注意力方案 DSA,核心思路是让模型只关注关键 token 来降低计算量。

但这个方案实际跑起来有个问题是,筛选关键 token 的索引器本身成了性能瓶颈,索引计算越来越慢,显存访问越来越碎,序列越长,效率掉得越明显。

LongCat-2.0 就是从这里接手,提出了LongCat 稀疏注意力(LSA),对索引器做了三项针对性优化:

把零散访问整理成连续读取、让相邻层共享索引结果、再通过两阶段筛选减少计算量。

这三项优化相互独立,可以按需组合,叠在一起的效果是让 1M 上下文的处理速度显著提升,同时模型质量基本无损。

LongCat 稀疏注意力设计总览

另一个很有意思的设计是N-gram Embedding,继承自 LongCat-Flash-Lite,并做了进一步增强。

很多 MoE 模型提升能力的方法都是继续堆专家,但 LongCat 团队反而把一部分参数"前移"到了 Embedding 层,让模型一开始就能识别更多高频词组和语言模式。

简单理解就是,以前很多事情要模型思考几十层才能反应过来,现在一开场就能认出来。

这样既提高了代码、指令理解等任务的准确率,也减少了专家之间频繁通信带来的额外开销。

N-gram Embedding 总览

除此之外,像ScMoE 快捷连接、零计算专家等设计,也都围绕着同一个目标,就是让模型把算力花在真正值得算的地方。

这套架构创新让模型实现更快、更省、效果更强,但 5 万张国产卡大规模集群落地,还需攻克诸多工程难题。

其中最现实的问题就是,卡会坏。

在这样的规模下,几乎每天都会出现硬件故障,所以 LongCat 团队专门搭了一套自动化故障处理体系。

从异常检测、链路切换到自动恢复几乎全部自动完成,把日均故障率从万分之 15.7 降到了万分之 4.4,还支持训练任务从 2560 张卡一路扩到 5 万多张卡,不用推倒重来。

另一边,他们又重写了一整套适配国产芯片的算子和并行方案,把硬件利用率(MFU)从 17.8% 提升到 27.68%,单日 Token 处理能力从 7170 亿提升到了 1.12 万亿。

靠着一系列架构和工程优化,美团把国产芯片的潜力一点点释放出来。

而且这些优化叠在一起,还有一个特别现实的好处——

省钱。

零计算专家减少无效计算,ScMoE 减少等待时间,N-gram Embedding 降低通信压力,再叠加国产芯片本身的成本优势,LongCat-2.0 的训推成本比同等规模的英伟达路线低了不少。

3 年等待的"国芯 + 国模"终上台前

从公开信息来看,美团布局国产算力已有三年。

2023 年初美团成立了 LongCat 基座团队,起步的第一件事就是搭建国产算力集群。

众所周知,用国产卡训模型意味着每个环节都要自己啃,研发周期更长,成本更高。

但国产算力集群一定是未来的主流,美团的选择就是在用"时间换空间",接受了短期适配阵痛,提前吃透国产算力全链路以稳住大模型长期迭代节奏。

现在看来,这个判断价值正在兑现。

2023 年搭集群跑通千亿参数训练流程,2024 年在国产卡上验证 MoE 架构,2025 年推出 5600 亿参数的 LongCat-Flash,2026 年落地了 1.6 万亿参数的 LongCat-2.0。

而且 OR 上匿名的 Owl Alpha,用两个月时间证明了一个比纸面技术指标更关键的问题:

国产芯片训出来的万亿规模模型,全球开发者也会买账。

LongCat-2.0 在完全匿名、无品牌背书的情况下,在多个场景下会被当成首选,这说明模型交付的结果大家是认可的。

今年 3 月,美团核心本地商业 CEO 王莆中在内部谈到 AI 时曾提到过一个关键词,建设物理世界 AI 底座。

他当时表示,美团会持续投入基础模型,做有特色、低推理成本,同时能力紧跟 SOTA 的模型。

从这个角度再看 LongCat-2.0,全流程训推只靠国产算力的它,确实在往有特色和低推理成本的逻辑上靠;

同时它的出现也像是在给未来的物理世界 AI 打地基,基模能力站住了,往上搭理解层和行动层才有着力点。

那么问题来了,下次冲榜的新 SOTA,会以什么新马甲出现呢?(doge)

参考链接:

[ 1 ] https://x.com/dr_cintas/status/2071363139967291838

[ 2 ] https://x.com/rohanpaul_ai/status/2071123605694652737

[ 3 ] https://github.com/gabrielecirulli/2048

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  完  —

� � 点亮星标 � �

科技前沿进展每日见



上一篇:自变量机器人发布全球首个世界统一模型,35天后新一代机器人入驻真实家庭
下一篇:没有了