雷火·竞技-视频模型巨大的「隐形成本」,没人告诉你

发布日期:2026-07-29 17:43:40 来源:雷火竞技 阅读量:28

  首页财产阐发评论ai正文 视频模子巨年夜的「隐形成本」,没人告诉你 视频 AI 的护城河,就是那数十 PB 的数据基础举措措施及每个月滚动孕育发生的带宽账单。 2026-06-08 07:15 ·微信公家号:极客公园 宇航猿 编纂 靖宇 宇航猿 编纂 靖宇 AI投资人解读· 练习视频年夜模子成本昂扬,存储视频及特性数据每个月数百万美元,数据进出费也贵,迭代速率快会使成本更高。自建数据中央可节省成本。 · 视频数据体量年夜、需重复利用,对于公有云成本压力年夜,创业公司难以超过。 总结:视频AI范畴竞争门坎高,基础举措措施成本是要害,把握数据存储流转者占优。行业于摸索降本增效要领,如视频Agent标的目的,但数据壁垒难破,投资需审慎评估相干企业成本与数据上风。内容由AI天生,仅供参考

关在 AI 烧钱,业内传播着各类使人张口结舌的数字。xAI 花了跨越 10 亿美元建起 Colossus 超算集群;OpenAI 的月度算力账票据称高达数亿美元;Anthropic 近来几轮融资拿到的钱,于公家眼里险些已经经及「GPU 时数」直接画上了等号。

各人谈的,险些都是算力。GPU 成为了权衡一家 AI 公司实力的通用钱币,也是每一一篇融资报导里最显眼的阿谁数字。

但近来,我听了一期 Latent Space 播客,采访对于象是 xAI 前研究员 Ethan He——Ethan 于 2025 年中插手 xAI 时,面临的是一个没有基础举措措施、没有数据、没有现成模子的白纸状况,然后用三个月时间及一支小团队,从零搭建出了 Grok Imagine 视频天生体系,做到了其时业内的一流水准。

于聊到年夜范围视频模子的练习成本时,他说了一组数字,让我忽然意想到,这个行业可能一直于算错了账。

「光是存储这些视频及特性数据,每一个月就要几百万美元——这还有没算算力成本。」

01

账单上的隐蔽成本

从零到一,最先练习一个视频年夜模子,需要花几多钱?先假定你的团队有矿,GPU 算力随意用。即便云云,你可能依然低估了这件事的巨量成本。

假定你要练习一个世界级的视频天生模子,去网上爬取了 10 亿条视频,每一条平均 5MB——这已经经是相称守旧的预计了。光这一项,你就需要 5PB(拍字节)的存储空间。根据 AWS S3 的订价,5PB 尺度存储,每一个月约莫 10 万美元。

但这还有只是原始视频。

于练习视频模子以前,业界通行的做法是先用 VAE(变分自编码器)把视频压缩成「潜于空间」的特性向量——由于一段视频睁开成像素,可能有几十亿个 token,任何 Transformer 都处置惩罚不了,必需先压缩成模子能理解的持续向量。

问题是,这份压缩后的特性数据,体积及原始视频相称,一样需要持久存储,随时备用。

两项叠加,数十 PB,每个月存储费就跨越 20 万美元。

然后是最出乎意料的那一项:数据进出费(egress/ingress)。

Ethan 说,从互联网下载 10 亿条视频的带宽用度,于 AWS 上比存储这些视频还有贵。每一次练习,数据都要从存储层拉到计较层跑一遍。视频模子的练习不像语言模子那样训完就完了——要迭代,要调参,要测试差别的数据配比,每一一次试验都象征着把全量数据再过一遍。试验跑患上越多,这笔钱就乘以响应的倍数。

综合算下来,Ethan 的估算是,光是数据这一块,每一个月就要几百万美元。GPU 的用度,还有没最先计入。

这笔账,我从来没见哪篇 AI 行业报导细算过。

02

扛不住的带宽费

那像 xAI 如许自建 Colossus 数据中央的公司,是否是于存储及带宽上省了一年夜笔钱?

Ethan 的回覆很直接:「固然,省了许多。」

这句话暗地里,藏着视频 AI 行业一个不太被会商的布局性奥秘。

年夜语言模子的练习数据是文本,体积相对于轻量,并且练习完成以后,原始数据基本就完成为了任务——你不需要重复拉取全量语料来做推理或者微调。但视频数据彻底差别:体积是文本的几个数目级,并且每一一次练习试验都要把全量数据完备过一遍。

迭代速率越快,数据搬运的成本就越高;而 Ethan 重复夸大,迭代速率,偏偏是视频模子研发中最要害的变量。

这就形成为了一个彼此咬合的困局:你需要快速迭代来晋升模子质量,但快速迭代象征着频仍搬运数据,而频仍搬运数据于公有云上的账单会把你压垮。

Ethan 本人的轨迹就是一个注脚。他于 NVIDIA 介入构建了 Cosmos 世界模子,做着做着意想到,视频模子存于及语言模子近似的「范围定律」,还有有很年夜的晋升空间。他其时面对的选择,外貌看是「我需要更多 GPU」,但一样要害的一句话他没明说——他需要一个不消按 AWS 账单算钱之处,来存放及搬运数据。这也是他去 xAI 的底子缘故原由之一,而 Colossus 给了他阿谁情况。

对于在没有自建基础举措措施的团队来讲,这笔账是怎么算的?每一个月几百万美元的数据成本,叠加于 GPU 算力之上,象征着哪怕你有一流的算法团队,哪怕你募到了充足的资金,只要你还有于用公有云,你就是于用一个无底洞的账单跟敌手的自建机房竞走。

这道门坎,不是一家有优异算法的创业公司能靠「技能取胜」跨已往的。

03

视频模子的护城河不是模子

这让我想起一个有趣的对于比。

于年夜语言模子范畴,「开源 vs 闭源」的竞争打患上相称激烈,Llama 系列的呈现让许多小团队也能于语言模子上打出有竞争力的产物,甚至逼着 OpenAI 及 Anthropic 不停压低 API 价格。但于视频天生范畴,咱们看到的格式大相径庭:能连续做召盘 尖视频模子的,基本只有 Sora、Veo、可灵这些违靠巨量资源的团队,没有一家是靠开源社区于车库里跑出来的。

许多人把这归结为「数据及算力的差距」。这固然没错,但 Ethan 展现的这组数字告诉咱们,问题比这更深:视频 AI 的基础举措措施成本,从一最先就把竞争的门坎,锁死于了少少数玩家的高度上。

这及半导体行业的逻辑有几分相似。台积电之以是难以撼动,不只由于它们有更好的设计,更由于一座新晶圆厂需要几百亿美元的前期投入,这道门坎自己就是最 好的护城河。视频 AI 的护城河,就是那数十 PB 的数据基础举措措施及每个月滚动孕育发生的带宽账单。

Ethan 于播客里还有增补了一个更深的推论:视频模子的「智能」,年夜部门实在来自暗地里的语言模子,而不是视频扩散模子自己。

视频扩散模子相对于「痴顽」,它只会根据文字描写照单全收地天生画面,描写写「一只猫」,它就天生一只猫,站于纯白配景前,岿然不动——由于你没有告诉它配景是甚么、猫于做甚么。

真正理解用户用意、把「一只猫」扩写成一段邃密的镜头语言描写的,是暗地里阿谁做「提醒词重写」的年夜型语言模子。Ethan 说,于 Cosmos 期间,他曾经经用一个「欢愉的羊」做测试:不颠末提醒词重写,天生出来的画面极为 CGI、毫无质感;加之重写以后,效果判若云泥——而整个视频扩散模子自己,并无发生任何转变。

这象征着,决议一家公司于视频 AI 范畴能走多远的,不只是视频模子的参数范围,而是可否同时撑起语言模子及视频模子这两套基础举措措施,并让它们有用协同。

这是一场拼综合体力的竞赛。

04

下一个疆场,早就被划好了

固然,行业也于探索前途。

提醒词重写的 Agent 化、让语言模子像「批示官」同样调理多个视频天生东西、用 FFmpeg 这种传统软件处置惩罚中间环节——这些标的目的的配合逻辑是,把「语言模子的推理成本」及「视频扩散模子的天生成本」分层计较,让每一一次视频天生的挪用越发精准,削减无效的计较及数据搬运。

Ethan 对于「视频 Agent」的走向相称笃定。他猜测本年年末将呈现一个拐点——当 Agent 天生的视频质量可以或许不变到达「可投放贸易告白」的水准,企业才会真正愿意为之买单,总体的成本布局也会随之蜕变。

但有一点不会变:谁把握了数据的存储及流转,谁就把握了这场游戏的出发点。

于 AI 这个赛道上,「真实的壁垒」每一隔一段时间就会轮换一次。先是参数目,然后是练习数据范围,然后是对于齐技能,然后是推理效率。此刻,视频 AI 正于展现下一道壁垒——不是某种神秘的算法冲破,而是一份冷冰冰的基础举措措施账单。

这笔账,从一最先就没筹算让所有人都算患上起。

【本文由投资界互助伙伴微信公家号:极客公园授权发布,本平台仅提供信息存储办事。】【免责声明】:本文不组成任何投资建议。市场有危害,投资需审慎。若有任何疑难,请接洽(editor@zero2ipo.com.cn)投资界处置惩罚。

-雷火·竞技