印度”主权AI”翻车记:从套壳Mistral到套壳DeepSeek,一部印度科技界的”拿来主义”简史

导语:印度最明星的AI独角兽Sarvam AI,高调宣称要为14亿印度人打造”主权AI”,拿到了政府合同和4100万美元融资。然而技术人员一扒底裤,发现它的”自研大模型”先套的是法国Mistral的壳,后套的是中国DeepSeek的壳。这究竟是一出科技骗局的闹剧,还是第三世界”拿来主义”弯道超车的必然路径?


一、”印度主权AI”的华丽出道

2023年12月,Sarvam AI正式出道。

这家由两位印度顶级技术背景创始人创办的公司,在成立仅五个月、员工约18人的情况下,宣布完成了4100万美元的种子轮加A轮融资——印度AI创业公司在这个阶段的最大单笔融资。投资方包括Lightspeed、Peak XV和Khosla Ventures,全是顶级资本。

创始人简历确实亮眼:Pratyush Kumar,IIT Bombay本科、ETH Zurich博士、89篇学术论文、AI4Bharat联合创始人;Vivek Raghavan,IIT Delhi本科、卡内基梅隆博士、Synopsys前副总裁、曾深度参与印度Aadhaar身份证系统建设十二年。

两位不是在硅谷学了几天深度学习就回国圈钱的”海归”,而是真正在印度数字基础设施最深处摸爬滚打过的老兵。

投资人Khosla Ventures创始人Vinod Khosla说得很好听:”我们需要像Sarvam这样的公司,为印度、在印度构建AI的深度能力。”

Sarvam也给出了自己的答案:造一个印度人自己的AI,一个不依赖英语、真正懂印度二十二种官方语言的大模型。

愿景是宏大的,融资是巨额的,故事是动人的。

然后呢?


二、第一次翻车:套壳Mistral

2025年5月23日,Sarvam发布了Sarvam-M。

这是一个240亿参数的混合模型,支持10种印度语言,针对数学和代码任务做了强化训练。发布公告里列了一串基准测试数字,措辞是”多项指标上与全球领先模型相当”。

但问题是:这个模型的底座,是法国公司Mistral的开源模型Mistral Small。

Sarvam的工程师在这个基础上用印度语言数据做了大规模的后训练。

名字里的那个”M”,据说就代表Mistral——虽然Sarvam没公开承认,但媒体和开发者都心知肚明。

这下印度科技圈炸了。一家宣称要造”印度自己的AI”、刚刚拿到政府主权模型合同的公司,交出的第一个成果,用的是法国人的底座?

2025年5月24日,Menlo Ventures投资人Deedy Das在X上发了一条帖子,把一个让很多人隐隐不安的问题用数字说出来了:Sarvam-M上线两天,Hugging Face下载量——23次。

作为对比,他附上了一个数字:两名韩国大学生做的开源模型Dia,上个月下载量约20万次。

最后两个字:丢人。

技术质疑随之而来。有开发者在X上贴出了对比数据——Sarvam-M在IndicLLM基准上的得分仅比原始Llama高出0.02。这意味着什么?意味着你花大价钱训练的”印度主权模型”,提升微乎其微,隔壁Llama开源模型随便跑跑就能追上。

Sarvam-M发布后的舆论风暴

面对全网嘲讽,创始人Pratyush Kumar终于开口了。他转发了批评帖子,写了一句话:

“很高兴收到大家对Sarvam-M的反馈,请继续。等我们开始训练主权模型的时候,这些都会用上。”

这句话翻译一下就是:你们说的都对,但我们真正的重磅产品还没出来呢,你们急什么?

不辩解,不反驳,不羞愧——把公开羞辱原地转化成了”预告”。

这波操作,我给满分。


三、4096块H100,政府买单

实际上,Sarvam确实拿到了真正训练主权模型的资源。

2025年4月,印度政府在67家申请机构中选中Sarvam,承接IndiaAI Mission的主权大模型项目。政府提供4096块NVIDIA H100,使用期六个月,托管在Yotta数据中心。作为交换,Sarvam让出一部分股权,训练完成的模型必须开源。

4096块H100,政府补贴算力,Sarvam负责训练,开源后印度人民受益。

听起来是一笔划算的交易。但账要细算:总账单2.47亿卢比,政府补贴9868万卢比,剩余超过1.5亿卢比要Sarvam自己承担。对于一家年收入只有2910万卢比的公司来说,这个数字意味着巨大的财务压力。

六个月的训练时间,一支114人的团队,在一个GPU基础设施直到最近才勉强够用的国家,完成这件事。

全球AI军备竞赛的背景下,这是一个冒险的赌注。OpenAI融资总额已经超过180亿美元,DeepSeek用相对有限的资源训练出了震惊业界的R1——但它背后是中国成熟的AI基础设施生态。

Sarvam的答案是:从基础设施开始做。

他们重新设计了tokenizer——这是大模型处理文字的最底层组件。现有主流tokenizer对印度文字效率极低,处理梵文、泰米尔文、孟加拉文这类非拉丁字母体系时,需要消耗比英文多出数倍的token。Sarvam重新训练的tokenizer,对印度文字的处理效率提升了三到四倍。

数据管道也是自建的。Sarvam搭建了一套评估数据质量的工具,最终用于预训练的数据量,30B模型约为16万亿token。强化学习基础设施也是自研的——这个环节决定了模型在推理任务上的最终表现,也是DeepSeek-R1让业界重新注意到的核心技术路线。

2025年下半年,Sarvam几乎对外沉默。

对外沉默的背后,是一支114人的团队在训练一个他们自己也不确定能否成功的模型。


四、第二次翻车:套壳DeepSeek

2026年2月,Sarvam开始了密集的公开攻势。

策略是刻意设计的:在India AI Impact Summit召开前的两周,每天发布一个新产品或新功能,连续十四天不间断。语音识别模型、文字转语音模型、文档数字化工具、多语言内容创作平台……节奏像节拍器一样准确。

参照对象很明显:OpenAI在2024年末的”12 Days of OpenAI”发布攻势。Sarvam把它改成了14天。

2月16日,Modi总理在峰会上试戴了Sarvam研发的AI智能眼镜,Pratyush Kumar在X上发了一张照片,配文只有一句:”第一个试戴的人?总理。”

这张照片的传播速度,超过了Sarvam过去两年所有发布的总和。

2月18日,Sarvam正式发布Sarvam-30B和Sarvam-105B。

两个模型,都从零训练。30B模型预训练用了约16万亿token,支持32000 token的上下文窗口,MoE架构下每次推理只激活约10亿参数,推理成本大幅压缩。105B模型支持128000 token的超长上下文,在AIME 25数学竞赛基准上得分88.3,使用工具后达到96.7;MMLU得分90.6;Math500得分98.6。

Pratyush Kumar在台上说,105B在多项推理基准上超过了DeepSeek-R1——而DeepSeek-R1的总参数量是6000亿,是Sarvam-105B的近六倍。

批评在几小时内又来了。

有人在X上翻出了Sarvam-105B的架构配置文件,指其为”DeepSeek的山寨缩水版”。有帖子把配置文件扔进ChatGPT,得到的描述是:”Mini DeepSeek-V2风格模型”。

这个截图被广泛转发。

对于刚刚经历过Sarvam-M事件的人来说,这个指控听起来似曾相识——上次是法国人的底座,这次是中国人的架构。

Pratyush Kumar的回应比上次更直接:团队欣赏DeepSeek的研究,也从中学习,但Sarvam-105B是用更小的规模做到了这些结果。一名Sarvam工程师补充:公司所有模型都是从零训练的基础模型,没有例外。

这场争议的实质,是一个在AI领域反复出现的认知误区:架构和模型是两件不同的事。

架构是蓝图,是发表在学术论文里供所有人使用的设计方案;模型是训练的产物,是数据、算力和工程决策共同生成的结果。

Sarvam借鉴了DeepSeek在Multi-head Latent Attention和Mixture of Experts上的架构设计,正如DeepSeek借鉴了Transformer,正如Transformer借鉴了注意力机制的早期论文。这是这个领域一直以来的运作方式。


五、业界争论:”套壳”还是”弯道超车”?

批评者的角度很直接:Sarvam号称”从零训练”,却大面积使用DeepSeek的开源架构,然后号称这是”印度主权AI”——这就好比你买了宜家的组装家具,自己拧了几颗螺丝,然后说这是你亲手打造的手工家具。

而且这已经是第二次了。上次是Mistral,这次是DeepSeek,下次会不会又是哪家?

支持者的角度也有道理:AI领域从来就是站在前人肩膀上。Transformer来自Google,MoE概念三十多年前就发表了,DeepSeek自己也是集大成者,凭什么印度人用了就要被骂”套壳”?

DeepSeek创始人自己也说过:开源不会导致重大损失,被跟随是一种奖励,回馈是一种荣誉。

Sarvam在2026年3月6日做了一个重要的决定:把sarvam-30b和sarvam-105b的完整模型权重在Hugging Face上彻底开源,采用极其宽松的Apache 2.0协议,连商业使用都不设障碍。

没有发布会,没有倒计时直播。就是两个文件,挂在网上。

Pratyush Kumar在X上写:”开源Sarvam 30B和105B。从零训练,所有数据、模型研究和推理优化全部在内部完成。”

关键在于”all done in-house”——全部在内部完成。不是Mistral的底座,不是借来的架构实现,是一支114人的团队,从头搭建tokenizer、自己整理数据管道、自己写强化学习基础设施,从头到尾跑完了一遍。


六、反思:叙事与现实的鸿沟

这整件事最值得深思的地方,不在于Sarvam是否”套壳”,而在于印度科技界对”主权AI”这四个字的执念与现实之间的距离。

印度有二十二种官方语言,一千多种母语。大多数全球语言模型都以外语训练为主。标准的tokenizer对梵文、泰米尔文、孟加拉文效率极低。Code-switching——在日常对话中混用印地语和英语,或者泰米尔语和英语——让只训练单语数据的模型完全摸不着头脑。

从这个角度说,印度确实需要自己的AI。这不是面子工程,是结构性需求。

Sarvam真正自研的东西是有价值的:专门为印度文字优化的tokenizer,效率提升三到四倍;对卡什米尔语、多格语、孔卡尼语等低资源语言的训练;面向印度语言优化的语音识别和语音合成系统。

这些产品没有DeepSeek的对应物。

但真正的问题在于叙事和现实之间的鸿沟。Sarvam一边说着”从零训练”,一边在架构选择上高度依赖开源社区的既有成果。这种言行不一致,才是引发舆论反噬的根本原因。

印度Aadhaar系统负责人Raghavan说过一句大实话:”否则,我们将沦为数字殖民地,在核心技术上依赖其他国家。”

这话没错。但”主权AI”的实现路径,显然不是换个架构名称就能完成的。


本文配图 华盟网

© 版权声明
THE END
喜欢就支持一下吧
点赞12 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容