DeepSeek据报采用更多华为等国产芯片训练模型 梁文锋称是最大押注、但必须成功
据美媒《The Information》引述消息报道,中国AI初创公司DeepSeek创办人梁文锋在一场闭门投资者会议上透露,希望采用更多国产芯片训练模型,并预计华为最快第四季或明年首季可交付新一批AI芯片作训练。
相信华为有望追上Nvidia
报道指出,梁文锋向投资者表示采用华为或其他国产处理器训练模型,是DeepSeek“最大的押注之一”,但强调这项工作“必须成功”。他相信,华为芯片仅需数年时间便有望追上Nvidia的水平,因此决定率先适配Nvidia垄断体系以外的硬件。
正训练一款2万亿参数模型
梁文锋又透露,DeepSeek目前正训练一款2万亿参数模型,规模已超过V4旗舰模型的1.4万亿参数,另计画训练一款8万亿参数模型。
对于有关2万亿参数的模型,市场预期为即将发布的DeepSeek V4.1 Pro,并可能于10月中旬至下旬发布。据内媒报道,训练2万亿参数大模型需要50万至60万亿词元(Token),按照目前显卡算力估算,Nvidia H100/H200芯片需要3万张,B200则需要1.5万张;若采用华为升腾910C,需要6万张,采用升腾950系列则需3万张,与H200所需数量相当。
---------------------------------------------
>>>星岛网WhatsApp爆料热线(416)6775679,爆料一经录用,薄酬致意。
>>>立即浏览【生活百答】栏目:新移民抵埗攻略,老华侨也未必知道的事,移民、工作、居住、食玩买、交通、报税、银行、福利、生育、教育。
>>>星岛网WhatsApp爆料热线(416)6775679,爆料一经录用,薄酬致意。
>>>立即浏览【生活百答】栏目:新移民抵埗攻略,老华侨也未必知道的事,移民、工作、居住、食玩买、交通、报税、银行、福利、生育、教育。
