返回

第333章 挖人

首页
关灯
护眼
字:
大
中
小
上一章 回目录 下一页 进书架
最新网址:wap.wangshugu.info
    第二天上午。

    棕榈滩国际机场。

    按照原定安排,陈默和陆静怡将从这里直接返回香港。

    车队刚刚驶进机场,陈默便接到了伊利亚的电话。

    “陈,你还没有离开美国吧?”

    “正在机场。”

    “先别走。”

    伊利亚的声音沙哑。

    陈默看了一眼时间。

    “出什么事了?”

    “下一代语言模型的第一次扩大训练失败了。”

    “模型结构有问题?”

    “不是模型。”

    电话另一端传来键盘敲击声。

    “昨天晚上,我们按照原方案将训练规模扩大到五百一十二张GPU。”

    “单机测试正常,接入的机器越多,训练效率反而越低。”

    “显存里堆满重复数据,大量GPU都在等待其他节点完成计算,机器之间传输参数的时间,甚至超过了真正用于训练的时间。”

    伊利亚停顿片刻。

    “最后系统在第七个小时失去同步,训练结果全部作废。”

    陈默没有立即说话。

    一台机器工作很快,不代表将几百台机器放在一起,速度便能增加几百倍。

    模型需要被拆分到不同GPU上。

    每一块GPU计算完自己的部分,还要与其他节点交换结果。

    数据如何分配。

    显存如何利用。

    什么时候通信。

    任何一个环节出现堵塞,价值数百万美元的GPU集群都会陷入等待。

    纸面算力再大,也无法转化成真正的训练能力。

    “现在的利用率多少?”

    “平均百分之三十二。”

    伊利亚回答。

    “最差的时候不到百分之二十。”

    OpenAI目前拥有两千多张GPU。

    如果始终保持这种效率,真正发挥作用的算力甚至不到账面规模的一半。

    未来将集群扩大四倍,问题只会更加严重。

    

第333章 挖人-->>(第1/3页),请点击下一页继续阅读。
最新网址:wap.wangshugu.info
上一章 回目录 下一页 存书签