deltafin 在普通电脑上跑起 Kimi K3 ,感兴趣可以去试试
deltafin
在普通电脑上跑起 Kimi K3 这个 2.8 万亿参数的超大模型。不靠堆硬件,而是靠”按需加载”:每次推理只拉取当前 token 需要的专家模块,其余 1.45TB 的权重数据要么存本地磁盘,要么从 Hugging Face 边下边用
Github地址
https://github.com/gavamedia/deltafin
主要实现
- 本地跑通完整版 Kimi K3(2.8T 参数,92 层,每层 896 个专家),不用阉割模型
- 两种运行模式:1.7TB 全本地安装(推荐,速度稳定)或 215GB 轻量版(流式加载,首次调用慢)
- 支持 Apple Silicon(MPS/Metal 加速)、NVIDIA CUDA、x86/ARM Linux 三平台
- 内置 OpenAI 兼容 API,可直接对接 chat 客户端和编码助手
- 推理结果可复现,greedy 解码相同 prompt 输出一致
- 可选 int8 量化压缩主干网络,磁盘占用砍半,质量损失肉眼难辨
注意事项
- 只是个技术验证,不是给日常聊天用的
- M1 Max 上生成一个 token 要 14.6 秒
- 长问题等半天
- 硬盘要够大,内存越多越好
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来自 马斯克的赛博空间!
评论


