自用AI系统的搭建全流程

首先关于装机
用的是Tesla p100改装的水冷,自己CAD做的改装盖板,四十块定做了两个,改成了水冷
当然,单卡跑大模型并不理想,所以采用了双卡
具体不必详述
以下操作均基于Windows版docker,Linux会有区别

OLLAMA_MODELS 环境变量设置模型位置

docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v D:DockerFilesopen-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

docker run -dit -v D:dragon-uiconfig:/ql/config -v D:DockerFilesdragon-uilog:/ql/log -v D:DockerFilesdragon-uidb:/ql/db -p 5700:5700 --name qinglong --hostname qinglong --restart always whyour/qinglong:latest

docker run --name one-api -d --restart always -p 4000:3000 -e TZ=Asia/Shanghai --add-host=host.docker.internal:host-gateway -v D:DockerFilesone-api:/data justsong/one-api

docker run -d -p 9095:8080 -p 50000:50000 -v "D:DockerFilesjenkinsjenkins_home":"/var/jenkins_home" -v "C:Program FilesJavajdk1.8.0_281":"/usr/local/java" -v "D:Program Filesapache-maven-3.8.4":"/usr/local/maven" --name jenkins jenkins/jenkins --add-host=host.docker.internal:host-gateway

注意,对于双卡情况,一定要修改ollama的config.json,一般在appdata下自己找
这是为了指定运算卡,否则指不定会用哪张卡来运算
{

"id": "b53b4661-93ca-4516-baba-f70a0a353378",
"first-time-run": true,
"gpu": {
    "devices": ["NVIDIA Tesla P100-PCIE-16GB", "NVIDIA GeForce GTX 1070 Ti"],
    "mode": "DFP",
    "memory_limit": [
        {"device_id": 0, "limit": 16000}, 
        {"device_id": 1, "limit": 8000} 
    ]
}

}

如果你发现模型运算很慢,那就是没用GPU运算,在用CPU运算,CPU的运算无法满足工作使用,还是要通过上面的配置来调整
当然,也要注意驱动是否安装正确,一般p100和其他N卡可以直接用娱乐大师安装好,两者一般不会冲突。
目前感觉ollama的加载和兼容还不是很完善,毕竟还是新产品,对于过大的模型并不能很好的借助内存,对显存的以来很大,
显存的大小束缚了你所能使用的模型当量。
所以如果家境富裕,三卡或者四卡或许也能考虑,再加两张24G的tesla卡
上面的配置是AI帮我写的,在我全网找遍了也没找到相关的资料后,我问了一下ollama会不会配置ollama,他给我了路径和配置文件,但是隔了几天再问他,他又答非所问了。算了,满打满算24G的脑子,要啥自行车了,日常查个资料写个代码是很富裕的,而且对于隐私保护也比较好,毕竟装在自己电脑上。


扫描二维码,在手机上阅读!

发表评论

电子邮件地址不会被公开。 必填项已用*标注