在树莓派5上本地跑大模型Hailo AI

来源:程序员写个解发布时间:2026-07-29 14:17
AI
大模型
生成海报
树莓派5配上AI HAT+ 2,确实能做成一个纯本地的大模型机子,这一点本身就挺厉害的。

总所周知,在本地跑大语言模型,那可老费劲了,得有个耗电巨多的桌面显卡,还得有耐心等半天。现在有了树莓派5,还有树莓派AI HAT+ 2(Hailo-10H),门槛一下就低多啦。你自己就能装一个小巧、省电的机子,完全在桌子上跑大模型推理——我自己就是直接放电视柜上用的,没啥问题。

这篇教程就是一步步教你,在树莓派5上装一个纯本地的LLM环境,用的是Ubuntu Server 24.04、树莓派AI HAT+ 2、Hailo兼容Ollama的运行时,还有OpenWebUI。等你全部装完,开机就自动跑服务,浏览器打开就能聊天,所有东西全靠本地硬件跑,不用连外面的服务器。

咱们做这个不是为了跟数据中心显卡比速度,真比不过。主要就是做一个能用、隐私好、一直开机的AI节点,你自己完全控制。可以接到家里自动化、自己写代码用、或者断网玩,不用依赖外面的东西。

最后装好的架构大概是这样的:

浏览器  ↓OpenWebUI (系统服务,端口8080)  ↓hailo-ollama (系统服务,端口8000)  ↓/dev/hailo0  ↓Hailo-10H硬件加速卡

说白了就是尽量用原生的东西,装完就一直能用,不用Docker,重启也不用手动开,东西越少越稳定。

从“自己从零瞎装”到“装完能稳定用”

最开始我想法很简单:就在树莓派5上装Ubuntu,配上AI HAT+ 2,只用Linux原生的东西跑本地大模型。

然后我就跟大多数人一样,啥都自己手动装。

自己编译Hailo内核驱动、自己编译运行库、一点点把整套东西拼起来。理论上这样能自己完全控制,实际上呢,简直就是天天修bug。内核模块特别娇气,编译器版本不对、头文件不匹配、内核更一下就炸。修好一个问题,下一个马上来。就算设备正常显示成 /dev/hailo0 了,用户层运行时还得跟硬件版本完全对得上。有些版本能找到设备,但是连不上;有些干脆就没打包Ubuntu版本,装都装不上。

弄到最后,问题根本不是“能不能跑”,明明就能跑。

真正的问题是“装完能不能一直用”。

后来我不自己瞎编译了,改用树莓派官方软件源装Hailo驱动和运行库。一开始我还觉得有点妥协,毕竟系统是Ubuntu。但只装Hailo相关的包,兼容性一点问题都没有,差别一下就看出来了:

  • 内核模块直接加载成功
  • 运行时跟硬件完美匹配
  • 模型直接就能初始化
  • 重启好几次推理服务都稳稳的

自己编译是自由,但是用官方维护的包就是稳定。这个项目里稳定最重要,就这么从一个随便玩玩的实验,变成了能一直开机用的本地AI节点。

下面我就一步一步把安装过程说一下,跟着做就行。

注意!写这篇文章的时候,树莓派官方给AI HAT+ 2写的LLM教程用的是 5.1.1版本 的Hailo GenAI模型包。我这里也用的这个版本,跟官方文档保持一致。再说了,5.2.0版本官方源里也没有,想用也用不了。

第一步:安装Hailo内核驱动

第一步先把内核层面的东西装好,这样Ubuntu才能正常跟加速卡通信。需要的Hailo包在树莓派软件源里有,我就把源加进去,再设置一下,只从这里拉Hailo相关的包:

curl -fsSL https://archive.raspberrypi.com/debian/raspberrypi.gpg.key \

然后建一个APT优先级文件,别让Ubuntu把别的无关的包也从树莓派源更新:

nano /etc/apt/preferences.d/raspberrypi-pinPackage: *Pin: origin archive.raspberrypi.comPin-Priority: 1Package: h10-hailort-pcie-driver hailort hailort-* libhailort* hailo*Pin: origin archive.raspberrypi.comPin-Priority: 1001

弄好之后,安装内核驱动和对应的内核头文件:

sudo apt updatesudo apt install h10-hailort-pcie-driver linux-headers-$(uname -r)

检查一下系统能不能看到Hailo设备,运行下面命令:

ls -l /dev/hailo*crw-rw-rw- 1 root root 234, 0 Feb 24 23:00 /dev/hailo0

只要出现 /dev/hailo0,内核这边就没问题了,这一步就算过了。

第二步:安装Hailo运行时

驱动装好、设备能识别之后,下一步就是装Hailo运行时。这个东西就是让应用程序能正常跟加速卡通信用的。直接装Hailo-10H运行时:

sudo apt install h10-hailort

然后验证一下运行时能不能跟硬件通信:

hailortcli fw-control identify

正常输出大概长这样:

Firmware Version: 5.1.1Device Architecture: HAILO10H

这一步很关键,到这里说明Linux不光找到硬件,还能正常通信了,不是只亮个灯而已。

第三步:安装Hailo Ollama运行时

底层东西都跑起来之后,下一步就是推理层。这套环境里用的是 hailo-ollama,它会提供一个跟Ollama兼容的API服务。先装模型包:

https://dev-public.hailo.ai/2025_12/Hailo10/hailo_gen_ai_model_zoo_5.1.1_arm64.deb

装完之后验证API能不能正常响应:

curl http://localhost:8000/hailo/v1/list

一切正常的话,会返回一段JSON,里面列着可用的模型:

{"models":[...]}

到这里,后端推理服务就已经装好能用了。

第四步:安装并配置 OpenWebUI

前端我想要个简单的网页界面,又不想用容器,就直接把OpenWebUI装在独立的Python虚拟环境里,干净又省事。先建一个专用的系统用户:

sudo useradd -r -m -d /opt/openwebui -s /usr/sbin/nologin openwebui

然后切到这个用户,在虚拟环境里装OpenWebUI:

sudo -u openwebui bashcd /opt/openwebuipython3 -m venv venvsource venv/bin/activatepip install open-webuiexit

把OpenWebUI放在独立用户下面,后面管理起来方便很多,也不乱。

接下来给OpenWebUI建一个环境变量文件:

nano /opt/openwebui/envOLLAMA_BASE_URL=http://localhost:8000WEBUI_AUTH=False

这里最重要的就是 OLLAMA_BASE_URL=http://localhost:8000,就是告诉OpenWebUI去连本地的 hailo-ollama 服务。

第五步:给Hailo Ollama建系统服务

推理服务也要开机自动跑,建一个systemd服务:

nano /etc/systemd/system/hailo-ollama.service[Unit]Description=Hailo Ollama ServiceAfter=network.target[Service]Type=simpleExecStart=/usr/bin/hailo-ollama serveRestart=always[Install]WantedBy=multi-user.target

启用并启动服务:

sudo systemctl daemon-reloadsudo systemctl enable hailo-ollamasudo systemctl start hailo-ollama

第六步:给OpenWebUI 建系统服务

让网页界面重启也能用,再建一个systemd服务:

nano /etc/systemd/system/openwebui.service[Unit]Description=OpenWebUI ServiceAfter=network.target hailo-ollama.serviceWants=hailo-ollama.service[Service]Type=simpleWorkingDirectory=/opt/openwebuiEnvironmentFile=/opt/openwebui/envExecStart=/opt/openwebui/venv/bin/open-webui serve --host 0.0.0.0 --port 8080Restart=alwaysRestartSec=3[Install]WantedBy=multi-user.target

重新加载systemd、启用并启动服务:

sudo systemctl daemon-reloadsudo systemctl enable openwebuisudo systemctl start openwebui

两个服务都设为开机自启之后,重启机器整套本地大模型环境就自动全跑起来,不用你管。

第七步:访问网页界面

最后,两个服务都跑起来之后,打开浏览器访问下面地址:

http://<树莓派IP>:8080

只要后端能连上,模型会自动出现在OpenWebUI里,直接就能用了。

最后随便说几句

树莓派5配上AI HAT+ 2,确实能做成一个纯本地的大模型机子,这一点本身就挺厉害的。但是想装好,还是得一点点耐心配,不是插上就能用那种。整套环境稳定之后,小巧、安静、不用连外网,都挺好的。就是性能还是有限,生成文字慢,能跑的模型也不多。所以别指望它能直接代替ChatGPT,还差得远呢。

更大的问题还是软件支持,尤其是不用树莓派官方系统的时候。树莓派2026年1月才出的AI HAT+ 2,官方文档还停留在5.1.1版本,Hailo自己都已经支持5.2.0了。一个主打本地AI的产品,更新这么慢真的说不过去。还有一些模型直接被换掉了,比如Llama-3.2–3B-Instruct。倒也不是不能用,就是感觉整个平台还不成熟,买之前得想清楚,除非你就喜欢折腾这种半成品。

喜欢折腾的玩家玩玩还行,真想要一个开箱即用、稳定的本地大模型平台,这个目前还真达不到那个水平。

本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。

评论
暂无用户评论