本地与私有
什么是本地 AI?
本地 AI 是指在你自己掌控的硬件上运行模型,而不是调用云端服务。这篇文章说明这在隐私和成本上具体改变了什么、对硬件提出了什么要求,以及它真正能在哪些场景下与云端竞争。
全部文章 · 最近核实:
什么改变了
数据才是真正的原因。发给托管模型的提示词,由该供应商按照自己的条款处理。发给本地模型的提示词哪儿都不会去——这是这份保证唯一不依赖于他人政策的版本。
它还消除了按 token 计费、速率限制,以及模型可能在你毫无察觉的情况下被下线的可能性。你下载的模型会一直可用。
成本的形态,而不是成本本身
本地 AI 不会自动更便宜。它把变动成本转变为固定成本:你购买或租用硬件,此后推理在边际上几乎是免费的。
这在高且稳定的用量下是笔好买卖,对偶尔使用来说则不划算。一块大部分时间都闲置的 GPU,比它替代的那些 API 调用更贵。
老实说的局限
能在单台机器上舒适运行的模型,通常不是可用的最大模型。在最难的推理任务上,与托管的前沿模型之间的差距是真实存在的。
而对于大量的日常任务——总结、起草、提取、分类、常规代码——这个差距比人们想象的要小得多,隐私和成本方面的特性往往比能力上的最后一点提升更重要。
混合使用最有价值
常见的模式既不是纯本地,也不是纯云端。而是敏感或高量的用本地,最难的问题用托管,再加一套策略来判断哪个是哪个——这正是路由器的用武之地。
常见问题
- 我需要什么硬件?
- 这完全取决于模型大小和量化方式,任何给你一个单一数字的人都是在猜。主导性的限制是可用内存:权重必须装得下,能装下什么决定了你能运行什么。
- 本地 AI 是不是天然就是私密的?
- 模型调用是私密的。应用程序的其余部分可能不是:搜索、遥测和其他集成仍然可能对外发送数据。隐私是整个系统的属性,而不是某一个组件的属性。
- 本地模型能用我的文档吗?
- 能。检索的运作方式相同,当检索和模型都是本地的,文档在任何时刻都不会离开你的硬件。
与其阅读,不如亲自试试
ClawAI 通过 Ollama 和 llama.cpp 运行本地模型,其仅本地路由模式把整条回退链都保持在本地供应商上,而不是去寻找云模型。