ローカルとプライベート
ローカルAIとは?
ローカルAIとは、自分が管理するハードウェア上でモデルを動かすことです。プライバシーとコストの面で何が変わるのか、ハードウェアに何が求められるのか、そして実際にどこでクラウドと張り合えるのかを解説します。
すべての解説 · 最終確認日:
何が変わるか
データが本当の理由です。ホストされたモデルに送られたプロンプトは、そのプロバイダーが自らの規約の下で処理します。ローカルモデルへのプロンプトはどこにも送られません。これは他人のポリシーに依存しない、その保証の唯一の形です。
トークンごとの課金、レート制限、そしてモデルが足元から引退させられる可能性も取り除きます。ダウンロードしたモデルは動き続けます。
コストそのものではなく、コストの形
ローカルAIは自動的に安くなるわけではありません。変動費を固定費に変えます。ハードウェアを購入または借りれば、その後の推論は限界的にはほぼ無料です。
高く安定した量では良い取引ですが、たまにしか使わない場合は悪い取引です。一日の大半アイドル状態のGPUは、それが置き換えたAPI呼び出しより高くつきます。
正直な限界
一台のマシンで快適に動くモデルは、一般に入手可能な最大のモデルではありません。最も難しい推論タスクでは、ホストされたフロンティアモデルとの差は実在します。
要約、下書き、抽出、分類、日常的なコードなど、非常に多くの日常的なタスクでは、その差は思われているよりずっと小さく、プライバシーとコストの特性が能力の最後の一歩よりも重要なことがよくあります。
ハイブリッドとして最も有用
一般的なパターンはローカルのみでもクラウドのみでもありません。機密性の高いものや大量のものはローカルで、最も難しい質問はホストで、どちらがどちらかを決めるポリシーがあります。それこそがルーターの存在理由です。
よくある質問
- どんなハードウェアが必要ですか?
- モデルのサイズと量子化に完全に依存し、一つの数字を教えてくれる人は推測しているだけです。支配的な制約は利用可能なメモリです。重みが収まらなければならず、収まるものが実行できるものを決めます。
- ローカルAIは定義上プライベートですか?
- モデル呼び出しはそうです。アプリケーションの残りはそうでないかもしれません。検索、テレメトリ、その他の統合はまだ外に出る可能性があります。プライバシーは一つの構成要素ではなくシステム全体の特性です。
- ローカルモデルは私の文書を使えますか?
- はい。検索は同じように機能し、検索とモデルの両方がローカルであれば、文書はいかなる時点でもハードウェアを離れません。
読むより試してみる
ClawAIはOllamaとllama.cppを通じてローカルモデルを実行し、そのローカルのみのルーティングモードは、クラウドモデルを求めるのではなくフォールバックチェーン全体をローカルプロバイダーに保ちます。