ローカルLLM

LLM開発・技術

三値(BitNet系)に量子化したテキスト埋め込みモデルとは|ローカルRAGの保存量と推論を同時に削る

Microsoftが公開したBitNet系の三値量子化テキスト埋め込みモデル「BITEMBED」を、論文の実測値とHugging Faceの配布物から整理。英語MMTEBでの精度、CPUでの処理速度、出力ビット幅による保存トレードオフ、ローカルRAGでの向き不向きと現時点の注意点までまとめた。
AI×コーディング

Cline でローカル LLM を動かして無料・オフラインで AI コーディングする(Ollama 連携)

Clineとは、VS Code 上で動く自律型の AI コーディング支援エージェントである。API キーの料金も、月額のサブスクも払わずに AI コーディングを動かす方法があります。Cline と Ollama を組み合わせるやり方です。Cline がクラウドの API ではなく、自分の PC の中で動くモデルを呼び…
LLM開発・技術

Ollama をローカル API サーバーにして社内アプリから LLM を呼ぶ

社内データを ChatGPT に貼り付けるわけにはいかない、でも LLM の処理能力は業務に使いたい——この板挟みを解く現実的な答えが、ローカル LLM の API サーバー化です。Ollama とは、ローカルでLLMを動かしREST APIで呼べる実行環境である。クラウドの API に頼らず、自分の PC やサーバ…
LLM開発・技術

Open WebUI で Ollama に Web UI を足して、チームでローカル LLM を使う

Open WebUIとは、Ollamaなどのローカルツールにブラウザ画面を足すオープンソースのWeb UIである。ターミナルで ollama run と打つたびに、社内の非エンジニアの手が止まる。コマンドを覚えてもらうわけにもいかず、結局ローカル LLM を触れるのは一部の技術者だけ——この状態のまま「チームで使おう…
AI×自動化

AI自動化のコスト構造と採算の見方 ─ 運用キャッシュ収支を3つの物差しで判断する

AI自動化のコストをAPI・GPU電気代・サーバ・データの4つに分解し、運用キャッシュ収支と出力単位運用差益、撤退ラインで採算を判断する手順を整理。Prompt CachingとBatch APIで単価を下げる考え方まで解説します。