LLM開発・技術

LLM開発・技術

Jevとは|文章を書かない判断モデルの仕組み・料金と、日本語で使う前に見る制約

TypeSafe AI の Jev は文章を生成せず型付きの判断と確率だけを返す。三つの質問型・料金とレート制限・公式が挙げる苦手分野・日本語での扱いを一次ソースから整理する。
LLM開発・技術

Ollama の Web 検索を使う|APIキーとクラウド経由の仕組み、必要なコンテキスト長

Ollama の Web 検索の使い方。モデルはローカルのままでも検索クエリは ollama.com へ出るので API キーが要る。REST・公式ライブラリ・MCP の3経路の違いと、必要なコンテキスト長が公式の2ページで食い違う点、JavaScript 側の既知の不整合をまとめた。
AI×コーディング

ローカルLLMをコーディングエージェントに繋ぐ|OpenCode × Ollama の設定とモデル選び

OpenCode に Ollama のローカルLLMを繋ぐ設定と、繋いだのにツール呼び出しが動かないときに見るコンテキスト長、tools 対応・コンテキスト上限・サイズの3条件でモデルを絞る手順を、2026年9月時点の公式ドキュメントの記述で整理した。
AI×コーディング

LLMのトークンコストを抑えるモデルルーティング|利用量の可視化と使い分けの基準

LLMのトークンコストをモデルルーティングで抑える手順を、利用量の可視化・単価差の確認・呼び出し削減・振り分けの4段で整理。Bedrock / Microsoft Foundry / OpenRouter / LiteLLM の4方式を、判定側の課金や日本語対応まで含めて比較します。
AIエージェント

OpenJarvisでローカルAIアシスタントを作る完全手順

OpenJarvisとは、ローカル環境で動く個人用AIエージェントを構築するためのフレームワークである。OpenJarvisはこの壁を逆向きに解く設計で、推論そのものを自分のPC上のモデルで回し、必要なときだけ外部に出る形を既定にしています。
AI×自動化

LLMの構造化出力を安定させる実装

構造化出力とは、LLMの応答をJSONなど決まった形式に固定して受け取る仕組み。型崩れを構文崩れとスキーマ不一致に分け、OpenAI・Gemini・Claudeのネイティブ機能とInstructorによる検証・リトライの二層で安定させる実装を整理する。
LLM開発・技術

LoRAとQLoRAでLLMをファインチューニングする実践手順|PEFT・TRLで単一GPU学習

LoRAとQLoRAで公開モデルを単一GPUにファインチューニングする手順を、PEFT・TRLの現行APIで解説。メモリが減る仕組み、LoraConfigの選び方、QLoRA特有の落とし穴、学習後のデプロイまでを一気通貫でまとめます。
AI×コーディング

LLM APIのプロンプトキャッシュでコストを削る|割高になりやすい設定と最適化のコツ

プロンプトキャッシュはAnthropicやGPT-5.6以降のOpenAIでは書込が通常入力より割高になり、入れれば必ず安くなるとは限らない。可変データが先頭だと割引が効かず書込だけ増える。固定を前・可変を後ろに並べ、usageで読出/書込を実測し採算を確かめるコツを、現行の公式仕様で整理する。
LLM開発・技術

三値(BitNet系)に量子化したテキスト埋め込みモデルとは|ローカルRAGの保存量と推論を同時に削る

Microsoftが公開したBitNet系の三値量子化テキスト埋め込みモデル「BITEMBED」を、論文の実測値とHugging Faceの配布物から整理。英語MMTEBでの精度、CPUでの処理速度、出力ビット幅による保存トレードオフ、ローカルRAGでの向き不向きと現時点の注意点までまとめた。
AI×ライティング

プロンプトを自動最適化してLLMの精度を上げる|Claude Code駆動FAPOが失敗ステップを特定

FAPOとは、LLMパイプラインを評価し失敗ステップを特定して、プロンプト・パラメータ・チェーン構造まで自動改善するCisco製の仕組み。多段パイプラインでどのステップが原因か追えないときの選択肢を、対GEPA評価とともに解説する。