Dev
技術・実装・AI システム
技術・実装・AI システム
93 件の記事 · 4 / 8 ページ
-
Stage 1 / Stage 2 二段品質ゲート ── LLM の「合格」を 2 種類に分ける
LLM 出力の品質基準には「絶対に許せない最低条件」と「以前より悪くなっていないか」の二種類がある。この二つを分離した品質ゲートを設計し、CI に組み込む方法を整理します。
-
テスト結果に「出自ハッシュ」を埋める ── LLM パイプラインの STALE 検出
先週のプロンプトで生成した結果を今日の基準で評価しても意味がない。入力とプロンプトのハッシュを結果ファイルに埋め込み「この結果は今のコードで作られたか」を機械的に判定する手法を解説します。
-
3 種の Judge で LLM 出力を立体的に検証する
LLM 出力の評価を「LLM による意味判定」「定量メトリクス」「ドメイン分類器」の三軸に分け、統一インターフェースで束ねる設計パターン。preference leakage を避けるモデル分離の話も含めて整理します。
-
テストシナリオを LLM で量産する ── カバレッジマトリクスという考え方
LLM アプリのテストケースを手書きするとすぐ頭打ちになる。入力条件の組み合わせをマトリクスで定義し、LLM にテストデータを生成させてカバレッジを体系的に管理する方法を整理します。
-
LLM の出力に「ゴールデンデータ」で回帰テストを仕込む
LLM の出力は非決定的でユニットテストが刺さらない。承認済み出力を「ゴールデンデータ」として git 管理し、プロンプト変更による意図しない出力変化を検出する設計パターンを方法論として整理します。
-
プロンプトは書くな、最適化させろ――DSPy/GEPA で何が変わるか
手動プロンプトエンジニアリングの試行錯誤をアルゴリズムに委ねる――DSPy と GEPA が示す自動プロンプト最適化の実力と、その先に変わるエンジニアの役割を整理します。
-
TextGradとDSPyの違いを一言で言うと
どちらも「プロンプトを自動で改善する」ツールだが、その思想はまったく異なる。TextGradは損失を言語で逆伝播させ、DSPyはプロンプトをコンパイルする。
-
SKILL.md はクロスツール標準だった——Agent Skills と 32 ツールへの広がり
Anthropic が 2025 年 12 月に公開した Agent Skills 標準により、SKILL.md は Claude Code 専用フォーマットを超え、Codex CLI・Gemini CLI・Cursor など 32 以上のツールで動く共通仕様になっています。
-
Agent Skills と MCP の違い
MCP はツール接続(外部サービスへのアクセス手段)、Agent Skills はエージェントへの知識・ワークフロー・専門手順の付与です。目的が根本的に異なります。
-
Claude Code で会社を経営する
エンジニアが「80% を Claude に書かせている」という段階を超え、Claude Code は組織そのものを動かすインフラになりつつあります——Managed Agents の登場で何が変わったかを整理します。
-
Claude Code をセッションから学習させる——continuous-learning スキルの仕組み
コミュニティ製スキル continuous-learning は、セッションで発生した修正・成功パターンを信頼スコア付きで蓄積し CLAUDE.md に書き戻すことで、Claude の振る舞いをフィードバックループで継続改善します。
-
クライアントツール vs サーバーツール
クライアントツールはユーザーが定義・実行しエージェントループが必要です。サーバーツールは Anthropic が実行するためループ不要で結果を直接受け取れます。