Category
AI
機械学習・LLM など
55 件の記事 · 2 / 5 ページ
-
LLM の出力に「ゴールデンデータ」で回帰テストを仕込む
LLM の出力は非決定的でユニットテストが刺さらない。承認済み出力を「ゴールデンデータ」として git 管理し、プロンプト変更による意図しない出力変化を検出する設計パターンを方法論として整理します。
-
プロンプトは書くな、最適化させろ――DSPy/GEPA で何が変わるか
手動プロンプトエンジニアリングの試行錯誤をアルゴリズムに委ねる――DSPy と GEPA が示す自動プロンプト最適化の実力と、その先に変わるエンジニアの役割を整理します。
-
TextGradとDSPyの違いを一言で言うと
どちらも「プロンプトを自動で改善する」ツールだが、その思想はまったく異なる。TextGradは損失を言語で逆伝播させ、DSPyはプロンプトをコンパイルする。
-
SKILL.md はクロスツール標準だった——Agent Skills と 32 ツールへの広がり
Anthropic が 2025 年 12 月に公開した Agent Skills 標準により、SKILL.md は Claude Code 専用フォーマットを超え、Codex CLI・Gemini CLI・Cursor など 32 以上のツールで動く共通仕様になっています。
-
Agent Skills と MCP の違い
MCP はツール接続(外部サービスへのアクセス手段)、Agent Skills はエージェントへの知識・ワークフロー・専門手順の付与です。目的が根本的に異なります。
-
Claude Code で会社を経営する
エンジニアが「80% を Claude に書かせている」という段階を超え、Claude Code は組織そのものを動かすインフラになりつつあります——Managed Agents の登場で何が変わったかを整理します。
-
Claude Code をセッションから学習させる——continuous-learning スキルの仕組み
コミュニティ製スキル continuous-learning は、セッションで発生した修正・成功パターンを信頼スコア付きで蓄積し CLAUDE.md に書き戻すことで、Claude の振る舞いをフィードバックループで継続改善します。
-
クライアントツール vs サーバーツール
クライアントツールはユーザーが定義・実行しエージェントループが必要です。サーバーツールは Anthropic が実行するためループ不要で結果を直接受け取れます。
-
長いエージェントループのためのコンテキスト管理術
コンテキストウィンドウは有限リソースです。Compaction・Context Editing・思考ブロック管理の3つのアプローチを整理します。
-
effort と budget_tokens の違い
budget_tokens は思考トークンの上限を数値で指定します。effort は思考・テキスト出力・ツール呼び出し回数すべてに影響するレベル指定です。2つは別の概念です。
-
バッチ・ストリーミング・高速モードの選び方
同期・ストリーミング・バッチ・高速モードのどれを使うかは、レイテンシ要件とコスト優先度で決まります。それぞれの特性と使い分けを整理します。
-
extended thinking と adaptive thinking の違い
「拡張思考を有効にする」と「適応型思考を有効にする」は別の概念です。モデルごとの対応状況と使い分けを整理します。