Tag
LLM
42 件の記事 · 2 / 4 ページ
-
テストシナリオを LLM で量産する ── カバレッジマトリクスという考え方
LLM アプリのテストケースを手書きするとすぐ頭打ちになる。入力条件の組み合わせをマトリクスで定義し、LLM にテストデータを生成させてカバレッジを体系的に管理する方法を整理します。
-
LLM の出力に「ゴールデンデータ」で回帰テストを仕込む
LLM の出力は非決定的でユニットテストが刺さらない。承認済み出力を「ゴールデンデータ」として git 管理し、プロンプト変更による意図しない出力変化を検出する設計パターンを方法論として整理します。
-
プロンプトは書くな、最適化させろ――DSPy/GEPA で何が変わるか
手動プロンプトエンジニアリングの試行錯誤をアルゴリズムに委ねる――DSPy と GEPA が示す自動プロンプト最適化の実力と、その先に変わるエンジニアの役割を整理します。
-
TextGradとDSPyの違いを一言で言うと
どちらも「プロンプトを自動で改善する」ツールだが、その思想はまったく異なる。TextGradは損失を言語で逆伝播させ、DSPyはプロンプトをコンパイルする。
-
Agent Skills と MCP の違い
MCP はツール接続(外部サービスへのアクセス手段)、Agent Skills はエージェントへの知識・ワークフロー・専門手順の付与です。目的が根本的に異なります。
-
クライアントツール vs サーバーツール
クライアントツールはユーザーが定義・実行しエージェントループが必要です。サーバーツールは Anthropic が実行するためループ不要で結果を直接受け取れます。
-
長いエージェントループのためのコンテキスト管理術
コンテキストウィンドウは有限リソースです。Compaction・Context Editing・思考ブロック管理の3つのアプローチを整理します。
-
effort と budget_tokens の違い
budget_tokens は思考トークンの上限を数値で指定します。effort は思考・テキスト出力・ツール呼び出し回数すべてに影響するレベル指定です。2つは別の概念です。
-
バッチ・ストリーミング・高速モードの選び方
同期・ストリーミング・バッチ・高速モードのどれを使うかは、レイテンシ要件とコスト優先度で決まります。それぞれの特性と使い分けを整理します。
-
extended thinking と adaptive thinking の違い
「拡張思考を有効にする」と「適応型思考を有効にする」は別の概念です。モデルごとの対応状況と使い分けを整理します。
-
LLM でデータセットを作る際の落とし穴とマトリクス設計
LLM による合成データ生成には世代崩壊やバイアス増幅といった構造的な落とし穴がある——その根本には Chat 形式の連続生成という設計ミスがあり、マトリクス×ステートレス単一 API 呼び出しに切り替えることで解決できます。
-
OOD(分布外データ)とは何か ── LLM で合成 OOD プロキシを生成して未知データに備える
訓練データの分布外にあるデータ——OOD——にモデルは高い確信度で誤る。ラベル付き OOD が手に入らないという根本問題に対し、LLM で合成プロキシを生成する最新アプローチと、その落とし穴を整理します。