ntea.log
日々の学習アウトプットと、技術や組織についての考えを発信する技術ブログ。ゲーム理論・プログラミング・AI など。
投稿カレンダー
色が濃いほど、その日の投稿数が多いことを表します。マスにカーソルを合わせると記事が見られます。
カレンダーを表示できませんでした。
新着記事 (3 / 8)
-
テストシナリオを LLM で量産する ── カバレッジマトリクスという考え方
LLM アプリのテストケースを手書きするとすぐ頭打ちになる。入力条件の組み合わせをマトリクスで定義し、LLM にテストデータを生成させてカバレッジを体系的に管理する方法を整理します。
-
LLM の出力に「ゴールデンデータ」で回帰テストを仕込む
LLM の出力は非決定的でユニットテストが刺さらない。承認済み出力を「ゴールデンデータ」として git 管理し、プロンプト変更による意図しない出力変化を検出する設計パターンを方法論として整理します。
-
プロンプトは書くな、最適化させろ――DSPy/GEPA で何が変わるか
手動プロンプトエンジニアリングの試行錯誤をアルゴリズムに委ねる――DSPy と GEPA が示す自動プロンプト最適化の実力と、その先に変わるエンジニアの役割を整理します。
-
TextGradとDSPyの違いを一言で言うと
どちらも「プロンプトを自動で改善する」ツールだが、その思想はまったく異なる。TextGradは損失を言語で逆伝播させ、DSPyはプロンプトをコンパイルする。
-
SKILL.md はクロスツール標準だった——Agent Skills と 32 ツールへの広がり
Anthropic が 2025 年 12 月に公開した Agent Skills 標準により、SKILL.md は Claude Code 専用フォーマットを超え、Codex CLI・Gemini CLI・Cursor など 32 以上のツールで動く共通仕様になっています。
-
Agent Skills と MCP の違い
MCP はツール接続(外部サービスへのアクセス手段)、Agent Skills はエージェントへの知識・ワークフロー・専門手順の付与です。目的が根本的に異なります。
-
Claude Code で会社を経営する
エンジニアが「80% を Claude に書かせている」という段階を超え、Claude Code は組織そのものを動かすインフラになりつつあります——Managed Agents の登場で何が変わったかを整理します。
-
Claude Code をセッションから学習させる——continuous-learning スキルの仕組み
コミュニティ製スキル continuous-learning は、セッションで発生した修正・成功パターンを信頼スコア付きで蓄積し CLAUDE.md に書き戻すことで、Claude の振る舞いをフィードバックループで継続改善します。
-
クライアントツール vs サーバーツール
クライアントツールはユーザーが定義・実行しエージェントループが必要です。サーバーツールは Anthropic が実行するためループ不要で結果を直接受け取れます。
-
長いエージェントループのためのコンテキスト管理術
コンテキストウィンドウは有限リソースです。Compaction・Context Editing・思考ブロック管理の3つのアプローチを整理します。
-
effort と budget_tokens の違い
budget_tokens は思考トークンの上限を数値で指定します。effort は思考・テキスト出力・ツール呼び出し回数すべてに影響するレベル指定です。2つは別の概念です。
-
バッチ・ストリーミング・高速モードの選び方
同期・ストリーミング・バッチ・高速モードのどれを使うかは、レイテンシ要件とコスト優先度で決まります。それぞれの特性と使い分けを整理します。
人気記事
マガジン
セットで読む記事リスト
-
AWS
1 記事
AWS を使ったインフラ構築・運用の記事まとめ
-
アジャイル
1 記事
アジャイル開発の考え方・実践に関する記事まとめ
-
AIコーディング時代のエンジニア
3 記事
AI が当たり前になった時代に、エンジニアは何を磨くべきか。空洞化への守り、深さで戦う攻め、AI との分業設計まで、考え方を一筋でたどる連作。
-
日々是考察
6 記事
一日一テーマ、本日の経営者・概念・言葉を一つ取り上げて短く考察する連載。人物も理論も、その日の一考として読み解く。
-
本日のAIニュース
2 記事
その日に目を引いた AI のニュースを一つ取り上げ、何が起きたか・なぜ重要かを短く整理する連載。
-
Claude Code 解剖
8 記事
claude コマンドの実体から、システムプロンプトの作り・1ターンの処理フロー・会話ログ・安全機構まで。手元のバイナリと ~/.claude を実際にのぞいて、Claude Code の中身を一筋に解き明かす連作。
-
graphify でコードを読む
4 記事
ナレッジグラフの概念から、graphify によるコードベース解析の仕組みまで。AI コーディングアシスタントの文脈理解をグラフで拡張する連作。
-
Claude Code スキル探訪
6 記事
Claude Code のスキル(SKILL.md)を公式・コミュニティの両面から読み解く。書き方の流派から設計指針、セッション学習まで。
-
Claude API 基礎
11 記事
Claude API の仕様を開発者目線で整理する。思考モード・ツール使用・コンテキスト管理・実行方式まで、よくある疑問に答える実践的な記事集。
-
LLM アプリの品質保証
8 記事
非決定的な LLM 出力をどうテストするか。ゴールデンデータ・プロビナンス追跡・品質ゲート・Judge 設計など、実装に根ざした品質保証パターンを一筋で整理する連作。