ntea.log
日々の学習アウトプットと、技術や組織についての考えを発信する技術ブログ。ゲーム理論・プログラミング・AI など。
投稿カレンダー
色が濃いほど、その日の投稿数が多いことを表します。マスにカーソルを合わせると記事が見られます。
カレンダーを表示できませんでした。
新着記事 (4 / 10)
-
Promise 入門 ── コールバック地獄から抜け出す
コールバックを重ねるほど深くなる「コールバック地獄」を、Promise はどう解消するのか。状態・チェーン・エラーハンドリングの基本を押さえる。
-
同期と非同期 ── JS がシングルスレッドでも止まらない理由
JavaScript はシングルスレッドでありながらなぜ固まらないのか。コールスタックとイベントループの仕組みから、同期・非同期の本質的な違いを整理する。
-
Ajax から fetch へ ── JavaScript 非同期通信の地図を描く
Ajax は技術名ではなくアーキテクチャパターンです。XHR から fetch、async/await まで、JavaScript 非同期通信の変遷と現代的な落とし穴を整理します。
-
LLM 評価のブレを多層的に抑える ── スコアが信頼できる数字になるまで
AI に採点させるとき、1 回の採点では誤差か実差か区別できない。繰り返し採点・G-Eval 確率加重・ペアワイズ順序反転・ブートストラップ信頼区間・BH 多重比較補正を組み合わせ、LLM 評価のブレを多層的に抑える設計を整理します。
-
3 シグナルで「リリースしてよいか」を判定する ── LLM パイプラインの最終ゲート
Stage 1/Stage 2 の品質ゲートを通過しても、それだけではリリース判断に足りない。ハルシネーション・法的配慮・品質改善の 3 シグナルを統合し、LLM を呼ばずに最終判定する上位ゲートの設計を整理します。
-
LLM 出力を AI が採点する ── 絶対評価・ペアワイズと統計的有意性
「前より良くなったか」を人手に頼らず AI に採点させるとき、一回の採点では誤差か実差か区別できない。絶対評価とペアワイズを組み合わせ、繰り返し採点で信頼区間を出す設計を整理します。
-
Stage 1 / Stage 2 二段品質ゲート ── LLM の「合格」を 2 種類に分ける
LLM 出力の品質基準には「絶対に許せない最低条件」と「以前より悪くなっていないか」の二種類がある。この二つを分離した品質ゲートを設計し、CI に組み込む方法を整理します。
-
テスト結果に「出自ハッシュ」を埋める ── LLM パイプラインの STALE 検出
先週のプロンプトで生成した結果を今日の基準で評価しても意味がない。入力とプロンプトのハッシュを結果ファイルに埋め込み「この結果は今のコードで作られたか」を機械的に判定する手法を解説します。
-
3 種の Judge で LLM 出力を立体的に検証する
LLM 出力の評価を「LLM による意味判定」「定量メトリクス」「ドメイン分類器」の三軸に分け、統一インターフェースで束ねる設計パターン。preference leakage を避けるモデル分離の話も含めて整理します。
-
テストシナリオを LLM で量産する ── カバレッジマトリクスという考え方
LLM アプリのテストケースを手書きするとすぐ頭打ちになる。入力条件の組み合わせをマトリクスで定義し、LLM にテストデータを生成させてカバレッジを体系的に管理する方法を整理します。
-
LLM の出力に「ゴールデンデータ」で回帰テストを仕込む
LLM の出力は非決定的でユニットテストが刺さらない。承認済み出力を「ゴールデンデータ」として git 管理し、プロンプト変更による意図しない出力変化を検出する設計パターンを方法論として整理します。
-
プロンプトは書くな、最適化させろ――DSPy/GEPA で何が変わるか
手動プロンプトエンジニアリングの試行錯誤をアルゴリズムに委ねる――DSPy と GEPA が示す自動プロンプト最適化の実力と、その先に変わるエンジニアの役割を整理します。
人気記事
マガジン
セットで読む記事リスト
-
AWS
1 記事
AWS を使ったインフラ構築・運用の記事まとめ
-
アジャイル
1 記事
アジャイル開発の考え方・実践に関する記事まとめ
-
AIコーディング時代のエンジニア
3 記事
AI が当たり前になった時代に、エンジニアは何を磨くべきか。空洞化への守り、深さで戦う攻め、AI との分業設計まで、考え方を一筋でたどる連作。
-
日々是考察
6 記事
一日一テーマ、本日の経営者・概念・言葉を一つ取り上げて短く考察する連載。人物も理論も、その日の一考として読み解く。
-
本日のAIニュース
2 記事
その日に目を引いた AI のニュースを一つ取り上げ、何が起きたか・なぜ重要かを短く整理する連載。
-
Claude Code 解剖
8 記事
claude コマンドの実体から、システムプロンプトの作り・1ターンの処理フロー・会話ログ・安全機構まで。手元のバイナリと ~/.claude を実際にのぞいて、Claude Code の中身を一筋に解き明かす連作。
-
graphify でコードを読む
4 記事
ナレッジグラフの概念から、graphify によるコードベース解析の仕組みまで。AI コーディングアシスタントの文脈理解をグラフで拡張する連作。
-
Claude Code スキル探訪
6 記事
Claude Code のスキル(SKILL.md)を公式・コミュニティの両面から読み解く。書き方の流派から設計指針、セッション学習まで。
-
Claude API 基礎
11 記事
Claude API の仕様を開発者目線で整理する。思考モード・ツール使用・コンテキスト管理・実行方式まで、よくある疑問に答える実践的な記事集。
-
LLM アプリの品質保証
8 記事
非決定的な LLM 出力をどうテストするか。ゴールデンデータ・プロビナンス追跡・品質ゲート・Judge 設計など、実装に根ざした品質保証パターンを一筋で整理する連作。
-
言語の世代交代
7 記事
PHP・Python・TypeScript・Rust はなぜ似た機能を揃って取り込んだのか。null・失敗・不変性・パターンマッチという共通の軸で言語を横断し、旧世代から現代への変化を読み解く連作。