Tag
Python
14 件の記事 · 1 / 2 ページ
-
ベイズ統計入門——事前知識を使って確率を更新する
データが少なくても「確率の分布」として答えを出せるベイズ統計の考え方——事前分布・尤度・事後分布という三つの要素と、頻度論との違いをビジネス文脈で解説します。
-
10種類のシールを全部揃えるには何個買えばいい?——クーポンコレクター問題
10種類のシールが入ったお菓子、全部揃えるには平均何個買えばいい?——直感的な「10個」ではなく約29.3個になる理由を、幾何分布・調和数・モンテカルロシミュレーションで解説します。
-
Python コード品質ツール大全
Ruff・mypy・pytest・Bandit など、Python プロジェクトの品質を保つ主要ツールを網羅的に解説する。
-
A/Bテストを始める前に——検出力・効果量・サンプルサイズの設計
A/Bテストの結果が「効果なし」だったとき、それは本当に効果がなかったのか、それともサンプルが足りなかっただけなのか——実験前に必要なサンプルサイズを正しく設計するための3つのパラメータと計算方法を解説します。
-
なぜ標本分散は n-1 で割るのか——不偏分散と自由度の直感
標本分散を n で割ると母分散を系統的に過小推定してしまう——その理由を直感・数学・自由度の三つの視点で解説し、NumPy の ddof=1 が何をしているかを明らかにします。
-
LLM 評価のブレを多層的に抑える ── スコアが信頼できる数字になるまで
AI に採点させるとき、1 回の採点では誤差か実差か区別できない。繰り返し採点・G-Eval 確率加重・ペアワイズ順序反転・ブートストラップ信頼区間・BH 多重比較補正を組み合わせ、LLM 評価のブレを多層的に抑える設計を整理します。
-
3 シグナルで「リリースしてよいか」を判定する ── LLM パイプラインの最終ゲート
Stage 1/Stage 2 の品質ゲートを通過しても、それだけではリリース判断に足りない。ハルシネーション・法的配慮・品質改善の 3 シグナルを統合し、LLM を呼ばずに最終判定する上位ゲートの設計を整理します。
-
LLM 出力を AI が採点する ── 絶対評価・ペアワイズと統計的有意性
「前より良くなったか」を人手に頼らず AI に採点させるとき、一回の採点では誤差か実差か区別できない。絶対評価とペアワイズを組み合わせ、繰り返し採点で信頼区間を出す設計を整理します。
-
Stage 1 / Stage 2 二段品質ゲート ── LLM の「合格」を 2 種類に分ける
LLM 出力の品質基準には「絶対に許せない最低条件」と「以前より悪くなっていないか」の二種類がある。この二つを分離した品質ゲートを設計し、CI に組み込む方法を整理します。
-
テスト結果に「出自ハッシュ」を埋める ── LLM パイプラインの STALE 検出
先週のプロンプトで生成した結果を今日の基準で評価しても意味がない。入力とプロンプトのハッシュを結果ファイルに埋め込み「この結果は今のコードで作られたか」を機械的に判定する手法を解説します。
-
3 種の Judge で LLM 出力を立体的に検証する
LLM 出力の評価を「LLM による意味判定」「定量メトリクス」「ドメイン分類器」の三軸に分け、統一インターフェースで束ねる設計パターン。preference leakage を避けるモデル分離の話も含めて整理します。
-
テストシナリオを LLM で量産する ── カバレッジマトリクスという考え方
LLM アプリのテストケースを手書きするとすぐ頭打ちになる。入力条件の組み合わせをマトリクスで定義し、LLM にテストデータを生成させてカバレッジを体系的に管理する方法を整理します。