Tag
LLM
42 件の記事 · 1 / 4 ページ
-
AIコーディング slop の解剖 ── なぜ足すばかりで消せないのか
一応動くのに、全体としては劣化していく——AI が量産するコードの症状を4つの軸に整理し、その根っこにある「削除の証明ができない」という制約と、コストを誰が払っているかを実証データから読み解きます。
-
プロンプトインジェクションはなぜ根本解決が難しいのか
プロンプトインジェクションが厄介なのは攻撃の巧妙さではなく、LLM が命令とデータを構造的に区別できないという設計上の性質にあります。
-
LLM 時代の読解力劣化——「スキャン」が「読む」を置き換える日
AI が文章を構造化してくれる時代に、人が自分で意味を組み立てる能力はどう変質するか——読解力劣化の機序と、その先にある思考の空洞化を考察します。
-
正しさの感覚を委託しないために——「確認しない人間」問題
ハルシネーションより怖いのは、それを確認しない人間の側の変化——「AI が言うなら合っている」という受け身の検証が常態化し、正しさを自分で判断する回路が錆びていく過程を考えます。
-
AIを使うことは「成果物の外注」である
AI に頼むことはアプリ開発を外注するのと同じ——外注した瞬間に消えるプロセスと経験に注目して、身につけたいかどうかで使い方を選び分ける整理をします。
-
bonsai — 全部読む前に地図を作れ
コードベースの骨格だけを抽出してトークン効率の高い地図を生成する CLI ツール bonsai——全文を読ませる前に「何を読むか」を決めることで、AI エージェントのコンテキスト消費を 4〜5 倍削減します。
-
LLM 評価のブレを多層的に抑える ── スコアが信頼できる数字になるまで
AI に採点させるとき、1 回の採点では誤差か実差か区別できない。繰り返し採点・G-Eval 確率加重・ペアワイズ順序反転・ブートストラップ信頼区間・BH 多重比較補正を組み合わせ、LLM 評価のブレを多層的に抑える設計を整理します。
-
3 シグナルで「リリースしてよいか」を判定する ── LLM パイプラインの最終ゲート
Stage 1/Stage 2 の品質ゲートを通過しても、それだけではリリース判断に足りない。ハルシネーション・法的配慮・品質改善の 3 シグナルを統合し、LLM を呼ばずに最終判定する上位ゲートの設計を整理します。
-
LLM 出力を AI が採点する ── 絶対評価・ペアワイズと統計的有意性
「前より良くなったか」を人手に頼らず AI に採点させるとき、一回の採点では誤差か実差か区別できない。絶対評価とペアワイズを組み合わせ、繰り返し採点で信頼区間を出す設計を整理します。
-
Stage 1 / Stage 2 二段品質ゲート ── LLM の「合格」を 2 種類に分ける
LLM 出力の品質基準には「絶対に許せない最低条件」と「以前より悪くなっていないか」の二種類がある。この二つを分離した品質ゲートを設計し、CI に組み込む方法を整理します。
-
テスト結果に「出自ハッシュ」を埋める ── LLM パイプラインの STALE 検出
先週のプロンプトで生成した結果を今日の基準で評価しても意味がない。入力とプロンプトのハッシュを結果ファイルに埋め込み「この結果は今のコードで作られたか」を機械的に判定する手法を解説します。
-
3 種の Judge で LLM 出力を立体的に検証する
LLM 出力の評価を「LLM による意味判定」「定量メトリクス」「ドメイン分類器」の三軸に分け、統一インターフェースで束ねる設計パターン。preference leakage を避けるモデル分離の話も含めて整理します。