Category
AI
機械学習・LLM など
55 件の記事 · 3 / 5 ページ
-
LLM でデータセットを作る際の落とし穴とマトリクス設計
LLM による合成データ生成には世代崩壊やバイアス増幅といった構造的な落とし穴がある——その根本には Chat 形式の連続生成という設計ミスがあり、マトリクス×ステートレス単一 API 呼び出しに切り替えることで解決できます。
-
OOD(分布外データ)とは何か ── LLM で合成 OOD プロキシを生成して未知データに備える
訓練データの分布外にあるデータ——OOD——にモデルは高い確信度で誤る。ラベル付き OOD が手に入らないという根本問題に対し、LLM で合成プロキシを生成する最新アプローチと、その落とし穴を整理します。
-
プロンプトキャッシングの落とし穴
プロンプトキャッシングは強力なコスト削減手段ですが、thinking パラメータの変更でメッセージキャッシュが無効になる点など、知らないと損をする挙動があります。
-
JSON 出力とソース引用
構造化出力(JSON スキーマ準拠)と引用機能を使うと、バリデーション不要のデータ抽出とハルシネーション対策ができます。2つの組み合わせ方も解説します。
-
AI の UI を「generated っぽく」させない——StyleSeed の 69 のデザインルール
StyleSeed はデザインデータではなくデザイン判断力を Claude に渡すスキルです。69 のビジュアルルール・7 つのブランドスキン・14 のスラッシュコマンドで、AI が出力する UI を「作られた感」のあるものに変えます。
-
Claude thinking の課金モデル
thinking ブロックの表示設定(summarized / omitted)に関わらず、課金は生の思考トークン全体に対して発生します。その仕組みと確認方法を解説します。
-
Claude API の思考設計の変遷
budget_tokens で「何トークン使うか自分で決める」時代から、effort で「方向性を示してあとは Claude に任せる」時代へ。設計思想の変化を読み解きます。
-
tool_choice の4種類と Claude のツール判断ロジック
tool_choice には auto / any / tool / none の4種類があります。それぞれの意味と、サーバーツール・クライアントツールの違い、effort との関係を整理します。
-
Claude Code スキルの設計指針——3 層構造をどう使い分けるか
フロントマター・スキルボディ・補助ファイルという公式スキルの 3 層構造を手がかりに、何をどこに書くべきかの実践的な判断基準を整理します。
-
ローカル LLM ベンチマーク:M3 / 24GB で 5 モデルを計測した
lm-evaluation-harness を使い、MacBook Air M3 / 24GB 上の 5 モデルを GSM8K と ARC Challenge で計測しました。phi4 が両タスクで最高スコアを記録し、速さでは mistral-nemo が突出しました。
-
ローカル LLM のモデル選定:M3 / 24GB で動かせる範囲を調査した
各 LLM ファミリーのバリアントを調べ、MacBook Air M3 / 24GB で快適に動かせる範囲を整理して、実際に導入する 5 モデルを選定しました。
-
Anthropic IPO 秘密申請——評価額 9,650 億ドルで OpenAI を超えた AI 企業の上場戦略
本日のAIニュースはAnthropicのIPO秘密申請——評価額9,650億ドルでOpenAIを上回り、AI企業として史上最大規模の上場へ動き出した背景を読み解きます。