AIに開発ルールを持たせたら差は埋まるか|Fable 5 と Opus 4.8 を3通りで再対決
Fable の進め方を開発ルールにまとめ Opus に持たせたら、新しいお題で差は埋まるのか。字幕タイミングのツールを3…
Claude・Gemini・OpenAI などの API 実装・プロンプト設計・精度検証。AI/LLM 開発の実測記録。
Fable の進め方を開発ルールにまとめ Opus に持たせたら、新しいお題で差は埋まるのか。字幕タイミングのツールを3…
最上位モデル Claude Fable 5 に freee 風の会計アプリを作らせたら、複式簿記から決算書・請求書・CS…
最上位の Claude Fable 5 と半額の Opus 4.8 に同じ勤怠集計ツールを作らせて実測。計算の正確性は同…
社内文書を要約するLLMツールにプロンプトインジェクションを実際に食らわせ、素の実装と防御実装の攻撃成功率を実測。秘密漏…
JSONを強制しても構造化出力は壊れます。Claude Haiku 4.5で引っかけ入力30件を実測すると、構文違反は0…
同じ日本語分類40件をOpus 4.8・Sonnet 5・Haiku 4.5にブラインドで解かせて実測。精度は97.5〜…
gpt-image-2 に日本語の見出しを5枚描かせたら、豆腐化・別字すり替えなど4種類の崩れ方をしました。なぜ崩れるの…
ブログのネタ出しを「5カテゴリ×3ペルソナ×採点」で仕組み化しました。AIに聞くだけが続かない理由と、コピペできる採点プ…