ENGINEERING NOTES

技術_

AIエージェント開発、システム設計、ローカルLLMなど、技術者向けの知見を発信します。

技術
#claude-code#AIエージェント#llm-as-a-judge#code-review#ai-operations

サブエージェントの「高」判定を、そのまま信じない ── 一次情報で再評価して進行可を出した事例

AIによる自動検証が「重要度: 高」と出した指摘を、そのまま採用せず「出典は実在するか」「記事の核心を支えるか」の2観点で再評価し、格下げして進行を許可した1件の実例を、一次記録に基づいて追体験します。

Read Article
技術
#ローカルLLM#Mac#AI開発#moe#apple-silicon

ローカルLLM Expert Streaming時のSSDランダムI/Oボトルネック実測 ── 速度ブレの裏でディスクリートリードは何が起きているか

常駐1.5GBで26B MoEモデルが動く裏で発生する「同一入力での推論速度2.8倍のブレ」。前作で未計測だったI/O側ボトルネックをMacのiostat実測データで解剖。decode中平均900MB/s〜1.5GB/sの連続リードとCPU idle 77〜81%が語る物理的実態を解明します。

Read Article
技術
#AIエージェント#claude-code#agent-harness#cost-optimization#ai-operations

スキルの進捗表とHarnessのリマインダーが二重管理を生む:ツール呼び出し29回 vs 0回の実測ケーススタディ

AIエージェントの実行基盤(Harness)が出すタスク更新リマインダーに素直に従うと、ツール呼び出しが急増しAPIコストが悪化する二重管理の罠を、5セッションの実測比較データと現場ルールを交えて解説します。

Read Article
技術
#AIエージェント#ai-operations#quality-gate#constraint-tax

指摘に全部対応したら、何も言っていない記事になった — 抑制的な制約が積み上がるとき

AIエージェントの品質ゲートの指摘に愚直に対応した結果、抑制的な制約が26項目まで膨らみ、約9,300字の完成原稿が主張のない無難な文章になってボツになった一次実録です。Over-Constraining (Constraint Tax) の構造と失敗の学びを解説します。

Read Article
技術
#AIエージェント#soft-404#url-verification#shell-script#ai-operations

AIエージェントのWeb調査検収で起きた2つの罠 — HTTP 200を返すSoft 404と正規表現汚染

AIエージェントが出力した出典URLをcURLで自動検証した際、HTTP 200を返すSoft 404や正規表現パースバグによって無効なURLがすり抜けた29件中7件の実測ログと、ロバストな検収スクリプト設計の手法を解説します。

Read Article
技術
#llm#AIエージェント#api-design#prompt-engineering

「話題の記事」の判定をLLMに任せると壊れる──APIで取得・ソートし、解釈だけを任せる設計パターン

Web検索エージェントに「高スコアな記事」を収集させると、順位判定だけが崩壊する現象が発生します。Hacker News API の実測データ(最高405pt vs 最低1pt)と論文をもとに、決定論的処理とLLM解釈の正しい役割分担を解説します。

Read Article
技術
#quality-gate#code-review#ai-operations#log-analysis

記事の根拠になっている一次計測ログを、どの工程も検証していなかった──品質ゲートが見落としていた「生データ検証」の盲点

AIレビューやCI/CDなどの「品質ゲート」を導入して文章表現の整合性をチェックしていても、根拠となる一次計測ログの集計・解釈誤りは検出できません。276KBの生ログ再集計で主張が真逆になった実例から、検証パイプラインの盲点を解説します。

Read Article
技術
#AIエージェント#citation-verification#ai-operations#hallucination

AIエージェントに調査を委譲したら、出典の半分が検証不能だった

AIエージェントによる調査委譲で「出典付き回答」を過信していませんか?スタンフォード大の研究データ(Citation Recall 51.5%)や実用上の劣化パターンから、自動検算ゲート(Citation Verification Gate)をパイプラインに組み込む設計手法を解説します。

Read Article
技術
#AIエージェント#llm#architecture#automation

LLM に逐語転記をさせない — 委譲の損益分岐を「生成」と「転記」で切る

AIエージェントへの業務委譲でプロンプト調整の沼にはまっていませんか?タスクの規模ではなく「生成(確率的)」か「転記(決定論的)」かで切り分ける明確な委譲基準と、100%の再現性を実現するスクリプト連携手法を解説します。

Read Article
技術
#ローカルLLM#ベンチマーク#Mac#AI開発

ローカルLLMのベンチマークは何回測るべきか ── 16回連続測定で分かった「1回測定」の罠と分散表記のすすめ

同一の Mac とプロンプト条件で 16 回測定したところ、推論速度が 4.3〜11.9 tok/s(2.77倍)も動揺しました。スワップや熱などの探求プロセスを開示し、1回測定の危険性と「複数回試行+分散表記」の標準テンプレートを提案します。

Read Article
技術
#AIエージェント#prompt-engineering#ui-ux#human-in-the-loop#システム設計

AIエージェントに複数選択を迫らせると会話コストが増える理由 — 選択肢ラベルの二重化事故

AIエージェントや支援ツールとの対話で、複数確認時に選択肢番号が重複する「ラベル二重化事故」と画面がブロックされるモーダルUIの課題を解説。一問一答原則と「直交ラベル命名規則」により1打鍵で即答できるプロンプトUI設計を提案します。

Read Article
技術
#AIエージェント#ハルシネーション対策#human-in-the-loop#データ検証

文章をレビューさせるな、ログを再集計させろ──AIレビューの使いどころを1段変える

「AIにレビューさせています」は、LLMを意見を下す「Judge」として使っているに過ぎません。文章の根拠になった生データや引用元に立ち返って確認する「検算」でしか見つからない誤りがあることを、自分の分析が実際に覆された記録から示します。

Read Article
技術
#ローカルLLM#Mac#AI開発#moe#apple-silicon

26Bモデルが常駐1.5GBで動いた──ただし同じ入力で16回測ったら速度が2.8倍ブレた

メモリに載らないMoEモデルをSSDストリーミングで動かすTurboFieldfareを、前回Ollamaで挫折したのと同じM1 Pro 16GBで実測。常駐1.5GB・スワップ増加ゼロという約束は守られましたが、同じ入力での16回の計測が4.3〜11.9 tok/sとブレました。原因を追ってpowermetricsまで回した記録です。

Read Article
技術
#tokenmaxxing#ai-cost-optimization#agents-md#llm-architecture#claude-code

「Tokenmaxxing」狂騒曲の終焉:大容量コンテキスト依存から脱却する実用的AIコスト最適化設計

1M+の大容量コンテキスト全投入(Tokenmaxxing)によるコスト急増や精度悪化の技術的リスクを解き明かし、Cascading AGENTS.mdやモデルルーティングによりコストを90%以上削減する実用的AIアーキテクチャ設計を解説します。

Read Article
技術
#AI導入ガバナンス#claude#プライバシー設計#ベンダーリスク管理#情報セキュリティ

「意図通りの動作です」で済ませていいのか──Claude共有チャット流出事故に見るAI導入ガバナンスの盲点

医療記録や暗号資産の秘密鍵まで検索結果に露出したClaude共有チャット流出事故。「noindex設定忘れ」という単純化を超え、robots.txtとnoindexの技術的な自己矛盾、公開URLの本質的な統制不能性から、AIツール導入時にベンダーの説明を鵜呑みにしないためのガバナンス視点を解説します。

Read Article
技術
#オープンウェイトAI#AI導入ガバナンス#ベンダーロックイン#経営とAI#マルチモデル戦略

Nvidia・Microsoft・Metaが「オープンウェイト規制」に反対する理由から読み解く、AIベンダー選定のリスク管理

2026年7月、Nvidia・Microsoft・Metaなど80団体規模が「オープンウェイトAIへの拙速な規制に反対する」公開書簡を発表しました。同時期のMythos・GPT-5.6の配布制限、Kimi K3とDeepSeekのライセンス差、報道でばらつくトークンシェアの数字を手がかりに、AIモデル選定を「性能」だけでなく「主権・ガバナンス」の軸で見直す視点を解説します。

Read Article
技術
#経営とAI#エンジニアリング組織#ソフトウェア品質#AI導入ガバナンス#claude-code

コーディングは「解決」したのに、なぜソフトウェアは劣化し続けるのか──ボトルネックは「書く」から「決める」に移っただけだった

Hacker Newsで876人が支持した「なぜソフトウェアは劣化し続けるのか」という問いから、GitLabとFaros AIの独立した調査データを手がかりに、AI時代の「書く速度」と「決める速度」の非対称という経営課題を読み解きます。

Read Article
技術
#AI#agentic-workflow#ai-operations#retrospective#process-design

AIパイプライン運用における「振り返り」の設計論──事故をルールに沈殿させ、過剰規制を防ぐメタプロセス

LLMエージェントによる自動化パイプラインにおいて、障害やハルシネーションを単発のプロンプト修復で終わらせず、システム仕様へ還元する「振り返り」の設計論。In-Loop/Out-of-Loopの二層構造、ルール沈殿、過剰規制(Constraint Tax)の防止策を解説します。

Read Article
技術
#claude-opus-5#AIエージェント#llm#失敗談#コンテキスト肥大化

Opus 5 にブログを書かせてみたが、ボツにした理由──上位モデルでも超えられなかった「合格ライン」の壁

Claude Opus 5 でブログ自律執筆を試みるも生成記事をボツにした実態記録。5時間枠の70%がわずか30分で消失したコスト構造と、スクショ追加による自律メタ解析誘発、敵対的レビュー(blog-verify)4周の無限ループの原因を解き明かします。

Read Article
技術
#ollama#ローカルLLM#claude-code#Mac#AI開発

Claude Codeの制限対策にOllamaを試して痛感した、ローカルLLMのリアルとクラウドAIのありがたみ

Claude Code利用量上限の逃げ道としてOllamaでローカルLLM導入を試みたリアルな体験談。M1 Pro Macでのスワップや遅延の現実、最新クラウドAPI(Claude Haiku 4.5, Gemini 3.6 Flash)とのコスト比較を通じ、クラウドとローカルの正しい使い分けを解説します。

Read Article
技術
#AIエージェント#context-engineering#harness-engineering#agents-md#システム設計

Loopを回す前に『ハーネス』を整えよ:AGENTS.mdの階層分割とmiseで実現する堅牢なAI開発基盤

単発のVibe Codingや自律Loopの前に必要な『ハーネスエンジニアリング』を解説。巨大なAGENTS.mdによるLost in the Middle現象を防ぐ階層分割モデルと、miseによる決定論的な検証環境(Self-Verification)の構築手法を提示します。

Read Article
技術
#AI時代キャリア#system-fluency#アーキテクチャ#AIエージェント#コードレビュー

AIスキルだけではキャリアを守れない──今エンジニアに求められる「システム説明力(System Fluency)」とは

CursorやClaude Code等のAIツール普及により、プロンプティング技能はコモディティ化しました。建設業界の「丸投げ構造」とのアナロジーから、AI時代に生き残るコアスキル「System Fluency(システム説明力)」と、AIを評価パートナーに変える実践アプローチを解説します。

Read Article
技術
#AIエージェント#loop-engineering#context-engineering#システム設計#claude-code

プロンプトを磨くのはもうやめよう。「Context」を整え「小さなLoop」を回すAIエンジニアリング実践

単発のプロンプト入力(Vibe Coding)に頼る開発は限界を迎えています。事前に適切な構造化文脈を与えるContext Engineeringと、機械的テストで自動検証するLoop Engineeringの導入手法を、20行のBashスクリプト等の具体例付きで解説します。

Read Article
技術
#gemini#AIエージェント#アップデート#システム設計#llm

GoogleがGemini 3.6 Flash / 3.5 Flash-Lite / 3.5 Flash Cyberを発表!AIエージェント開発はどう変わるか

Googleが発表したGemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyberの全貌を解説。トークン消費最大65%削減、350tpsの超高速処理、セキュリティ特化モデルの登場がAIエージェント開発に与える影響とモデル選定の指針を整理します。

Read Article
技術
#claude-code#claude#生産性向上

Claude Codeの週次利用制限と付き合う配分術──「/usage」で可視化し、ヘビーなタスクを計画的に投入する

Claude Codeの週次利用制限に週の後半で毎回突き当たる悩みを、`/usage`コマンドによる可視化と、タスクの重さに応じた配分計画で解消する方法を解説。あわせて2026年5月13日〜8月19日に実施された週次利用制限50%増量キャンペーンの内容も記録します。

Read Article
技術
#claude#claude-code#AIエージェント#アップデート

Claudeが料金体系を大幅アップデート!Pro/Teamユーザーに配られた「$100移行クレジット」の正体と正しい確認・活用方法

2026年7月20日のClaudeの仕様変更に伴い、Pro/Team Standardユーザーに配布された$100クレジットについて徹底解説。Claude Codeで消費するための環境変数の注意点や、Fable 5のフォールバック・セーフガードの挙動など、エンジニア向けに技術仕様を分かりやすくまとめました。

Read Article
技術
#claude-code#AIエージェント#開発環境#生産性向上

Claude Codeを「リアルなエンジニアの道具」にする:mattpocock/skillsを導入して気づいた、AI協働開発の新しい仕事術

Claude Codeで再利用可能なワークフローを定義する「mattpocock/skills」の導入体験レポート。自動化の限界であるコンテキスト肥大化を防ぐ「人間主体のAI制御」という設計思想の魅力に迫ります。

Read Article
技術
#AIエージェント#業務自動化#システム設計#claude-code

「一つのことをうまくやる」スキルを、壊さずに束ねる。ブログ執筆パイプラインにオーケストレーターを追加した話

5つに増えたAIエージェントスキルを毎回手動で順番に呼び出す運用に限界を感じ、既存スキルの中身を一切変更せずに束ねるオーケストレーター機能を追加しました。UNIXの哲学「一つのことをうまくやる」を、工程の設計だけでなく工程同士の繋ぎ方にまで適用した記録です。

Read Article
技術
#AIエージェント#業務自動化#システム設計#claude-code

AIに『必ず間違いがある』前提でレビューさせる。ブログ執筆パイプラインに懐疑的検証ゲートを足した話

執筆の前工程(企画・設計)で記事の品質の大部分は決まる、という体感から、設計書を懐疑的な視点で見直す/blog-verifyステージと、それを迂回できなくするハードゲートを追加しました。人間の『見直し』とAIの自己レビューの違いを起点にした設計思想です。

Read Article
技術
#AI#ブログ#効率化#実践ガイド

AIを活用した効率的なブログ執筆術

Meetsourceの技術ブログを実際に支えている、AIエージェントとの分業のコツを紹介します。一発生成に頼らず、企画・執筆・校閲を分けて任せることで得られた実務的な知見です。

Read Article