メインコンテンツへスキップ

AIエージェント・コーディング・Scientific Software

AI実装は「検証できる実行」へ――数値parity、Virtual First Flight、複合検査、Agent統治

今日のご案内 ☕✨ # 今日の中心は、AIを「賢い出力器」として導入するだけでは足りず、結果を検証できる実行系として組み込む設計が前面に出てきたことだ。Mistralの科学コード移行では、Fortran 77からC++へ書き換える前に数値parity harnessを作り、最終出力だけでなく中間状態まで照合した。AirbusのA350F Virtual First Flightも、simulationを単独で回すのではなく実機avionics benchへ接続し、失敗シナリオと認証試験計画へつなげている。 製造側でも、AECC Donganは3D scanだけでは拾いにくい狭所の小部品を2D visionとAIへ振り分け、Lumafieldは大型CTの内部欠陥・寸法情報をCAD比較やGD&T確認へつなぐ。Scientific AIでは、材料文献から構造化データを作るLLM pipelineや、LG AI Researchの材料設計・自律実験の方向性が、モデルを研究・品質保証の実務loopへ組み込む動きを示している。 企業Agentも同じく「動けること」だけでは不十分だ。Salesforceは日単位・週単位の長期実行、永続状態、承認境界を前面に出し、OneTrustの調査ではAgent利用を奨励する組織が87%に達する一方、明確な統制を持つのは47%にとどまった。AI予算の超過も広がっており、導入競争の焦点はモデル選定から、検証、権限、データ、運用費を含む実行アーキテクチャへ移っている。 1. Mistral、科学コード移行で「翻訳」より数値parityを先に置く # Mistral AIは、物理計算を含む約30万行のFortran 77製reservoir simulatorのうち、最初のsprintで4万行をC++へ移行した事例を公開した。重要なのは、Agentにコードを書かせる前に、legacy側の最終結果と重要な中間状態を出力し、C++側で同じcheckpointを比較できるnumerical-parity harnessを構築した点だ。さらにcaller-callee treeを解析し、100体超のAgentで文書化を進めた。