今日やったこと # ライブ監査結果の状態遷移をテストへ反映 # 企業拠点データの監査テストを修正し、位置や現在の所在が確認済みであることだけを求める固定的な期待値から、ライブ監査によって要確認へ遷移する場合も扱える期待値へ変更した。 既知の拠点補正、同一施設を共有する組織、主要拠点、航空宇宙・ドローン関連企業を検査する複数のケースへ同じ状態遷移の考え方を適用した。 変更はテストに限定し、本番の監査処理や拠点データそのものには手を加えていない。 判断と学び # ライブ監査の結果は外部情報の変化に応じて更新されるため、一度確認済みになった項目が常にその状態を保つとは限らない。監査を完了したことと、結果が確認済みであることを分け、追加確認が必要な状態への遷移も正当な結果としてテストする必要があった。
今日やったこと # AI記事生成の証拠と引き継ぎ契約を再設計 # 調査、選定、執筆を独立した工程として扱い、後段は保存された前段の成果物だけを読む契約にした。同じ会話に残った暗黙の記憶へ依存しない構成を目指した。 調査結果の形式を厳密化し、実行日時、検索状況、情報源の確認結果、警告を記録するようにした。対象日が違う入力、古い入力、不完全な入力は選定工程で止める方針にした。 選定結果には、採用した主張と根拠の対応、検証状態、情報提供者による自己申告かどうか、記事内の順序と深さを残すようにした。 過去記事との重複を抑えるため、公開履歴とイベント単位の識別情報を保持する設計を追加した。執筆後には、採用項目、主張、数値情報がどれだけ保持されたかを監査できるようにした。 本番公開を行わずに各工程の境界と成果物を検査するドライラン手順、受け入れ基準、評価項目、例示データを整備した。 公開前検証と配信ゲートを実装 # AIが生成した記事だけを対象に、必須メタデータ、項目数、情報源、公開日、追跡用パラメータ、内部工程名、匿名の編集文体を決定論的に検査する仕組みを追加した。 情報源の数と記事項目の数、採用項目の識別情報を相互に照合し、欠落や重複があれば公開前に失敗させるようにした。 公開サイトのビルド前に記事検証を実行し、検証を通過した最新版だけを配信するようにした。新しい更新が来た場合は古い配信処理を打ち切り、競合した版が公開されにくい構成へ変更した。 検証器に対して、正常な記事、項目数の不一致、内部語の混入、追跡用パラメータ、日付欠落、追跡情報の欠落を扱うテストを追加した。 判断と学び # 生成記事の品質を文章の自然さだけで評価すると、調査時点では存在した根拠、数値の分母、留保、帰属が執筆中に落ちても検出しにくい。各工程の成果物を厳密な契約でつなぎ、主張単位の根拠と情報保持率を残す方が、品質低下の場所を特定しやすい。
今日やったこと # AIモデル比較基盤を実演可能な形へ拡張 # 日本語対話、連鎖パズル、立体パズル、制御シミュレーションの各課題について、指示文、公開テスト、独立評価、実行記録の扱いを見直した。 候補の実行環境を一時的な認証領域へ分離し、評価基盤や外部の追加指示が候補へ漏れた場合は比較不能として記録するようにした。 連鎖パズルは完成盤面を渡す方式から、空の盤面から合法手順で組み立てる方式へ変更した。制御課題の一つはロボットアームの仕分けへ差し替え、運動学、速度制限、衝突、把持を検査対象にした。 モデル別ページで各課題の最新実行を表示し、検証済みの候補作品をブラウザ上で再演できるようにした。スマートフォンで実演領域が隠れる問題と、更新後のスタイルが残るキャッシュ問題も修正した。 小規模モデルによる一連のデバッグ実行を公開した。結果は実演と基盤確認のためのもので、正式比較にはまだ昇格していない。 文章スタイルモデルを実例と負例から校正 # 過去の長文と短文を材料に、話題の選び方、判断の進め方、文のリズム、代筆時に創作してはいけない事実の境界を整理した。 最初の生成例は、見出しや段落が均等で、機能を順番に巡回し、最後に再要約する構成になった。語彙より構成が整いすぎていることを負例としてモデルへ反映した。 網羅性を既定にせず、一つの問いに必要な事実だけを残す方針へ変更した。比較や留保を帳尻合わせで足さず、冒頭の主張を末尾で言い換えるだけの結論も避けるようにした。 生成と校正を別の工程に分け、別コンテキストの編集で事実を増やさず削る内部テストを行った。機能カタログ化を抑える効果は確認できたが、本人承認はまだ得ていない。 判断と学び # 比較サイトでは、候補作品が動いて見えることと、正式な比較条件を満たすことを分けて示す必要がある。実演は理解を助けるが、隔離、計測、未知入力での検査が不足した実行を正式結果として扱う根拠にはならない。
今日やったこと # 小規模AIモデルの比較基盤を構築 # 日本語チャット、連鎖パズル、立体パズル、垂直着陸シミュレーションの4課題を用意し、版を固定した指示文と公開テストを整えた。 課題達成、ロジック、未知入力への頑健性、見やすさ、使用資源を分けて記録し、単一の総合点へ丸めない評価方針を定めた。 候補コードを信頼済みの評価処理から分離し、非公開の評価データや参照実装を候補側へ渡さない実行経路を実装した。 実行記録の形式、指示文のハッシュ化、作業領域の準備、評価、静的サイト生成までを追加した。 デバッグ試行を記録して比較上の不足を明示 # 4課題のデバッグ試行を実行記録として追加し、結果サイトで課題や状態を絞り込み、評価と使用資源の内訳を確認できるようにした。 日本語チャットは形式に関する決定的検査を通過した一方、エージェント固有の追加指示を含むため正式比較には使えないと記録した。 垂直着陸は公開テストを通過したが、独立評価では5条件中3条件の着陸にとどまり、見た目の成果物も未完成だった。 残る2課題は途中停止や成果物不足があり、すべての試行を正式結果へ昇格できない「結論なし」として扱った。 公開経路の実行環境を調整 # ローカル要件、継続的インテグレーション、説明文の実行環境を同じ版へそろえた。 検証と静的サイト生成は通ったものの、当初の公開は公開設定段階で失敗した。再実行では成果物のアップロードと公開まで成功した。 判断と学び # モデル比較では、見栄えのよい一例と再現可能な評価を分ける必要がある。機械判定、人手評価、使用資源を別々に示し、失敗を別の指標で相殺しない構成にした。
今日やったこと # データ監査を最古優先へ変更 # 日次監査の対象を固定的な分割から、未確認または確認日が古い項目を優先する方式へ切り替えた。 一度に扱う件数を制限しつつ、途中で失敗して保存されなかった項目は次回も古い対象として再試行されるようにした。 全件、分割、対象指定の既存モードは残し、通常実行だけを最古優先に変更した。 選択順、件数制限、失敗後の再試行を自動テストで固定した。 監査結果を公開地図へ確実に反映 # データ監査が成功した後にも公開処理を起動し、監査が保存した最新データを公開地図へ反映する経路を追加した。 公開処理が常に主ブランチを取得するようにし、機械実行が作成した更新でも古い状態を配信しないようにした。 監査と公開の関係を生成ドキュメントへ反映し、運用説明を現在の構成に合わせた。 公式拠点の判定を強化 # 公式サイト内のリンクに加え、クロール規則を尊重しながらサイトマップと構造化データから拠点候補を探せるようにした。 ニュース、規約、採用、製品、PDFなどを現在地の確認根拠から外し、公式の拠点・連絡先ページを優先するようにした。 都市名だけの一致では現在の拠点を確認済みにせず、企業名と番地を含む根拠がそろった場合だけ確認済みにするよう厳格化した。 根拠を取得できない項目は削除せず要確認として残し、誤検出しやすい語句を候補から除外した。 判断と学び # 固定的な分割監査は全体を均等に回しやすい一方、途中で失敗した対象が次の周期まで後回しになる。最終確認日の古さを基準にすると、保存できなかった対象を自然に再試行でき、未確認項目も先に減らせる。