<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>評価 on Daily Signal</title><link>https://blog.nightly.dedyn.io/tags/%E8%A9%95%E4%BE%A1/</link><description>Recent content in 評価 on Daily Signal</description><generator>Hugo -- gohugo.io</generator><language>ja-JP</language><copyright>© 2026 Daily Signal</copyright><lastBuildDate>Fri, 28 Aug 2026 23:59:00 +0900</lastBuildDate><atom:link href="https://blog.nightly.dedyn.io/tags/%E8%A9%95%E4%BE%A1/index.xml" rel="self" type="application/rss+xml"/><item><title>開発日誌 2026-08-28 — 小規模AIモデルの比較基盤を構築</title><link>https://blog.nightly.dedyn.io/daily/2026-08-28-development-diary/</link><pubDate>Fri, 28 Aug 2026 23:59:00 +0900</pubDate><guid>https://blog.nightly.dedyn.io/daily/2026-08-28-development-diary/</guid><description>&lt;h2 class="relative group"&gt;今日やったこと
 &lt;div id="今日やったこと" class="anchor"&gt;&lt;/div&gt;
 
 &lt;span
 class="absolute top-0 w-6 transition-opacity opacity-0 -start-6 not-prose group-hover:opacity-100 select-none"&gt;
 &lt;a class="text-primary-300 dark:text-neutral-700 !no-underline" href="#%e4%bb%8a%e6%97%a5%e3%82%84%e3%81%a3%e3%81%9f%e3%81%93%e3%81%a8" aria-label="アンカー"&gt;#&lt;/a&gt;
 &lt;/span&gt;
 
&lt;/h2&gt;

&lt;h3 class="relative group"&gt;小規模AIモデルの比較基盤を構築
 &lt;div id="小規模aiモデルの比較基盤を構築" class="anchor"&gt;&lt;/div&gt;
 
 &lt;span
 class="absolute top-0 w-6 transition-opacity opacity-0 -start-6 not-prose group-hover:opacity-100 select-none"&gt;
 &lt;a class="text-primary-300 dark:text-neutral-700 !no-underline" href="#%e5%b0%8f%e8%a6%8f%e6%a8%a1ai%e3%83%a2%e3%83%87%e3%83%ab%e3%81%ae%e6%af%94%e8%bc%83%e5%9f%ba%e7%9b%a4%e3%82%92%e6%a7%8b%e7%af%89" aria-label="アンカー"&gt;#&lt;/a&gt;
 &lt;/span&gt;
 
&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;日本語チャット、連鎖パズル、立体パズル、垂直着陸シミュレーションの4課題を用意し、版を固定した指示文と公開テストを整えた。&lt;/li&gt;
&lt;li&gt;課題達成、ロジック、未知入力への頑健性、見やすさ、使用資源を分けて記録し、単一の総合点へ丸めない評価方針を定めた。&lt;/li&gt;
&lt;li&gt;候補コードを信頼済みの評価処理から分離し、非公開の評価データや参照実装を候補側へ渡さない実行経路を実装した。&lt;/li&gt;
&lt;li&gt;実行記録の形式、指示文のハッシュ化、作業領域の準備、評価、静的サイト生成までを追加した。&lt;/li&gt;
&lt;/ul&gt;

&lt;h3 class="relative group"&gt;デバッグ試行を記録して比較上の不足を明示
 &lt;div id="デバッグ試行を記録して比較上の不足を明示" class="anchor"&gt;&lt;/div&gt;
 
 &lt;span
 class="absolute top-0 w-6 transition-opacity opacity-0 -start-6 not-prose group-hover:opacity-100 select-none"&gt;
 &lt;a class="text-primary-300 dark:text-neutral-700 !no-underline" href="#%e3%83%87%e3%83%90%e3%83%83%e3%82%b0%e8%a9%a6%e8%a1%8c%e3%82%92%e8%a8%98%e9%8c%b2%e3%81%97%e3%81%a6%e6%af%94%e8%bc%83%e4%b8%8a%e3%81%ae%e4%b8%8d%e8%b6%b3%e3%82%92%e6%98%8e%e7%a4%ba" aria-label="アンカー"&gt;#&lt;/a&gt;
 &lt;/span&gt;
 
&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;4課題のデバッグ試行を実行記録として追加し、結果サイトで課題や状態を絞り込み、評価と使用資源の内訳を確認できるようにした。&lt;/li&gt;
&lt;li&gt;日本語チャットは形式に関する決定的検査を通過した一方、エージェント固有の追加指示を含むため正式比較には使えないと記録した。&lt;/li&gt;
&lt;li&gt;垂直着陸は公開テストを通過したが、独立評価では5条件中3条件の着陸にとどまり、見た目の成果物も未完成だった。&lt;/li&gt;
&lt;li&gt;残る2課題は途中停止や成果物不足があり、すべての試行を正式結果へ昇格できない「結論なし」として扱った。&lt;/li&gt;
&lt;/ul&gt;

&lt;h3 class="relative group"&gt;公開経路の実行環境を調整
 &lt;div id="公開経路の実行環境を調整" class="anchor"&gt;&lt;/div&gt;
 
 &lt;span
 class="absolute top-0 w-6 transition-opacity opacity-0 -start-6 not-prose group-hover:opacity-100 select-none"&gt;
 &lt;a class="text-primary-300 dark:text-neutral-700 !no-underline" href="#%e5%85%ac%e9%96%8b%e7%b5%8c%e8%b7%af%e3%81%ae%e5%ae%9f%e8%a1%8c%e7%92%b0%e5%a2%83%e3%82%92%e8%aa%bf%e6%95%b4" aria-label="アンカー"&gt;#&lt;/a&gt;
 &lt;/span&gt;
 
&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;ローカル要件、継続的インテグレーション、説明文の実行環境を同じ版へそろえた。&lt;/li&gt;
&lt;li&gt;検証と静的サイト生成は通ったものの、当初の公開は公開設定段階で失敗した。再実行では成果物のアップロードと公開まで成功した。&lt;/li&gt;
&lt;/ul&gt;

&lt;h2 class="relative group"&gt;判断と学び
 &lt;div id="判断と学び" class="anchor"&gt;&lt;/div&gt;
 
 &lt;span
 class="absolute top-0 w-6 transition-opacity opacity-0 -start-6 not-prose group-hover:opacity-100 select-none"&gt;
 &lt;a class="text-primary-300 dark:text-neutral-700 !no-underline" href="#%e5%88%a4%e6%96%ad%e3%81%a8%e5%ad%a6%e3%81%b3" aria-label="アンカー"&gt;#&lt;/a&gt;
 &lt;/span&gt;
 
&lt;/h2&gt;
&lt;p&gt;モデル比較では、見栄えのよい一例と再現可能な評価を分ける必要がある。機械判定、人手評価、使用資源を別々に示し、失敗を別の指標で相殺しない構成にした。&lt;/p&gt;</description></item></channel></rss>