Research

Research & Validation

テストサイトへの過剰適合を避け、機械判定・人間評価・外部AI観測を分離して検証します。混ぜると、どれが効いたのか分からなくなります。

検証原則

比較ページは原則として一つの要因だけを変更し、絶対スコアよりも比較方向の正しさを先に確認します。絶対値の妥当性は、方向が正しいことを確認した後の問題です。

  • 単一変数比較
  • 内部期待値の非公開
  • セマンティックシグナル
  • バージョン別回帰結果

3種類の評価を混ぜない

評価には性質の異なるものが混在しています。決定的に判定できるものと、観測にとどまるものを同じ指標に入れると、指標そのものが信用できなくなります。

注意外部AIの応答は同じ入力でも変動します。少数の観測から因果関係を主張することはしません。

評価の種類と扱い
種類再現性合否判定に使うか
機械判定(構造・メタ・矛盾)あり使う
人間評価(読みやすさ・妥当性)限定的参考にする
外部AI観測(引用されたか)なし使わない

研究テーマ

AIO評価、JavaScriptレンダリング、エンティティ理解、計測品質、Webセキュリティを段階的に追加します。

過剰適合を避ける

検証環境に対してのみ正しく動くツールは、実サイトでは役に立ちません。検証ケースを増やすときは、既存ケースを通すための調整になっていないかを確認します。

アナライザが期待値を満たせなかったときに期待値を緩めることは、変更として認めていません。設計自体が変わった場合のみ、理由を記録して更新します。

Explore next

インサイトを読む

インサイトを読む

最終更新: