Skip to content

[V3-10] 失敗分類・top-k分析から改善対象を順位付けする #124

Description

@PyYoshi

親トラッカー: #114

目的・成果物

失敗report、top-k分析、coverage/ranking改善の優先順位

実装先・順序

作業

  • UNRESOLVEDを許容し、正解候補の存在だけでranking failureと断定しない。
  • corpus/language/family/size/workload別の分母、exact/compatible/decode-equivalent/language指標を保持する。

完了条件

代表例を確認済みで、未参照holdoutがある。V3-03/06/08

  • 対象の実装PR・設計判断へのリンクを記録する。
  • 再現command、検証結果、必要なartifact hashを記録する。
  • 未解決事項・既知の制約と、依存先への影響を明記する。

現在の実績(2026-09-21)

残る作業

代表例の確認・未参照holdoutの保持・report基盤は実施済み。独立holdoutは未開封。Tatoeba等の生成・棚卸しをnative品質評価に読み替えない。生成モデルの品質後退も結果として記録済みであり、測定未実施ではない。

元の完了条件に「全corpusで原因解明」等を暗黙追加しない。開発順位と根拠は#171で確定し、下記の受入監査で確認した。

根拠・再現:
開発順位、family分類、品質評価、chunk差分、利用者報告。

受入監査:完了(2026-09-21)

#171で開発順位と#125/#126へ渡す先行候補・受入案をdevへ統合(427e91e7091ea7267b41228224176bfe0ed4234a)。文書2件のみ、diff check成功、dev docs-only CI省略。

  1. incremental証拠の一貫性、まずSBCS filterのchunk依存。
  2. BOM境界とBOMなしUTF-16の構造的証拠(別の変更)。
  3. 新規SBCS model品質・内部選抜・confidence。
  4. 新encoding/language/content hintの根拠収集。

完了根拠: hash照合付きの失敗report/top-k・分母別集計、legacy非exact代表5件、UTF-16のsource確認、French内部選抜の観測/score説明、chunk比較、未参照holdout保持、具体的な開発順位と受入案が揃った。
確定した開発順位。

実Webの頻度を推測した市場順位ではない。未確認の利用者報告や独立corpusの採用前評価は後続課題として残す。元の完了条件に全corpus原因解明を追加せず、分析から次の改善候補を選ぶ役割として受け入れる。
#125では試作枠/D02/D03、状態保持・EOF・メモリ上限・候補/doneの契約を決める。#126で実装と旧新評価を行う。P01、追加encoding採用、独立holdout開封はこのcloseで承認しない。

Activity

  1. added
    v3cChardet v3開発の作業・設計判断
    on Sep 20, 2026
  2. added
    pinned継続して追跡する作業。既存stale設定の除外対象
    on Sep 20, 2026
  3. PyYoshi commented on Sep 20, 2026

    @PyYoshi
    OwnerAuthor

    sample単位のnative候補/top-k分析toolをPR #128へ追加。開始点の既存158fixtureはexact153/compatible154、decode-equivalentはPython codecで評価可能な149件中147件、language151件。exactでない5件のうち3件はcompatibleまたはdecode-equivalent、残り2件はUTF-16 BE/LEの候補不在。候補不在だけで未対応modelと断定しません。独立corpus/大入力の最終評価・因果分類は未完了で、P01の保留に依存する部分をskipしています。

  4. PyYoshi commented on Sep 20, 2026

    @PyYoshi
    OwnerAuthor

    追加実装: #129(Draft/CI中)。manifest-aware inventory/evaluation tool、split・言語・codec・サイズ・形式別の母数、除外理由、exact/compatible/decode-equivalent/language/joint/top-kを記録。既定は予測なし。旧pilot96件のうちvalidationかつ1KiB以下12件、独立holdout24件は未評価。新generatorで再生成して全96sample byte一致と横断split監査成功。エラーを誤判定・skipに埋没させない回帰test追加。family単位の原因分類、実運用多様性、coverage優先順位の定量決定は残作業。P01の大入力評価は保留を維持。

  5. PyYoshi commented on Sep 20, 2026

    @PyYoshi
    OwnerAuthor

    保存済み158件の観測をcorpusのbyte_length/SHA256と全件照合し、codec-family-v1で再分類しました(native再実行なし)。未分類family34件は全件exactであり、detector未対応ではなく分析mapping側の未分類。exact差5件中3件は互換/decode-equivalent、UTF-16の2件だけが原因未確定の候補不在です。

    UTF-16 LE/BEは各1416 bytes、先頭55 00 54 00 / 00 55 00 54でBOMなし。保存観測の先頭候補は両方UTF-8。BOM feed分割の試作だけでは解決しない例として記録し、P01対象の実行/修正/性能比較は再開していません。母数が小さく実運用頻度も未測定なので、これだけで新encoding追加の順序は確定しません。

    次のPRへfamily/workload分母・UNRESOLVED原因status・保存観測のoffline再分析CLIを集約中です。

  6. PyYoshi commented on Sep 20, 2026

    @PyYoshi
    OwnerAuthor

    corpus多様化としてuchardet #17を11 CI成功後devへmergeしました(aa46261)。公式Tatoeba CC0のfra/rus各200 sentencesから2367 variants生成、33 variantsを変換不能として記録。別出力先で全生成物byte一致、cross-manifest split監査成功。全件validation専用・同一originで、native/独立holdout評価は未実施です。保存legacy再分析のUNRESOLVEDは計11件(候補不在2+Python codec未対応でdecode未検証9)で、新規誤判定11件を示すものではありません。

  7. PyYoshi commented on Sep 20, 2026

    @PyYoshi
    OwnerAuthor

    追加進捗: uchardet #20 のsource-only重複監査をdevへ統合済み(11 CI成功)。Tatoeba validation 400文・79,800比較から近似候補15組を検出しました。全て同じsplit内で、漏洩確定やsplit独立性の証明ではありません。独立holdout本文はこの監査では開かず、native予測もしていません。方法・整数集計・report hashは #133 で公開します。独立/real-world精度評価の完了条件は変更しません。

  8. PyYoshi commented on Sep 20, 2026

    @PyYoshi
    OwnerAuthor

    追加進捗(#134、CI中): 保存済みlegacy158件を実byte/hash照合後、confidence bucketと固定閾値別の残存件数を集計するoffline toolを追加。0.9以上は42/158件が残り42exactですが、116件を捨てるため精度100%や推奨閾値とは扱いません。非exact5例のうち3例はdecode-equivalentであり、高confidence誤判定と一括しません。Tatoeba候補は12複数source成分・26文。連結成分を独立標本数と扱わず、削除・重み付け・native再実行・独立holdout予測は行っていません。

  9. PyYoshi commented on Sep 20, 2026

    @PyYoshi
    OwnerAuthor

    追加進捗: native #23を全11 CI成功でdevへ統合しました。Paris Storiesのupstream devのみを固定取得し、692文を録音単位の16validation文書へ集約。技術文書・例文に対して会話ジャンルを追加できました。固定tableの未観測matrix pairは531/22,158(encoding accuracyではありません)。3corpus横断219sourceの監査では独立章本文1件をskipし、cross-manifest近似候補は0件でしたが独立性の保証ではありません。cChardet統合と日本語結果は #136(CI中)。新規training・native予測・独立holdout予測・P01再開はありません。

  10. PyYoshi commented on Sep 20, 2026

    @PyYoshi
    OwnerAuthor

    進捗: family未分類34件を明示分類するcChardet #139はCI中(native予測・精度判定変更なし)。native PyYoshi/uchardet#24は全11CI成功後devへ統合済みです。

    追加の公式CC0 snapshotは日本語2文、アラビア語2文、ヘブライ語27文のみでした。186 variantsは再生成一致しましたが、特に各2文では代表的な精度評価に不足します。この不足を隠さず、別collectionの必要性を日本語で記録しました。5言語431 source recordsを共通validation originに保持し、独立holdout予測や新しい学習はしていません。

    cChardetへの固定点更新はローカル216 passed / 10 skippedを確認済み。先行wheel CIが動いているためまだpushせず、完了後に統合PRへ進めます。

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    pinned継続して追跡する作業。既存stale設定の除外対象v3cChardet v3開発の作業・設計判断

    Projects

    No projects

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions