Repository navigation
[V3-10] 失敗分類・top-k分析から改善対象を順位付けする #124
Description
Activity
- added a parent issue
on Sep 20, 2026 sample単位のnative候補/top-k分析toolをPR #128へ追加。開始点の既存158fixtureはexact153/compatible154、decode-equivalentはPython codecで評価可能な149件中147件、language151件。exactでない5件のうち3件はcompatibleまたはdecode-equivalent、残り2件はUTF-16 BE/LEの候補不在。候補不在だけで未対応modelと断定しません。独立corpus/大入力の最終評価・因果分類は未完了で、P01の保留に依存する部分をskipしています。
追加実装: #129(Draft/CI中)。manifest-aware inventory/evaluation tool、split・言語・codec・サイズ・形式別の母数、除外理由、exact/compatible/decode-equivalent/language/joint/top-kを記録。既定は予測なし。旧pilot96件のうちvalidationかつ1KiB以下12件、独立holdout24件は未評価。新generatorで再生成して全96sample byte一致と横断split監査成功。エラーを誤判定・skipに埋没させない回帰test追加。family単位の原因分類、実運用多様性、coverage優先順位の定量決定は残作業。P01の大入力評価は保留を維持。
保存済み158件の観測をcorpusのbyte_length/SHA256と全件照合し、codec-family-v1で再分類しました(native再実行なし)。未分類family34件は全件exactであり、detector未対応ではなく分析mapping側の未分類。exact差5件中3件は互換/decode-equivalent、UTF-16の2件だけが原因未確定の候補不在です。
UTF-16 LE/BEは各1416 bytes、先頭55 00 54 00 / 00 55 00 54でBOMなし。保存観測の先頭候補は両方UTF-8。BOM feed分割の試作だけでは解決しない例として記録し、P01対象の実行/修正/性能比較は再開していません。母数が小さく実運用頻度も未測定なので、これだけで新encoding追加の順序は確定しません。
次のPRへfamily/workload分母・UNRESOLVED原因status・保存観測のoffline再分析CLIを集約中です。
corpus多様化としてuchardet #17を11 CI成功後devへmergeしました(aa46261)。公式Tatoeba CC0のfra/rus各200 sentencesから2367 variants生成、33 variantsを変換不能として記録。別出力先で全生成物byte一致、cross-manifest split監査成功。全件validation専用・同一originで、native/独立holdout評価は未実施です。保存legacy再分析のUNRESOLVEDは計11件(候補不在2+Python codec未対応でdecode未検証9)で、新規誤判定11件を示すものではありません。
追加進捗(#134、CI中): 保存済みlegacy158件を実byte/hash照合後、confidence bucketと固定閾値別の残存件数を集計するoffline toolを追加。0.9以上は42/158件が残り42exactですが、116件を捨てるため精度100%や推奨閾値とは扱いません。非exact5例のうち3例はdecode-equivalentであり、高confidence誤判定と一括しません。Tatoeba候補は12複数source成分・26文。連結成分を独立標本数と扱わず、削除・重み付け・native再実行・独立holdout予測は行っていません。
追加進捗: native #23を全11 CI成功でdevへ統合しました。Paris Storiesのupstream devのみを固定取得し、692文を録音単位の16validation文書へ集約。技術文書・例文に対して会話ジャンルを追加できました。固定tableの未観測matrix pairは531/22,158(encoding accuracyではありません)。3corpus横断219sourceの監査では独立章本文1件をskipし、cross-manifest近似候補は0件でしたが独立性の保証ではありません。cChardet統合と日本語結果は #136(CI中)。新規training・native予測・独立holdout予測・P01再開はありません。
進捗: family未分類34件を明示分類するcChardet #139はCI中(native予測・精度判定変更なし)。native PyYoshi/uchardet#24は全11CI成功後devへ統合済みです。
追加の公式CC0 snapshotは日本語2文、アラビア語2文、ヘブライ語27文のみでした。186 variantsは再生成一致しましたが、特に各2文では代表的な精度評価に不足します。この不足を隠さず、別collectionの必要性を日本語で記録しました。5言語431 source recordsを共通validation originに保持し、独立holdout予測や新しい学習はしていません。
cChardetへの固定点更新はローカル216 passed / 10 skippedを確認済み。先行wheel CIが動いているためまだpushせず、完了後に統合PRへ進めます。
親トラッカー: #114
目的・成果物
失敗report、top-k分析、coverage/ranking改善の優先順位
実装先・順序
dev。Draft PRで作成する。作業
完了条件
代表例を確認済みで、未参照holdoutがある。V3-03/06/08
現在の実績(2026-09-21)
残る作業
代表例の確認・未参照holdoutの保持・report基盤は実施済み。独立holdoutは未開封。Tatoeba等の生成・棚卸しをnative品質評価に読み替えない。生成モデルの品質後退も結果として記録済みであり、測定未実施ではない。
元の完了条件に「全corpusで原因解明」等を暗黙追加しない。開発順位と根拠は#171で確定し、下記の受入監査で確認した。
根拠・再現:
開発順位、family分類、品質評価、chunk差分、利用者報告。
受入監査:完了(2026-09-21)
#171で開発順位と#125/#126へ渡す先行候補・受入案をdevへ統合(
427e91e7091ea7267b41228224176bfe0ed4234a)。文書2件のみ、diff check成功、dev docs-only CI省略。完了根拠: hash照合付きの失敗report/top-k・分母別集計、legacy非exact代表5件、UTF-16のsource確認、French内部選抜の観測/score説明、chunk比較、未参照holdout保持、具体的な開発順位と受入案が揃った。
確定した開発順位。
実Webの頻度を推測した市場順位ではない。未確認の利用者報告や独立corpusの採用前評価は後続課題として残す。元の完了条件に全corpus原因解明を追加せず、分析から次の改善候補を選ぶ役割として受け入れる。
#125では試作枠/D02/D03、状態保持・EOF・メモリ上限・候補/doneの契約を決める。#126で実装と旧新評価を行う。P01、追加encoding採用、独立holdout開封はこのcloseで承認しない。