/** * WPML compatibility functions * * @global array $duplicated_posts Array to store the posts being duplicated. * * @package Yoast\WP\Duplicate_Post * @since 3.2 */ add_action( 'admin_init', 'duplicate_post_wpml_init' ); /** * Add handlers for WPML compatibility. */ function duplicate_post_wpml_init() { if ( defined( 'ICL_SITEPRESS_VERSION' ) ) { add_action( 'dp_duplicate_page', 'duplicate_post_wpml_copy_translations', 10, 3 ); add_action( 'dp_duplicate_post', 'duplicate_post_wpml_copy_translations', 10, 3 ); add_action( 'shutdown', 'duplicate_wpml_string_packages', 11 ); } } global $duplicated_posts; // phpcs:ignore WordPress.NamingConventions.PrefixAllGlobals -- Reason: Renaming a global variable is a BC break. $duplicated_posts = []; /** * Copy post translations. * * @global SitePress $sitepress Instance of the Main WPML class. * @global array $duplicated_posts Array of duplicated posts. * * @param int $post_id ID of the copy. * @param WP_Post $post Original post object. * @param string $status Status of the new post. */ function duplicate_post_wpml_copy_translations( $post_id, $post, $status = '' ) { global $sitepress; global $duplicated_posts; remove_action( 'dp_duplicate_page', 'duplicate_post_wpml_copy_translations', 10 ); remove_action( 'dp_duplicate_post', 'duplicate_post_wpml_copy_translations', 10 ); $current_language = $sitepress->get_current_language(); $trid = $sitepress->get_element_trid( $post->ID ); if ( ! empty( $trid ) ) { $translations = $sitepress->get_element_translations( $trid ); $new_trid = $sitepress->get_element_trid( $post_id ); foreach ( $translations as $code => $details ) { if ( $code !== $current_language ) { if ( $details->element_id ) { $translation = get_post( $details->element_id ); if ( ! $translation ) { continue; } $new_post_id = duplicate_post_create_duplicate( $translation, $status ); if ( ! is_wp_error( $new_post_id ) ) { $sitepress->set_element_language_details( $new_post_id, 'post_' . $translation->post_type, $new_trid, $code, $current_language ); } } } } // phpcs:ignore WordPress.NamingConventions.PrefixAllGlobals -- Reason: see above. $duplicated_posts[ $post->ID ] = $post_id; } } /** * Duplicate string packages. * * @global array() $duplicated_posts Array of duplicated posts. */ function duplicate_wpml_string_packages() { // phpcs:ignore WordPress.NamingConventions.PrefixAllGlobals -- Reason: renaming the function would be a BC-break. global $duplicated_posts; foreach ( $duplicated_posts as $original_post_id => $duplicate_post_id ) { // phpcs:ignore WordPress.NamingConventions.PrefixAllGlobals -- Reason: using WPML native filter. $original_string_packages = apply_filters( 'wpml_st_get_post_string_packages', false, $original_post_id ); // phpcs:ignore WordPress.NamingConventions.PrefixAllGlobals -- Reason: using WPML native filter. $new_string_packages = apply_filters( 'wpml_st_get_post_string_packages', false, $duplicate_post_id ); if ( is_array( $original_string_packages ) ) { foreach ( $original_string_packages as $original_string_package ) { $translated_original_strings = $original_string_package->get_translated_strings( [] ); foreach ( $new_string_packages as $new_string_package ) { $cache = new WPML_WP_Cache( 'WPML_Package' ); $cache->flush_group_cache(); $new_strings = $new_string_package->get_package_strings(); foreach ( $new_strings as $new_string ) { if ( isset( $translated_original_strings[ $new_string->name ] ) ) { foreach ( $translated_original_strings[ $new_string->name ] as $language => $translated_string ) { do_action( // phpcs:ignore WordPress.NamingConventions.PrefixAllGlobals -- Reason: using WPML native filter. 'wpml_add_string_translation', $new_string->id, $language, $translated_string['value'], $translated_string['status'] ); } } } } } } } } nlq-dev開発②差分学習の工程 – Raqqa

nlq-dev開発②差分学習の工程

工程1:学習の保存パイプラインを「確定」する(package→queued→upsert)

目的:コメント差分が 必ず Chroma に「更新」される状態を固定する(入口/出口がこれに依存する)

決定事項(ここで必ず決める)

  1. doc_id 方針(最重要)
  • 「同じ natural_key の学習更新」を成立させるには、Chroma の id自然キー由来で固定にするのが正解
    doc_id = sha256(entity:natural_key:lang)(上書き更新される)
    source_hash は **中身のハッシュ(差分検知・NOP判定用)**として metadata に持つ
  • つまり doc_id ≠ source_hash が基本(今の services/chroma_upsert.py_doc_id() と整合)
  1. Chroma書き込みAPIは add ではなく upsert
  • Chroma 側は add だと「同じidで再投入」や更新運用が破綻しやすいので、upsertに統一(あなたの狙い通り)
  1. metadata の None を禁止
  • 今起きたエラー:Expected metadata value ... got None を二度と出さない
    ✅ ルール:metadata は str/int/float/bool のみ、Noneはキーごと落とす(または空文字)
  1. natural_key の命名規約を固定
  • いまは sid#turnnlq::<sid>::<turn>::cmt::<idx> が混在気味なので、将来の検索/学習利用のために統一する
    例)nlq::<sid>::<turn>::<variant>::<subkey>
    • comment diff:nlq::<sid>::<turn>::cmt::<idx>
    • analysis comment:nlq::<sid>::<turn>::analysis
    • execute要約:nlq::<sid>::<turn>::exec
  1. user_idをどう扱うか(あなたの提案)
  • user_idnatural_key には入れない(入れると更新単位がブレる)
  • 代わりに meta.user_idnlq_history.user_id(列追加)で束ねる
  • 将来「去年のものは捨てる」は **DB側の削除ポリシー(TTL)**で実現

工程2:入口(Metabase結果 → LLMが“最初の分析コメント”を出す)

目的:「LLMが出すコメント」が無いと差分学習が始まらないので、まず 初回コメント生成 を作る

決定事項

  1. 入口API(どこで生成するか)
  • 選択肢A:/nlq/execute の最後に feature flag で自動生成
  • 選択肢B:別API POST /analysis/comment(推奨:切り分けが楽)
  1. 入力に使うデータ(最低限)
  • Metabase の結果は「URL」ではなく、集計結果/列名/条件/期間/粒度(= LLMに渡せる構造)
  • card_id/hash は参照として meta に保持してOK(署名URLは不要)
  1. 保存形式(学習対象として残す単位)
  • 生成物は variant="analysis"(または analysis_comment)として history に保存
  • package 化して portal_chroma_doc に enqueue
  • natural_key は固定:nlq::<sid>::<turn>::analysis
  1. コレクション方針
  • 当面は既定:nlq_sessions_{lang}
  • 後で user_id を入れるなら nlq_users_{lang} に分けるのも可(ただし工程1で決めた meta.user_id が前提)

工程3:出口(学習済み差分 → 次のコメント生成に反映)

目的:差分を貯めるだけでなく、次のコメントを賢くする(あなたが言ってる“命題”)

決定事項

  1. 検索キー(何で過去を引くか)
  • 検索クエリは「ユーザの最新コメント」だけだと弱いので、最低でも
    • ユーザの質問文
    • base SQL(または要約)
    • 生成した analysis comment の要点
      を混ぜたテキストで検索する
  1. フィルタリング(user_id運用をするなら)
  • meta.user_id で絞れるようにしておく(工程1の決定の通り)
  1. 出口の生成対象(何を出すか)
  • 最低ラインは「次の分析コメント案」
  • 余力があれば「SQL改善提案」も一緒に(ただし今はコメント差分が主目的ならコメント優先)
  1. 学習ループの更新単位
  • 「同じ natural_key の更新」は analysiscomment diff は別キーにするのが安全
    • ...::analysis は “そのターンの分析コメント”
    • ...::cmt::idx は “そのターンでユーザが入れた指摘/修正”
  1. 古いものを捨てる運用
  • user_id + created_at でDB側削除(TTL)
  • Chroma 側は「削除」か「再構築」どちらで運用するかを決める(まずはDB TTL→必要なら再upsert)

まとめ(超短縮)

  • 工程1:doc_id固定(自然キー由来)・upsert統一・metadata None禁止・natural_key統一・user_idはmetaで束ねる
  • 工程2:Metabase結果から LLMが初回分析コメントを生成→history保存→package→queued
  • 工程3:学習済み差分を検索で引いて、次のコメント生成に混ぜる(user_idフィルタ可能に)

この3工程の順にやると、入口/出口を作っても「学習の保存」が揺れないので、デバッグが地獄になりません。


Comments

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です