baodan/api/insurance/models/insurance_document.py
wsb1224 2422303b36 前工程开发已经推进到 Phase 6 基础能力,但正式验收还没有完成。更准确地说:Phase 0~5 的主要代码链路已经落地,Phase 6 完成了治理框架,尚缺生产化和真实数据验收。
阶段	当前状态	说明
Phase 0~3	基本完成	Document IR、证据链、人工确认、不可变 PlanData Snapshot、海报/PPT 投影已实现
Phase 4	代码完成	场景、策略、模板版本,校验/发布门禁,确定性 resolver 和严格槽位合并已实现
Phase 5	代码完成	输入冻结、PPTX/海报对账、失败关闭、幂等、心跳、重试和冻结输入重放已实现
Phase 6	基础完成	质量看板、结构化告警、Golden 审批、留存清理、孤儿检查和灰度开关已实现
正式上线	未完成	缺真实样本、生产模板、业务规则签字和灰度观察

目前验证基线:
PPT/海报专项测试:107 passed, 1 skipped
Vue TypeScript 检查:通过
前端生产构建:通过
代码变更仍在工作区,尚未提交
仓库全量测试仍有既有失败/挂起项,暂时不能宣称全仓测试完全绿色
仍未完成的代码任务主要有:
影子解析差异流水线
目前有灰度开关,但还没有完整的“新旧解析同时运行、字段差异入库、按保司/profile 聚合”的影子比较任务。

自动视觉回归
目前实现的是 DOM 模块、溢出、尺寸、文本和数值检查;还缺基于真实模板和标准图片的像素差异、字体缺失、遮挡和裁切回归。

告警通道接入
后台已经能产生结构化质量告警,但尚未自动推送到邮件、企微或其他通知通道。

留存任务生产化
dry-run、实删服务和失败审计已经具备,但尚未接入周期性 Celery/定时任务,也没有自动重试失败清理批次。

旧链路最终下线
旧 PPT 解析器和海报紧凑解析仍保留为回滚路径。需要全量灰度稳定后才能删除或彻底关闭写入口。

全仓测试收口
需要处理现有无关失败和挂起测试,建立真正全绿的 CI 基线。

仍需外部输入和生产环境完成的事项:
至少 30 份脱敏 Golden PDF,并完成双人标注和精确率验收。
业务专家确认派生公式、缺失值、可比较性和结论策略。
上传并标注真实生产 PPTX 的语义 shape、页面类型和容量。
安装生产字体并建立视觉基准图片。
实际执行数据库迁移 038~040。
完成留存 dry-run、实删演练以及 10% → 30% → 100% 灰度。
观察期通过后开启 SCENARIO_ENGINE_V2,目前它仍默认关闭;真实清理开关也默认关闭。
完整状态记录在 [PPT与海报Phase4至6补充实施记录](D:/work/code/python/coding/baodanagent/docs/PPT与海报Phase4至6补充实施记录_20260802.md)。
2026-08-02 16:34:06 +08:00

139 lines
5.8 KiB
Python

"""Document IR 持久化模型。"""
import json
from sqlalchemy import BigInteger, Column, Float, ForeignKey, Index, Integer, String, Text, TIMESTAMP, UniqueConstraint, func
from insurance.db.compat import db
DOCUMENT_ID_TYPE = BigInteger().with_variant(Integer, "sqlite")
def _json_value(value, fallback):
if not value:
return fallback
try:
return json.loads(value)
except (TypeError, ValueError):
return fallback
class InsuranceDocument(db.Model):
__tablename__ = "insurance_documents"
__table_args__ = (
UniqueConstraint("user_id", "sha256", name="uq_insurance_documents_user_sha256"),
Index("idx_insurance_documents_user_status", "user_id", "status"),
Index("idx_insurance_documents_expires", "expires_at"),
)
id = Column(DOCUMENT_ID_TYPE, primary_key=True, autoincrement=True)
user_id = Column(String(64), nullable=False)
sha256 = Column(String(64), nullable=False)
storage_key = Column(String(500), nullable=False)
original_name = Column(String(255), nullable=False)
mime_type = Column(String(100), nullable=False, default="application/pdf")
file_size = Column(BigInteger, nullable=False)
page_count = Column(Integer, nullable=False)
document_type = Column(String(50), nullable=False, default="plan_illustration")
pdf_kind = Column(String(20), nullable=False)
status = Column(String(20), nullable=False)
parser_version = Column(String(100), nullable=False)
ocr_version = Column(String(100), nullable=True)
profile_code = Column(String(100), nullable=True)
profile_version = Column(String(100), nullable=True)
quality_json = Column(Text, nullable=True)
processing_log_json = Column(Text, nullable=True)
expires_at = Column(TIMESTAMP, nullable=True)
created_at = Column(TIMESTAMP, server_default=func.now())
updated_at = Column(TIMESTAMP, server_default=func.now(), onupdate=func.now())
def to_public_dict(self) -> dict:
quality = _json_value(self.quality_json, {})
return {
"id": self.id,
"sha256": self.sha256,
"originalName": self.original_name,
"mimeType": self.mime_type,
"fileSize": self.file_size,
"pageCount": self.page_count,
"documentType": self.document_type,
"pdfKind": self.pdf_kind,
"status": self.status,
"parserVersion": self.parser_version,
"ocrVersion": self.ocr_version,
"profileCode": self.profile_code,
"profileVersion": self.profile_version,
"quality": quality,
"expiresAt": self.expires_at.isoformat() if self.expires_at else None,
"createdAt": self.created_at.isoformat() if self.created_at else None,
"updatedAt": self.updated_at.isoformat() if self.updated_at else None,
}
class InsuranceDocumentPage(db.Model):
__tablename__ = "insurance_document_pages"
__table_args__ = (
UniqueConstraint("document_id", "page_number", name="uq_insurance_document_pages_number"),
Index("idx_insurance_document_pages_document", "document_id"),
)
id = Column(DOCUMENT_ID_TYPE, primary_key=True, autoincrement=True)
document_id = Column(DOCUMENT_ID_TYPE, ForeignKey("insurance_documents.id", ondelete="CASCADE"), nullable=False)
page_number = Column(Integer, nullable=False)
width = Column(Float, nullable=False)
height = Column(Float, nullable=False)
native_text_quality = Column(Float, nullable=True)
ocr_quality = Column(Float, nullable=True)
page_class = Column(String(30), nullable=False)
text_blocks_json = Column(Text, nullable=True)
ocr_blocks_json = Column(Text, nullable=True)
images_json = Column(Text, nullable=True)
created_at = Column(TIMESTAMP, server_default=func.now())
def to_public_dict(self) -> dict:
return {
"documentId": self.document_id,
"pageNumber": self.page_number,
"width": self.width,
"height": self.height,
"pageClass": self.page_class,
"nativeTextQuality": self.native_text_quality,
"ocrQuality": self.ocr_quality,
"textBlocks": _json_value(self.text_blocks_json, []),
"ocrBlocks": _json_value(self.ocr_blocks_json, []),
"images": _json_value(self.images_json, []),
}
class InsuranceDocumentTable(db.Model):
__tablename__ = "insurance_document_tables"
__table_args__ = (
UniqueConstraint("document_id", "table_id", name="uq_insurance_document_tables_table"),
Index("idx_insurance_document_tables_document", "document_id"),
)
id = Column(DOCUMENT_ID_TYPE, primary_key=True, autoincrement=True)
document_id = Column(DOCUMENT_ID_TYPE, ForeignKey("insurance_documents.id", ondelete="CASCADE"), nullable=False)
table_id = Column(String(100), nullable=False)
scenario_type = Column(String(50), nullable=False, default="unknown")
headers_json = Column(Text, nullable=True)
rows_json = Column(Text, nullable=True)
source_pages_json = Column(Text, nullable=True)
continuation_of = Column(String(100), nullable=True)
bbox_json = Column(Text, nullable=True)
conflicts_json = Column(Text, nullable=True)
created_at = Column(TIMESTAMP, server_default=func.now())
def to_public_dict(self) -> dict:
return {
"documentId": self.document_id,
"tableId": self.table_id,
"scenarioType": self.scenario_type,
"headers": _json_value(self.headers_json, []),
"rows": _json_value(self.rows_json, []),
"sourcePages": _json_value(self.source_pages_json, []),
"continuationOf": self.continuation_of,
"bbox": _json_value(self.bbox_json, None),
"conflicts": _json_value(self.conflicts_json, []),
}