阶段 当前状态 说明 Phase 0~3 基本完成 Document IR、证据链、人工确认、不可变 PlanData Snapshot、海报/PPT 投影已实现 Phase 4 代码完成 场景、策略、模板版本,校验/发布门禁,确定性 resolver 和严格槽位合并已实现 Phase 5 代码完成 输入冻结、PPTX/海报对账、失败关闭、幂等、心跳、重试和冻结输入重放已实现 Phase 6 基础完成 质量看板、结构化告警、Golden 审批、留存清理、孤儿检查和灰度开关已实现 正式上线 未完成 缺真实样本、生产模板、业务规则签字和灰度观察 目前验证基线: PPT/海报专项测试:107 passed, 1 skipped Vue TypeScript 检查:通过 前端生产构建:通过 代码变更仍在工作区,尚未提交 仓库全量测试仍有既有失败/挂起项,暂时不能宣称全仓测试完全绿色 仍未完成的代码任务主要有: 影子解析差异流水线 目前有灰度开关,但还没有完整的“新旧解析同时运行、字段差异入库、按保司/profile 聚合”的影子比较任务。 自动视觉回归 目前实现的是 DOM 模块、溢出、尺寸、文本和数值检查;还缺基于真实模板和标准图片的像素差异、字体缺失、遮挡和裁切回归。 告警通道接入 后台已经能产生结构化质量告警,但尚未自动推送到邮件、企微或其他通知通道。 留存任务生产化 dry-run、实删服务和失败审计已经具备,但尚未接入周期性 Celery/定时任务,也没有自动重试失败清理批次。 旧链路最终下线 旧 PPT 解析器和海报紧凑解析仍保留为回滚路径。需要全量灰度稳定后才能删除或彻底关闭写入口。 全仓测试收口 需要处理现有无关失败和挂起测试,建立真正全绿的 CI 基线。 仍需外部输入和生产环境完成的事项: 至少 30 份脱敏 Golden PDF,并完成双人标注和精确率验收。 业务专家确认派生公式、缺失值、可比较性和结论策略。 上传并标注真实生产 PPTX 的语义 shape、页面类型和容量。 安装生产字体并建立视觉基准图片。 实际执行数据库迁移 038~040。 完成留存 dry-run、实删演练以及 10% → 30% → 100% 灰度。 观察期通过后开启 SCENARIO_ENGINE_V2,目前它仍默认关闭;真实清理开关也默认关闭。 完整状态记录在 [PPT与海报Phase4至6补充实施记录](D:/work/code/python/coding/baodanagent/docs/PPT与海报Phase4至6补充实施记录_20260802.md)。
139 lines
5.8 KiB
Python
139 lines
5.8 KiB
Python
"""Document IR 持久化模型。"""
|
|
import json
|
|
|
|
from sqlalchemy import BigInteger, Column, Float, ForeignKey, Index, Integer, String, Text, TIMESTAMP, UniqueConstraint, func
|
|
|
|
from insurance.db.compat import db
|
|
|
|
|
|
DOCUMENT_ID_TYPE = BigInteger().with_variant(Integer, "sqlite")
|
|
|
|
|
|
def _json_value(value, fallback):
|
|
if not value:
|
|
return fallback
|
|
try:
|
|
return json.loads(value)
|
|
except (TypeError, ValueError):
|
|
return fallback
|
|
|
|
|
|
class InsuranceDocument(db.Model):
|
|
__tablename__ = "insurance_documents"
|
|
__table_args__ = (
|
|
UniqueConstraint("user_id", "sha256", name="uq_insurance_documents_user_sha256"),
|
|
Index("idx_insurance_documents_user_status", "user_id", "status"),
|
|
Index("idx_insurance_documents_expires", "expires_at"),
|
|
)
|
|
|
|
id = Column(DOCUMENT_ID_TYPE, primary_key=True, autoincrement=True)
|
|
user_id = Column(String(64), nullable=False)
|
|
sha256 = Column(String(64), nullable=False)
|
|
storage_key = Column(String(500), nullable=False)
|
|
original_name = Column(String(255), nullable=False)
|
|
mime_type = Column(String(100), nullable=False, default="application/pdf")
|
|
file_size = Column(BigInteger, nullable=False)
|
|
page_count = Column(Integer, nullable=False)
|
|
document_type = Column(String(50), nullable=False, default="plan_illustration")
|
|
pdf_kind = Column(String(20), nullable=False)
|
|
status = Column(String(20), nullable=False)
|
|
parser_version = Column(String(100), nullable=False)
|
|
ocr_version = Column(String(100), nullable=True)
|
|
profile_code = Column(String(100), nullable=True)
|
|
profile_version = Column(String(100), nullable=True)
|
|
quality_json = Column(Text, nullable=True)
|
|
processing_log_json = Column(Text, nullable=True)
|
|
expires_at = Column(TIMESTAMP, nullable=True)
|
|
created_at = Column(TIMESTAMP, server_default=func.now())
|
|
updated_at = Column(TIMESTAMP, server_default=func.now(), onupdate=func.now())
|
|
|
|
def to_public_dict(self) -> dict:
|
|
quality = _json_value(self.quality_json, {})
|
|
return {
|
|
"id": self.id,
|
|
"sha256": self.sha256,
|
|
"originalName": self.original_name,
|
|
"mimeType": self.mime_type,
|
|
"fileSize": self.file_size,
|
|
"pageCount": self.page_count,
|
|
"documentType": self.document_type,
|
|
"pdfKind": self.pdf_kind,
|
|
"status": self.status,
|
|
"parserVersion": self.parser_version,
|
|
"ocrVersion": self.ocr_version,
|
|
"profileCode": self.profile_code,
|
|
"profileVersion": self.profile_version,
|
|
"quality": quality,
|
|
"expiresAt": self.expires_at.isoformat() if self.expires_at else None,
|
|
"createdAt": self.created_at.isoformat() if self.created_at else None,
|
|
"updatedAt": self.updated_at.isoformat() if self.updated_at else None,
|
|
}
|
|
|
|
|
|
class InsuranceDocumentPage(db.Model):
|
|
__tablename__ = "insurance_document_pages"
|
|
__table_args__ = (
|
|
UniqueConstraint("document_id", "page_number", name="uq_insurance_document_pages_number"),
|
|
Index("idx_insurance_document_pages_document", "document_id"),
|
|
)
|
|
|
|
id = Column(DOCUMENT_ID_TYPE, primary_key=True, autoincrement=True)
|
|
document_id = Column(DOCUMENT_ID_TYPE, ForeignKey("insurance_documents.id", ondelete="CASCADE"), nullable=False)
|
|
page_number = Column(Integer, nullable=False)
|
|
width = Column(Float, nullable=False)
|
|
height = Column(Float, nullable=False)
|
|
native_text_quality = Column(Float, nullable=True)
|
|
ocr_quality = Column(Float, nullable=True)
|
|
page_class = Column(String(30), nullable=False)
|
|
text_blocks_json = Column(Text, nullable=True)
|
|
ocr_blocks_json = Column(Text, nullable=True)
|
|
images_json = Column(Text, nullable=True)
|
|
created_at = Column(TIMESTAMP, server_default=func.now())
|
|
|
|
def to_public_dict(self) -> dict:
|
|
return {
|
|
"documentId": self.document_id,
|
|
"pageNumber": self.page_number,
|
|
"width": self.width,
|
|
"height": self.height,
|
|
"pageClass": self.page_class,
|
|
"nativeTextQuality": self.native_text_quality,
|
|
"ocrQuality": self.ocr_quality,
|
|
"textBlocks": _json_value(self.text_blocks_json, []),
|
|
"ocrBlocks": _json_value(self.ocr_blocks_json, []),
|
|
"images": _json_value(self.images_json, []),
|
|
}
|
|
|
|
|
|
class InsuranceDocumentTable(db.Model):
|
|
__tablename__ = "insurance_document_tables"
|
|
__table_args__ = (
|
|
UniqueConstraint("document_id", "table_id", name="uq_insurance_document_tables_table"),
|
|
Index("idx_insurance_document_tables_document", "document_id"),
|
|
)
|
|
|
|
id = Column(DOCUMENT_ID_TYPE, primary_key=True, autoincrement=True)
|
|
document_id = Column(DOCUMENT_ID_TYPE, ForeignKey("insurance_documents.id", ondelete="CASCADE"), nullable=False)
|
|
table_id = Column(String(100), nullable=False)
|
|
scenario_type = Column(String(50), nullable=False, default="unknown")
|
|
headers_json = Column(Text, nullable=True)
|
|
rows_json = Column(Text, nullable=True)
|
|
source_pages_json = Column(Text, nullable=True)
|
|
continuation_of = Column(String(100), nullable=True)
|
|
bbox_json = Column(Text, nullable=True)
|
|
conflicts_json = Column(Text, nullable=True)
|
|
created_at = Column(TIMESTAMP, server_default=func.now())
|
|
|
|
def to_public_dict(self) -> dict:
|
|
return {
|
|
"documentId": self.document_id,
|
|
"tableId": self.table_id,
|
|
"scenarioType": self.scenario_type,
|
|
"headers": _json_value(self.headers_json, []),
|
|
"rows": _json_value(self.rows_json, []),
|
|
"sourcePages": _json_value(self.source_pages_json, []),
|
|
"continuationOf": self.continuation_of,
|
|
"bbox": _json_value(self.bbox_json, None),
|
|
"conflicts": _json_value(self.conflicts_json, []),
|
|
}
|