huawu矿业 / 矿业项目评估
MODEL INTEGRATION · 2026.10.06
v1.1 · 设计建议稿
系统设计与Astra方案的整合入口。仅更新设计,未接入真实模型或启动训练。 首期模拟交付不变;新增后续模型及训练条款尚未实施。

huawu矿业:Z.ai 后训练能力与系统设计整合

版本:v1.1 / 设计建议稿
日期:2026年10月6日
依据:系统设计v1.0、GPT-6 Astra《模型应用与专项训练方案v2.0》
状态:仅更新设计;未接入模型、建立数据服务或启动训练

1. 本次整合的决定

将后训练得到的模型作为系统可选的任务执行模型,而不是增加一个独立聊天产品。专项训练用于提高识别、字段抽取、证据标注和任务建议质量;项目知识更新依靠带版本的资料和检索,金额仍由确定性计算产生。训练是否值得开展,由真实资料评测决定。

交付层 本次设计纳入 实施边界
首期模拟演示 保留四案例、模拟分析、人工核验、计算、报告和各设备保存 不新增真实调用、上传、后台或训练;不伪造“专用模型已训练”
后续无训练试点 真实资料解析、项目隔离检索、现成Z.ai模型、草稿复核、版本与运行记录 数据授权、处理地点、合作资源及专家评测落实后实施
后续专项训练试点 经授权的纠错样本、离线SFT/LoRA、独立验证、模型版本发布与回滚 六项训练门槛同时成立后启动;不做自动在线学习
正式使用 有限范围推广、权限、审计、恢复和持续回归 单独验证生产要求;浏览器本地保存不代替正式资料保护

本次请求授权设计整合,不等于启动真实服务或训练。既定业务仍以藏川滇三江成矿带为重点、兼顾海外、一般同时少于10个项目;无销售管理、最终投资审批或统一收益门槛。

2. 模型能力映射到业务页面

能力ID 专项能力与训练目标 系统位置 产物及限制
AI-01 文档/化验表识别;仅对反复出现的版面识别错误考虑OCR适配 资料与证据 页面、表格、原始数字与单位;保留图像,不把识别失败当缺项
AI-02 带证据位置的结构化抽取;适合专家标注后的SFT/LoRA 资料核验、估值输入建议 资源类别、数量、品位、主体、日期、试验条件及交易字段;待核验,不自动进入估值
AI-03 矛盾、缺失与已知风险线索;规则配合检索 风险页 并列来源与待查事项;不能自行定性造假或确认法律阻断
AI-04 根据证据提出验证任务;专项训练只改善已定义输出行为 价值提升计划 当前未知、证据、前置条件、成功/失败与停止条件;成本无依据时待估
AI-05 有引用的问答和报告草稿;后续可评估稳定专家偏好的DPO 分析、报告 事实、未知、冲突、假设和计算引用分别呈现;禁止无依据关键结论
AI-06 专家纠错到训练候选样本 核验记录;管理侧样本治理 使用权、项目隔离、复核与准入;修正业务数据不等于授权训练
AI-07 发布、版本锁定、失败处理与回滚 管理侧模型台账;业务侧只显示运行来源 运行和报告固定模型版本;新模型不回写历史结果

模型不能升级资源类别、推定可采储量、替代空间建模、决定收购价、投资批准或交易放行。被证实造假后的独立重建通过既有重评路径形成新版本,保留原资料、认定依据和历史,不把旧版本纠错样本自动加入训练。

3. 在线业务与离线训练的关系

授权原件
版本、项目与处理范围
→
解析与检索
先按项目及权限过滤
→
模型任务
现成或已发布的专项模型
→
待核验草稿
引用及结构校验
→
专家确认与计算
既有领域状态和公式

离线训练链:授权的专家纠错 → 样本复核 → 按项目划分训练/验证/封存测试 → 固定底模训练 → 独立评测 → 登记可用版本 → 后续业务请求选择该版本。线上项目资料不通过请求自动更新权重。

3.1 后续试点的最小模块

Module Interface职责 隐藏的Implementation与约束
资料与证据模块 保存原件、定位证据、查询项目内资料 文件解析、关键词索引、版本与来源校验;先用关键词和元数据,效果不足再增加向量检索
模型任务模块 创建、查询及取消分析任务;返回统一草稿 授权、受控检索、模型版本、超时、输出检查和运行记录集中处理
现有领域与计算模块 接受人工确认的字段变更、重算及生成快照 保留原值、核验状态、依赖变化、权益和现金流校验;不信任模型金额
离线评测与训练模块 产出数据版本、评测记录和候选模型版本 样本权利、隔离、训练配方、复现、失败样本;不由普通项目页面发起训练

首期不提前创建这些后台Module。实际接入时只实现已选部署路径的一个模型Adapter;未来基础模型与微调版本通常只需要更换模型配置,不为每个任务另建服务。采用一个受控应用后端、授权文件存储和必要元数据记录即可起步,不默认微服务、图数据库、消息队列或智能体集群。

3.2 部署和设备保存

真实模型密钥只在受控服务器保存。浏览器使用受验证的会话访问后端;项目权限在后端执行,不能只靠传入projectId。训练机器与在线推理分开运行,GPU/NPU配置由指定负载测试确定。

后续试点可以采用合作API或受控私有推理之一;训练产物须通过该路径的加载验证。合作API若不支持公司适配器/权重,不能声称API已使用专项模型,应另选支持的受控推理路径。

各设备独立保存的首期要求不变。真实试点上传的授权原件及运行记录可以保存在约定服务器;这不自动开启工作区、参数或核验状态跨设备同步。服务器保留什么、保留多久及哪些人员访问,在试点数据流中明确。真实凭据和敏感原件不放入localStorage;真实资料保存方式另行设计并验收。

4. 共享数据与任务契约

以下为后续试点的逻辑契约,不修改首期schemaVersion=1或固定案例算例。后续存储升级需单独迁移检查,不能让旧浏览器静默覆盖新格式。

4.1 事实与来源

FactCandidate包含id、projectId、targetField、rawValue、rawUnit、normalizedValue、normalizedUnit、conversionRuleVersion、objectScope、reportStandard、reportStandardVersion、asOfDate、sourceRefs、status、runId。数值未知为null,低于检测限/区间另存限定,不强制变零。

SourceRef包含projectId、documentId、documentVersion、fileHash、PDF物理页码、印刷页码、bbox或表格单元格、quote和来源类型。引用必须定位到请求时的资料版本;页码正确但不支持主张仍判失败。原报告陈述、专家确认、计算、假设分别存放,不共用一个“可信度”字段。

4.2 AnalysisRun与统一产物

对象 主要字段和约束
请求 projectId、taskType、inputRevision、documentVersionIds、question或targetFields、clientRequestId;后端从会话确定操作者与授权,不信任客户端角色
AnalysisRun runId、projectId、taskType、inputRevision、evidenceManifestHash、modelReleaseId、promptVersion、retrievalVersion、schemaVersion、calculationRuleVersion、startedAt、finishedAt、status、errorCode、usage;日志不默认记录原件全文
AnalysisDraft draftId、runId、facts、claims、conflicts、missingItems、suggestedActions、calculationRefs、limitations、reviewState;只作为草稿,不执行修改
ModelRelease releaseId、baseModel及快照/API版本、adapter/weightHash可空、precision、训练数据及配方版本、评测记录、支持任务、许可、deploymentPath、状态及previousReleaseId
ReviewRecord draftId、runId、candidateId、采纳/修改/驳回、理由、确认后业务版本、复核人和时间;训练授权独立记录

claims每项关联sourceRefs或calculationRefs。计算引用保存scenarioId、输入版本、公式版本与结果哈希;模型不能以生成文本替代公式输出。动态API无法固定版本时记录这一限制,不能承诺精确复现。

4.3 Interface与错误行为

建议后续HTTP入口:POST /projects/{id}/analysis-runs,GET /projects/{id}/analysis-runs/{runId},DELETE /projects/{id}/analysis-runs/{runId}。三者都检查项目权限;DELETE表示请求取消,不表示抹除运行记录。首轮查询进度即可,不预设流式输出或消息队列。

相同授权人、项目与clientRequestId只创建一个任务;相同ID配不同请求拒绝。任务返回queued/running/succeeded/partial/needs_evidence/failed/cancelled;模型调用成功但输出无效属于failed,不伪装succeeded。可展示有效子项,但整体标记partial并禁止批量采纳。取消与完成竞争时按服务器已登记的终态返回,不能将已完成任务改为已取消或重复产生结果;取消不撤销已由用户确认的业务修改。

错误区分unauthorized、invalid_input、missing_evidence、unsupported_task、timeout、provider_unavailable、invalid_output、stale_input、budget_exceeded。不得在响应里暴露其他项目内容、服务密钥或服务商内部信息。

模型任务不自动调用applyCommand。用户采纳字段时重新检查inputRevision、当前资料版本、SourceRef和数值口径;旧任务结果标记stale_input,用户需重新分析或逐项复核。审核通过后才调用既有领域命令和finance;失败不改变原工作区。任务取消、重复请求或服务恢复不能重复写入费用/核验结果。

5. 模型与后训练的接入策略

模型官方事实及固定来源沿用Astra方案v2.0,本文件不追加新的性能或硬件结论。

任务 首轮候选 后训练接入条件
OCR GLM-OCR;电子表格/文本先直接读取 版面识别模型存在稳定错误、有标注及官方配方验证;产物通过独立页面/表格测试
图文及综合证据草稿 实际可获得的GLM-5.3-Flash合作服务 大型320B总/18B激活;MIT不代表低成本;不预设训练此模型
文本字段与报告 GLM-4.7-Flash成本对照;需要时追加GLM-5.3 指定版本的训练配方另核实;5.3为自定义许可,不能沿用其他模型MIT结论
较小模型专项训练 按效果及配方选择GLM-OCR或9B-0414等 小模型先达到任务基线;旧视觉仓库维护与合作支持需确认

SFT训练带证据的目标行为,LoRA是更新部分参数的方式,两者可同时采用。DPO仅在事实可靠、专家偏好稳定后评估;强化学习与继续预训练均不设为默认阶段。资源标准、法规和实时项目事实不靠微调权重保存。没有适配收益时使用基础版本,模型不可用时继续人工核验。

6. 样本治理、评测与发布

6.1 六项训练门槛

  1. 错误跨项目反复出现且归因明确。若目标是OCR适配,应证明错误来自识别模型;若目标是文本抽取,应先排除上游OCR、检索、资料缺失或公式错误。
  2. 已有提示、结构约束、规则和检索的可复现基线,存在值得投入的差距。
  3. 样本合法可用、专家确认,按项目及报告血缘隔离;封存测试不参与调优。
  4. 指定底模、精度、更新模块和训练框架跑通最小训练与产物加载;资源责任与预算明确。
  5. 预先确定目标收益、重大错误不得恶化、完整项目成本及停止条件。
  6. 数据、标注、适配器、权重、配方与日志归属和导出权明确;保留基础版本回滚。

采纳/修改/驳回记录仅作为候选,不自动成为标签。样本必须经授权、脱敏或批准的原文使用、专家仲裁、质量检查。删除资料时检查切片、索引、日志和训练副本;已进入权重的数据无法承诺一键删除影响,须在训练前约定重新训练/退役等处理,保留合法的最小版本记录。

6.2 数据隔离与比较

按项目、报告版本和衍生问答保持同组;相关矿区和重复模板检查泄漏。用训练集训练、验证集选择模型/提示/阈值,最终封存测试仅验收。封存结果不通过时记录失败,下一轮更换封存集或另留未触碰数据,不能反复调到该测试通过后称独立泛化。

实测比较人工/规则、基础模型、基础模型+检索、同底模专项模型+同检索。标准证据包用于定位模型瓶颈,实际检索结果用于端到端验收。衡量关键数字和单位、引用支持、已知重大风险召回/误报、未知处理、复核工时、项目成本和延迟。按项目报告分母,模型裁判仅辅助。

6.3 ModelRelease生命周期

候选 → 已评测 → 已登记可用 → 在限定任务启用 → 停用/回滚。发布是技术版本启用,不是投资审批。每次运行开始时固定releaseId,更新默认版本只影响新任务。报告保存草稿、证据、复核、输入及计算快照,不因升级重生成旧内容。

升级前跑回归与相同负载成本测试;限定范围问题触发停用候选并回滚配置,旧运行记录保留。发布登记与授权人员复核不同于日常业务人员点击“采用建议”。API权重加载和适配器可用性需合作方实际验证,不能只记录一个模型名称就称后训练已接入。

7. 文档追踪与并行开发顺序

能力 SPEC 设计 架构 任务 验收
AI-01/02 S-AI-01/02 D-AI-01 A-AI-01/02 J-AI-01/02 AT-01/02/03
AI-03/04 S-AI-03/04 D-AI-02/03 A-AI-02/03 J-AI-02/03 AT-04/05/06
AI-05 S-AI-05 D-AI-04 A-AI-03 J-AI-03 AT-07/08
AI-06 S-AI-06 D-AI-05 A-AI-04 J-AI-04 AT-09/10
AI-07 S-AI-07 D-AI-06 A-AI-04/05 J-AI-00/04 AT-11/12/13/14

六份系统文档v1.1分别补充相关条款,原S/D/A/J/T及FR/AC编号不变。首期开发任务仍独立;真实模型任务在资料与接口冻结后分批执行,最多3个开发agent加1个集成负责人。不在本次设计工作中派发开发。

8. 本次交付与待落实条件

本次提供整合说明、需求、SPEC、交互、架构契约、Agent任务和验收计划v1.1。文档检查不能代替产品或模型验收,全部后续用例标记未执行。

进入真实试点前需确定可用API/权重版本、数据与成果条款、部署路径、历史资料授权、评测专家、页数/文件大小/并发负载及预算。试点评测数量沿用Astra建议作为起点,不能当作公司已有资料量或训练充分性保证。未明确的硬件、成本、准确率和目标国家法规继续列为待确认。

9. 一个专项能力如何进入评估流程

以下为设计示例,不是已完成的训练结果:化验表经常把“1%”识别成“1”,先判断错误发生在OCR还是字段规范化。若电子原件已正确、错误仅来自单位抽取,训练目标就是带来源的数值和单位抽取,不去重训OCR。

专家确认样本并获授权后,以同底模比较训练前后在未见项目的错误;产物验证通过才登记专项版本。业务运行生成“100万吨矿石、1%品位”的待核验字段,用户核对原件并确认后,计算模块得到1万吨含金属量。报告注明原件、复核、模型和公式版本,不进一步推断可采量、收入或收购价格。若模型仍输出1且没有单位,系统拦截而不是用该值计算。