huawu矿业 / Z.ai 调研评审
REVIEW BY GPT-6 ASTRA · 2026.10.05
独立评审 · 文档阶段
由用户指定的GPT-6 Astra审核。评审内容按原稿呈现,保留已证实、待核实及建议的区别;未执行模型部署或训练。

huawu矿业:Z.ai 模型与训练路线独立评审

评审者:GPT-6 Astra。评审日期:2026年10月5日。

评审对象:原《Z.ai模型与训练路线》HTML及其三份研究底稿。已重新读取官方模型卡、权重许可证、官方仓库和训练说明;未下载权重、部署模型、运行训练或测量矿业任务效果。

一、结论先行

原方案的总体方向成立,但还不能作为选型、采购或训练立项依据。 “先用现成模型建立基线,再建设有来源的知识库,最后针对稳定错误决定是否微调”值得保留。主要缺口是候选信息不够新、最新版本许可与训练支持未纳入,以及矿业任务的验收规则和数据边界不够具体。

建议先做一个小而可验证的文档与证据试点,再决定是否拥有专用权重。 深度合作的首要价值应落在获得准确版本、受控数据通道、工程支持及联合评测,而不是预设必须训练大模型。

最先应改五项:

  1. 更新候选和维护状态。 纳入 GLM-5.3-Flash 作为合作 API/受控服务器的多模态质量对照;纳入 GLM-5.3 作为可选文本质量对照。保留 GLM-OCR 和较小模型作为成本、隐私及部署对照,不能只因版本号更新就替换。
  2. 补上版本级许可及训练证据。 GLM-5.3 是自定义许可,GLM-5.3-Flash 是 MIT;当前 GLM-5 仓库已列出微调框架支持。把“有许可”“框架支持”“跑通训练”“矿业效果提升”写成四个不同结论。
  3. 定义关键事实的结构和拦截条件。 资源类别、矿石量与金属量、单位、报告时点、采选试验条件、交易权益及债务必须有来源;没有证据或存在冲突时进入待核验状态。
  4. 冻结真实评测集与训练门槛。 四个模拟案例只能验界面和流程;先用授权资料建立按项目隔离的测试集,比较人工/规则、现成模型、检索增强及专项微调的差异。
  5. 先画清数据路径和成果归属。 电脑和手机分别本地保存,不代表调用模型时数据不出设备。明确 API、私有部署、训练及日志的数据流,合同覆盖样本、标注、适配器、权重、日志和退出迁移。

范围保持:首期仍是四个模拟案例的 UI 和决策支持演示,电脑与手机各自本地保存。首期不接入真实 AI、不上传真实矿业资料、不开展训练,也不加入买家需求/销售管理或最终投资审批。 以下真实模型试点是后续独立工作包。

二、问题清单:按影响排序

严重程度说明:P1 为进入真实试点前必须处理;P2 为选型或试点评测时应补齐。它们不是当前模拟界面存在损失或泄露的认定。

编号 严重度与问题 已有证据 影响及修正
R1 P1:主候选遗漏较新的模型和旧视觉仓库维护声明 官方已发布 GLM-5.3/5.3-Flash;GLM-V README 明确标注 2026-09-02 不再维护该仓库,并引导新模型讨论至 GLM-5 仓库。[S1][S2][S3] 原稿明确“非穷尽清单”,因此不是虚称最新;但仍优先推荐 4.6V-Flash 而未说明维护状态,可能影响长期支持选择。补新系列对照;旧模型保留为小型部署候选,要求合作方确认维护责任。仓库声明不等于所有推理框架都停止支持旧权重。
R2 P1:最新型号不能沿用“GLM 权重均 MIT”的印象 GLM-5.3 权重卡标 other,独立 LICENSE 为 GLM-5.3 License;5.3-Flash 有独立 MIT LICENSE。[S4][S5] 原稿对已列旧型号的 MIT 判断基本正确,缺口发生在扩展候选时。新增 5.3 必须单列许可;不能把代码 Apache-2.0 或 Flash 的 MIT 外推到旗舰。
R3 P1:缺少资源分类、数值口径和权益数据的发布拦截条件 原稿仅笼统写“字段单位、分类、规则、专家确认”;公司业务依靠补勘、采选论证和许可改善项目可信度与退出条件。 分类误映射、矿石量当金属量、实验室回收率当工业指标、企业价值当股权对价,均可系统性扭曲结果。按第五节设置结构化字段和确定性校验,关键冲突不能自动进入估值。
R4 P1:真实数据试点边界未落实到数据流和权限 原稿提到保密、归属,但未定义资料、检索库、提示、日志、备份分别去向;首期要求每台设备本地保存。 容易把“本地保存”误解为“全程本地处理”。真实接入前明确每段数据通道及访问范围;不能在浏览器内嵌合作 API 密钥,不能默认跨项目检索或允许服务商训练。
R5 P2:GLM-5 微调信息不完整 当前官方仓库新增“Fine-tuning GLM-5 Series Models”,列 Slime 0.3.0+ 与 ms-swift 4.4.0+,后者支持 SFT、PPO、GRPO。[S1] 原稿只说官方采用 slime 后训练,这句话本身成立,但已不足以描述当前支持。更新为“已有官方列举的框架路径;具体子型号、精度、训练方式与硬件仍须验证”。不能反向推成所有 5.x 变体都已有同样的 LoRA 配方。
R6 P2:只有指标名,没有可执行评测协议和门槛 原稿列字段正确率、引用准确率、风险召回等,但无样本分层、判分规则、配对比较、重大错误处理。 无法说明微调究竟改善哪种错误,也容易用少数漂亮案例立项。采用第六、七节的隔离测试、错误分层及继续/停止门槛。
R7 P2:业务增值链与检索设计仍偏通用 原稿的“增值计划、报告表达”没有绑定不确定性、验证任务、成本、成功条件和停止条件;检索只描述到页码段落。 容易输出好看的任务清单,却无法回答“这项勘探支出消除什么不确定性”。补证据对象、阶段任务、情景条件及失败后的安排;保留项目、权属主体、时点、矿种和空间范围过滤。
R8 P2:硬件例表可能被误读为普遍最低要求 原稿基本保留了配置条件;但“服务器内存 >1TB”来自特定 GLM-4.5 官方表,并非所有架构的普遍下限。[S8] 保留为参考配置,增加精度、上下文、并发、推理框架、卸载策略与试验版本;不据此直接报价或采购,也不按 MoE 激活参数计算全部权重占用。

三、官方事实复核:哪些成立,哪些需要更新

3.1 原稿中可保留的结论

原结论 复核结果与边界
GLM-OCR 官方标称 0.9B,模型 MIT、代码 Apache-2.0,布局组件另有许可 成立。官方 README 明确区分模型、代码及 PP-DocLayoutV3。[S6] 官方通用识别成绩不能证明矿业扫描件准确率。
GLM-OCR 有官方微调教程,使用第三方 LLaMA-Factory 成立。教程给 LoRA 单卡 ≥8GB、full ≥24GB 的示例;full 配置确实冻结视觉编码器与投影器,仅训练语言部分。[S7] 这些是示例条件,不是任意分辨率、长表格或批量的保证。
GLM-4.6V-Flash 9B、4.6V 106B,权重卡 MIT 成立。官方描述 128K 训练上下文及原生工具调用。[S3][S10] 但没有经本评审验证的地质图空间推理表现。
GLM-4.7-Flash 30B 总参数、3B 激活 成立。[S11] 它仍可作为相对较小的文本对照,不等于 3B 权重装载。
GLM-4.5/Air 355B/32B 与 106B/12B;官方列第三方训练路径 成立。[S8] 原稿引用的 H100、H20 训练例表及推理/训练区分基本准确。
GLM-5 为 744B 总参数、40B 激活,原版权重卡 MIT 成立。[S12] 当前候选更新时须区分原版 GLM-5 与 GLM-5.3。
GLM-4-9B-0414 有官方列出的 LoRA 22GB 和 ZeRO3 约55GB×4参考 成立。[S9] 官方也说明 9B 未获得 32B 同等智能体增强;保留作窄任务训练可行性对照,而非默认综合分析主力。[S13]
4.6V/Flash 的专项训练支持不能从旧视觉教程外推 这种谨慎成立。GLM-V 微调段落明确列的是 4.5V 和 4.1V-9B-Thinking。[S3] 此段未列新型号不等于新型号一定不能训练。
模型许可不授予矿业资料使用权,知识库不等于训练 成立。API 数据条款、资料授权和合作成果归属需要分别落实。

3.2 必须补充的新事实

GLM-5.3-Flash 是大型原生多模态模型。 官方卡列 320B 总参数、18B 激活,支持图文输入,权重 MIT。官方仓库列默认发行版 FP8,并另列 BF16 版本。[S1][S2][S5] 名称里的 Flash 不能作为普通电脑可本地部署的依据,更不能拿 18B 激活参数当总显存预算。本评审未验证它的矿业效果或全套部署最小硬件。

GLM-5.3 是不同许可的文本候选。 官方仓库列 744B/40B,FP8 与 BF16 权重分别发布;权重卡是 text-generation。[S1][S4] 它与 5.3-Flash 的架构、输入能力、总规模及许可都不同,不应只当成速度不同的两个档位。

GLM-5.3 自定义许可仍允许使用、部署、修改、微调和衍生作品,但附条件。 独立许可规定:若被许可方或关联方经营“模型即服务”,且被许可方及关联方任意连续12个月累计总收入超过100亿美元,商业使用前须通过 Z.AI 安全审查;许可也明确排除仅在特定功能中嵌入模型的终端产品等情形。[S4] 不能把此条简化成“所有商业使用需审批”。普通矿业内部应用不因使用模型自动触发该条,但实际关联主体和服务模式仍应由合同核对。本评审不是法律意见。

GLM-5 系列已有官方列举的微调框架。 Slime 0.3.0+、ms-swift 4.4.0+ 的支持声明需要写入原稿;它并未给本项目提供已验证的全套矿业 SFT 硬件与效果承诺。[S1] 框架列在“本地部署”章节也不能单独作为训练支持证据。

版本必须包括权重变体和快照。 除模型名,还应记录权重提交号、FP8/BF16、分词器及聊天模板、推理框架、训练框架、上下文限制、思考参数。5.3 系列官方说明 reasoning_effort 默认 max;如果评测一边用低思考、一边用最高思考,成本与延迟比较会失真。[S1][S2]

本次核验到的两份新权重快照:GLM-5.3 为 aca966e4e02791568aa6a4ced368624b3d897f42;GLM-5.3-Flash 为 eb9eb208eb0d988989d07a6a12d0fdeb5f52574a。它们是本次证据定位,不代表必须选择这两个版本生产上线。

四、建议候选组合:按任务和约束选择

层次 首轮候选与用法 选择条件
原文与表格获取 先使用 PDF 已有文字与原始电子表格;扫描件/复杂版面用 GLM-OCR 保留原文件、页面图与表格结构,不能把原本准确的电子表格先转图片再识别。OCR 结果单独评测。
页面及图件理解 GLM-5.3-Flash 经合作 API/受控服务器做质量对照;GLM-4.6V-Flash 做小型部署对照 前者需明确数据条款与算力;后者需明确版本及维护责任。对地质图做页面观察与证据定位,不默认其可完成可靠坐标变换或资源建模。
文本证据整理与报告 首选比较 GLM-4.7-Flash 与合作方实际可提供的 GLM-5.3;也可直接测试 5.3-Flash 是否已能覆盖文本任务 每个模型用同一证据包、输出结构和计算工具。若同一模型已满足要求,不额外建设复杂多模型调度。API 型号须由合作方确认,不从权重名猜测。
专项训练 优先 GLM-OCR 的识别适配;文本窄任务按实测选择 4.7-Flash 或 9B-0414 等可验证训练路径 4.7-Flash 训练支持仍需具体配方核实;9B 教程清晰不等于效果一定好。只有基础版本先达到可用水平,且错误确属模型适配时才训练。
暂不作为默认训练对象 GLM-4.5/Air、GLM-5、GLM-5.3 和大型多模态旗舰 已有专项合作算力、需要的能力、配方与独立评测收益均得到证明时再评估。教程齐全或合作紧密都不是单独的训练理由。

这不是采购名单。首轮宜控制在两到三个实际可获得的推理候选,加一个 OCR 方案。最终同时比较任务质量、专家复核时间、每个完整项目处理成本、等待时间和维护负担;不采用官方通用榜单替代矿业测试。

五、业务方案需要补齐的具体约束

以下是针对huawu矿业业务的设计建议,不是已经证明模型具备这些能力,也不是对任何具体矿权的法律判断。

5.1 从“文档字段”升级为可追溯的事实记录

每条关键事实至少记录:项目与持权主体、对象及空间范围、原始字段、原始值与单位、标准化值与换算规则、来源文件版本、文件哈希、PDF物理页码与报告印刷页码、页内区域/表格单元格、报告与取样日期、模型版本、提取状态、复核人及时间。

把“原报告陈述”“专家确认”“计算所得”“假设情景”“未知/冲突”分开显示。来源真实存在、页码正确和内容支持结论是三个不同检查;模型的自报置信度不能直接当成事实可靠性的概率。

5.2 资源分类与地质证据

保留报告原用标准、版本、原始类别、估算日期、估算人、边界品位、估算范围及重要前提。中国资源储量类别、历史分类代码、JORC/CRIRSCO 等体系不能只凭中文名或一张简单对照表自动等同,更不能将找矿潜力或推测量直接视作可开采储量。

JORC 官方页面明确其对象包括勘查结果、矿产资源和矿石储量的公开报告,并要求结合相关司法辖区的监管环境。[S14] 它不自动成为藏川滇境内所有交易的适用标准。具体项目采用的中国标准、现行版本、历史报告换算规则及评审备案要求,需要矿业专家和法务建立适用清单;本评审没有逐项完成中国及三省区现行规定核查。

补勘建议应连接到具体未知:样品代表性、QA/QC、体重与含水率、矿体连续性、边界、估算假设、重复样/标准样/空白样、第三方复验。矛盾是待调查线索,不能直接标注为造假。

5.3 数字和单位:模型提取,程序计算,专家确认口径

必须区分矿石量、含金属量、可回收金属量和可销售/计价金属量;区分吨与万吨、克/吨与百分数、干基与湿基、元素与氧化物含量、矿区总体与本次拟购权益份额。<检测限、区间值、未检出、空白和缺失不能一律变成零。

最小独立算例可包括:100万吨矿石、1%金属品位,对应1万吨含金属量;100万吨矿石、2克/吨金品位,对应2吨含金属量。两例只验证单位与公式,均不能据此推定可采量或收入。平均品位需要按适用权重计算,不得把不同吨位矿段的品位简单平均。

采选指标保留试验规模、原矿性质、样品覆盖、流程、回收率、精矿品位、有害杂质及计价条件。实验室闭路试验、扩大试验和工业生产不能默认等效。多金属共伴生项目还应防止重复计价或重复计算回收收益。

财务输入区分矿权受让与持权公司股权收购;明确企业价值、股权价值、净债务、股东借款、资本金投入、勘探及论证支出、税费、持有费用、或有负债、生态修复义务、退出费用及最终净回收。不能将同一债务既扣减对价又重复计入现金流。IRR 无解、多解和没有实际退出年份时要明确提示,不能生成一个看似精确的数字。

5.4 增值计划应显示验证价值和失败路径

每个阶段任务至少写:当前未知、所需证据、执行主体、前置条件、预估时间与费用来源、成功/失败判据、对后续方案的影响、停止或转向条件。

公司没有统一金额或收益门槛,应使用逐项目可编辑假设与情景,不把固定 IRR、价格或“AI投资评分”伪装成公司政策。退出情景可分析权益、费用和实现条件,但不延伸成买家管理或销售系统。最终投资审批继续留在系统范围之外。

5.5 检索与隐私设计

先做项目/授权范围过滤,再做关键词与语义检索;证号、孔号、样品号、坐标和金额需要精确匹配,不能只依赖语义相似度。首轮先验证“全文关键词+元数据过滤”的检索基线,只有召回不足才增加向量检索或重排。加入表头、脚注和相邻页上下文,保留原图以便核查;新报告不必然推翻旧报告,要比较覆盖范围和适用时点。

没有证据时应输出缺失清单;相互冲突时并列来源并交复核,不以“生成一个折中数字”解决。检索不到与模型忽略证据须分别归因。外部文档中的命令性文字只当资料,不能改变系统权限或触发工具外发;首轮工具限于检索和受控计算。

真实试点的数据清单应覆盖原件、OCR 中间结果、切片、向量、提示、回复、人工标注、训练检查点、监控日志和备份。确认所在地、访问人、保留期、删除及备份处理方式、能否用于服务商训练、是否有子处理方。地质资料是否涉及保密、测绘地理信息或跨境限制应按实际资料分类核验,不能一概宣称可上传或一概认定禁止。

在后续真实接入方案中,浏览器页面不能保存长期服务密钥。本地浏览器存储也不等于加密资料库;原型可以继续按模拟数据方案运行,真实资料权限与审计需另行设计。

六、分阶段 PoC 与停止条件

下列数量是建议的试点起点,用来安排工作,不是训练足量标准或统计保证;实际以资料授权、分层覆盖和学习曲线调整。

阶段 工作与交付物 通过条件/停止条件
0:完成既定模拟演示 四模拟案例;字段、证据入口、未知、矛盾和情景;电脑手机独立保存 用模拟记录验流程、布局、交互、计算和保存。不据此评价模型准确率。
1:建立授权评测包 可先选择约12—20个真实历史项目、200—400页重点资料及100—200个专家问题;覆盖勘探/待建、两种交易结构、不同资料质量和不利结果;出字段字典及标注规则 专家认可标签和错误严重度;测试项目先封存;资料权利及处理范围明确。若只有少数项目,结论仅限探索,不能宣称泛化。
2:无训练基线 对同一批任务比较人工/规则、现成模型、检索增强;用“完整标准证据包”和“实际检索结果”两种输入定位检索瓶颈;记录完整项目成本、时延和复核工时 选出任务合适、证据可靠且成本可接受的方案。若主要错误来自扫描或漏检索,先修这些环节;若现成方案已满足要求,停止训练立项。
3:仅做一项专项微调 从误差最大的可训练任务选一项,如特定化验表识别或证据字段提取;固定底模、训练配方、独立验证集,保留未微调对照和回滚版本 目标错误在未见项目稳定减少;关键错误不恶化;专家复核工时和总体成本收益成立。微调后只是表述更顺,不通过。
4:有限真实使用 输出仍为待核验草稿;记录专家采用/修改/驳回、失败和人工接管;定期回归评测 达到预先约定的任务门槛再扩大范围;有重大漏错、泄漏、版本不可复现或维护成本失控就暂停扩围并回滚。

不预设偏好训练、强化学习或继续预训练为必经阶段。SFT 是训练目标,LoRA 是参数更新方式,两者可以同时使用;不能把“LoRA→SFT”写成必须升级的两级路线。

训练立项的六个门槛

  1. 同类错误跨多个项目反复出现,并已定位到模型行为;不是原件缺失、OCR错误、检索漏召回或公式设计错误。
  2. 提示、结构化约束、规则与检索已形成可靠对照,仍有可衡量的差距。
  3. 有合法可用且专家确认的目标样本;训练、验证、测试按项目隔离,测试集不参与模板调优或选模型。
  4. 合作方给出指定版本可运行的训练配方、算力、耗时范围、交付责任和预算;先跑最小训练与加载验证。
  5. 事先确定目标指标、重大错误不得恶化的规则、成本上限和停止条件;微调只与同底模、同检索和同工具的基线比较。
  6. 已明确训练成果、数据、日志、适配器与合并权重归属,退出时可导出和复现;具备未微调版本回滚路径。

DPO 只在偏好稳定且事实与证据已可靠时考虑;专家分歧先仲裁,不用多数偏好掩盖资源分类或法律事实问题。继续预训练只在广泛专业语言理解确有系统性缺陷、语料权利清楚、收益可独立测量且算力预算可承担时另行论证。

七、评测数据与指标:不要用一个总分代替判断

7.1 样本与标注

保留原件、目标字段、支持区域、正确输出、允许答案、缺失原因、严重度、专家依据及分歧处理记录。关键资源、权益和法规标签应由相应专业人员复核;高影响样本建议两人独立标注后仲裁。模型生成样本可用于扩展格式和测试异常输入,但不能作为事实金标准。

按项目划分所有报告版本、页图、表格、摘要和衍生问答;高度相关的矿区/矿床、同模板复制报告也要检查泄漏。样本足够时保留新时段或新地区项目作为额外外部测试,不以“藏川滇都出现过一个案例”证明覆盖全部成矿环境。四个演示案例及其衍生问答不进入泛化效果统计。

必须包含:错误单位、跨页表格、模糊小数点、混合资源类别、历史旧报告、过期或缺失许可材料、样品/矿段混用、债务重复计算、资料互相矛盾、没有答案、不利项目及资料中嵌入的指令。对地质图保留图例、比例尺、坐标参考与空间范围,单独评测页面识别和空间推断。

7.2 指标与判分

能力 建议指标与定义 使用限制
OCR与表格 关键数字及单位精确匹配;表格行列归属正确率;跨页表头/脚注关联;漏行和小数点错位率 字符正确率高仍可能把关键数字错一位;必须单独统计金额、吨位、品位与日期。
字段抽取 字段级准确率/召回,按矿种、文档类型、质量和严重度拆分;空值与检测限单独判分 单位规范化后匹配与原始值匹配分别保留;不可用模型自行估计的置信度替代正确性。
检索 专家所需证据是否出现在前 k 个结果;多来源问题的证据覆盖;无关项目泄漏率 k、过滤条件和切片策略固定后比较;项目授权过滤属于硬性约束。
引用与事实 可定位率、证据支持率、关键主张引用覆盖率、无依据关键主张数量 引用存在不等于支持主张;由专家抽查或裁定,模型裁判只做辅助筛查。
风险与矛盾 专家已标注重大风险召回、误报、冲突来源完整性;未发现风险与明确不存在风险的区分 召回只针对测试集中已知风险,不是对现实未知风险的覆盖保证。
数值和交易逻辑 独立算例通过率;单位、权益、债务、税费和现金流口径错误;异常输入是否拦截 计算器单测和端到端输入选择分别测;计算公式正确但输入选错仍算失败。
拒答与未知 缺证据问题是否合理暂停;有证据问题被错误拒答率;冲突时是否保留双方 必须同时测过度作答和过度拒答,避免靠全部拒答提高安全分。
实用性 任务建议可执行性、依赖条件完整性、专家采用率、复核工时及返工次数 盲评时隐藏模型名称;记录专家分歧,不以文风作为主要质量标准。
成本与性能 每完整项目成本、失败重试、人审成本、首次可用结果时延、长尾等待、峰值内存 API单价或单次短问答速度不能代表整份矿业项目资料的成本。

7.3 建议验收规则

所有百分比必须报告样本数量、分母和按项目分层结果,尽量给出不确定区间;在同一封存测试集上做配对比较。不要把同一项目数百个高度相似字段当成数百个独立项目。

固定重大错误测试集建议采用**零项“未被提示或拦截的重大错误”**作为进入有限试点的门槛:例如将1%按1直接计算、虚构关键矿权结论、错用其他项目资料、把资源量自动升级成储量。这里的“零项”是对这套测试的验收要求,不是对真实世界零错误的保证;发现一项就修正并重新检查相关任务。

其他指标不在资料与基线缺失时凭空给“95%/99%”承诺。由业务和专家在阶段1签定字段严重度、可接受误报、复核工时、等待时间及预算门槛,再封存测试集。若微调只在训练同类项目上改善、外部项目退步,或人工复核成本不降,不进入下一阶段。

八、与 Z.ai 合作需要获得的具体答案

主题 要问清楚的问题 应拿到的结果
实际可用模型 哪些确切 API ID、权重版本及精度可供本项目?5.3-Flash 是否支持所需图像尺寸、页数、上下文和结构化输出? 型号/快照/接口能力清单,不以商业名称或聊天产品界面代替。
部署与硬件 公司或合作方分别提供什么 GPU/NPU、内存、存储与网络?在约定页数、并发、上下文和延迟下如何部署? 指定工作负载的配置、压测记录、预算和责任人;不要只给“几张卡”或激活参数。
微调支持 指定版本到底支持 SFT、LoRA、全参或其他哪一种?FP8 与 BF16 如何选择?视觉与语言模块训练哪些? 可复现配方、版本锁定、样例训练及产物加载结果;先证明跑通,再承诺业务提升。
联合评测 是否愿意在双方认可的矿业测试集上比较现成、检索及微调方案,并保留失败样本? 联合评测协议、错误归因和验收门槛,不用通用榜单或演示视频替代。
数据处理 服务地点、存储与日志、保留和删除、备份、子处理方、支持人员权限是什么?输入和输出能否用于服务商训练? 可执行的数据处理条款与数据流图;需要不训练条款时写入合同,不能默认为零留存。
权利与衍生成果 原始资料、专家标签、合成样本、提示模板、适配器、合并权重、评测集和日志各归谁?能否给其他客户复用? 权利清单、保密与复用边界;对基础权重原许可义务单独保留。
蒸馏与教师输出 能否以合作 API 输出训练较小模型?是否涉及其他教师模型条款? 对输出使用与蒸馏的明确授权;不以开放权重许可代替 API 合同。
运维与退出 旧模型支持期限?版本升级是否会改变输出?能否固定版本、回滚、导出所有公司数据和训练成果? 支持期限、变更通知、回归评测、退出迁移及删除证明安排。

九、证据索引与核查限度

以下链接均为本次直接读取的官方发布资料或官方标准组织页面;[S1]—[S3]等仓库链接采用本次读到的提交,便于复核。外部网页会变化,正式合同或采购应再固化当时的版本与许可文件。

尚未核实: 公司与 Z.ai 的实际合同、API 可用型号及限额、真实矿业样本效果、训练硬件和成本、最新子型号的逐项训练配方、私有部署的全套依赖许可,以及每个真实项目的标准/法规适用性。本评审不提供这些事项的保证,也不承诺微调必然提高投资收益。