huawu矿业:Z.ai 模型与训练路线独立评审
评审者:GPT-6 Astra。评审日期:2026年10月5日。
评审对象:原《Z.ai模型与训练路线》HTML及其三份研究底稿。已重新读取官方模型卡、权重许可证、官方仓库和训练说明;未下载权重、部署模型、运行训练或测量矿业任务效果。
一、结论先行
原方案的总体方向成立,但还不能作为选型、采购或训练立项依据。 “先用现成模型建立基线,再建设有来源的知识库,最后针对稳定错误决定是否微调”值得保留。主要缺口是候选信息不够新、最新版本许可与训练支持未纳入,以及矿业任务的验收规则和数据边界不够具体。
建议先做一个小而可验证的文档与证据试点,再决定是否拥有专用权重。 深度合作的首要价值应落在获得准确版本、受控数据通道、工程支持及联合评测,而不是预设必须训练大模型。
最先应改五项:
- 更新候选和维护状态。 纳入 GLM-5.3-Flash 作为合作 API/受控服务器的多模态质量对照;纳入 GLM-5.3 作为可选文本质量对照。保留 GLM-OCR 和较小模型作为成本、隐私及部署对照,不能只因版本号更新就替换。
- 补上版本级许可及训练证据。 GLM-5.3 是自定义许可,GLM-5.3-Flash 是 MIT;当前 GLM-5 仓库已列出微调框架支持。把“有许可”“框架支持”“跑通训练”“矿业效果提升”写成四个不同结论。
- 定义关键事实的结构和拦截条件。 资源类别、矿石量与金属量、单位、报告时点、采选试验条件、交易权益及债务必须有来源;没有证据或存在冲突时进入待核验状态。
- 冻结真实评测集与训练门槛。 四个模拟案例只能验界面和流程;先用授权资料建立按项目隔离的测试集,比较人工/规则、现成模型、检索增强及专项微调的差异。
- 先画清数据路径和成果归属。 电脑和手机分别本地保存,不代表调用模型时数据不出设备。明确 API、私有部署、训练及日志的数据流,合同覆盖样本、标注、适配器、权重、日志和退出迁移。
范围保持:首期仍是四个模拟案例的 UI 和决策支持演示,电脑与手机各自本地保存。首期不接入真实 AI、不上传真实矿业资料、不开展训练,也不加入买家需求/销售管理或最终投资审批。 以下真实模型试点是后续独立工作包。
二、问题清单:按影响排序
严重程度说明:P1 为进入真实试点前必须处理;P2 为选型或试点评测时应补齐。它们不是当前模拟界面存在损失或泄露的认定。
| 编号 | 严重度与问题 | 已有证据 | 影响及修正 |
|---|---|---|---|
| R1 | P1:主候选遗漏较新的模型和旧视觉仓库维护声明 | 官方已发布 GLM-5.3/5.3-Flash;GLM-V README 明确标注 2026-09-02 不再维护该仓库,并引导新模型讨论至 GLM-5 仓库。[S1][S2][S3] | 原稿明确“非穷尽清单”,因此不是虚称最新;但仍优先推荐 4.6V-Flash 而未说明维护状态,可能影响长期支持选择。补新系列对照;旧模型保留为小型部署候选,要求合作方确认维护责任。仓库声明不等于所有推理框架都停止支持旧权重。 |
| R2 | P1:最新型号不能沿用“GLM 权重均 MIT”的印象 | GLM-5.3 权重卡标 other,独立 LICENSE 为 GLM-5.3 License;5.3-Flash 有独立 MIT LICENSE。[S4][S5] | 原稿对已列旧型号的 MIT 判断基本正确,缺口发生在扩展候选时。新增 5.3 必须单列许可;不能把代码 Apache-2.0 或 Flash 的 MIT 外推到旗舰。 |
| R3 | P1:缺少资源分类、数值口径和权益数据的发布拦截条件 | 原稿仅笼统写“字段单位、分类、规则、专家确认”;公司业务依靠补勘、采选论证和许可改善项目可信度与退出条件。 | 分类误映射、矿石量当金属量、实验室回收率当工业指标、企业价值当股权对价,均可系统性扭曲结果。按第五节设置结构化字段和确定性校验,关键冲突不能自动进入估值。 |
| R4 | P1:真实数据试点边界未落实到数据流和权限 | 原稿提到保密、归属,但未定义资料、检索库、提示、日志、备份分别去向;首期要求每台设备本地保存。 | 容易把“本地保存”误解为“全程本地处理”。真实接入前明确每段数据通道及访问范围;不能在浏览器内嵌合作 API 密钥,不能默认跨项目检索或允许服务商训练。 |
| R5 | P2:GLM-5 微调信息不完整 | 当前官方仓库新增“Fine-tuning GLM-5 Series Models”,列 Slime 0.3.0+ 与 ms-swift 4.4.0+,后者支持 SFT、PPO、GRPO。[S1] | 原稿只说官方采用 slime 后训练,这句话本身成立,但已不足以描述当前支持。更新为“已有官方列举的框架路径;具体子型号、精度、训练方式与硬件仍须验证”。不能反向推成所有 5.x 变体都已有同样的 LoRA 配方。 |
| R6 | P2:只有指标名,没有可执行评测协议和门槛 | 原稿列字段正确率、引用准确率、风险召回等,但无样本分层、判分规则、配对比较、重大错误处理。 | 无法说明微调究竟改善哪种错误,也容易用少数漂亮案例立项。采用第六、七节的隔离测试、错误分层及继续/停止门槛。 |
| R7 | P2:业务增值链与检索设计仍偏通用 | 原稿的“增值计划、报告表达”没有绑定不确定性、验证任务、成本、成功条件和停止条件;检索只描述到页码段落。 | 容易输出好看的任务清单,却无法回答“这项勘探支出消除什么不确定性”。补证据对象、阶段任务、情景条件及失败后的安排;保留项目、权属主体、时点、矿种和空间范围过滤。 |
| R8 | P2:硬件例表可能被误读为普遍最低要求 | 原稿基本保留了配置条件;但“服务器内存 >1TB”来自特定 GLM-4.5 官方表,并非所有架构的普遍下限。[S8] | 保留为参考配置,增加精度、上下文、并发、推理框架、卸载策略与试验版本;不据此直接报价或采购,也不按 MoE 激活参数计算全部权重占用。 |
三、官方事实复核:哪些成立,哪些需要更新
3.1 原稿中可保留的结论
| 原结论 | 复核结果与边界 |
|---|---|
| GLM-OCR 官方标称 0.9B,模型 MIT、代码 Apache-2.0,布局组件另有许可 | 成立。官方 README 明确区分模型、代码及 PP-DocLayoutV3。[S6] 官方通用识别成绩不能证明矿业扫描件准确率。 |
| GLM-OCR 有官方微调教程,使用第三方 LLaMA-Factory | 成立。教程给 LoRA 单卡 ≥8GB、full ≥24GB 的示例;full 配置确实冻结视觉编码器与投影器,仅训练语言部分。[S7] 这些是示例条件,不是任意分辨率、长表格或批量的保证。 |
| GLM-4.6V-Flash 9B、4.6V 106B,权重卡 MIT | 成立。官方描述 128K 训练上下文及原生工具调用。[S3][S10] 但没有经本评审验证的地质图空间推理表现。 |
| GLM-4.7-Flash 30B 总参数、3B 激活 | 成立。[S11] 它仍可作为相对较小的文本对照,不等于 3B 权重装载。 |
| GLM-4.5/Air 355B/32B 与 106B/12B;官方列第三方训练路径 | 成立。[S8] 原稿引用的 H100、H20 训练例表及推理/训练区分基本准确。 |
| GLM-5 为 744B 总参数、40B 激活,原版权重卡 MIT | 成立。[S12] 当前候选更新时须区分原版 GLM-5 与 GLM-5.3。 |
| GLM-4-9B-0414 有官方列出的 LoRA 22GB 和 ZeRO3 约55GB×4参考 | 成立。[S9] 官方也说明 9B 未获得 32B 同等智能体增强;保留作窄任务训练可行性对照,而非默认综合分析主力。[S13] |
| 4.6V/Flash 的专项训练支持不能从旧视觉教程外推 | 这种谨慎成立。GLM-V 微调段落明确列的是 4.5V 和 4.1V-9B-Thinking。[S3] 此段未列新型号不等于新型号一定不能训练。 |
| 模型许可不授予矿业资料使用权,知识库不等于训练 | 成立。API 数据条款、资料授权和合作成果归属需要分别落实。 |
3.2 必须补充的新事实
GLM-5.3-Flash 是大型原生多模态模型。 官方卡列 320B 总参数、18B 激活,支持图文输入,权重 MIT。官方仓库列默认发行版 FP8,并另列 BF16 版本。[S1][S2][S5] 名称里的 Flash 不能作为普通电脑可本地部署的依据,更不能拿 18B 激活参数当总显存预算。本评审未验证它的矿业效果或全套部署最小硬件。
GLM-5.3 是不同许可的文本候选。 官方仓库列 744B/40B,FP8 与 BF16 权重分别发布;权重卡是 text-generation。[S1][S4] 它与 5.3-Flash 的架构、输入能力、总规模及许可都不同,不应只当成速度不同的两个档位。
GLM-5.3 自定义许可仍允许使用、部署、修改、微调和衍生作品,但附条件。 独立许可规定:若被许可方或关联方经营“模型即服务”,且被许可方及关联方任意连续12个月累计总收入超过100亿美元,商业使用前须通过 Z.AI 安全审查;许可也明确排除仅在特定功能中嵌入模型的终端产品等情形。[S4] 不能把此条简化成“所有商业使用需审批”。普通矿业内部应用不因使用模型自动触发该条,但实际关联主体和服务模式仍应由合同核对。本评审不是法律意见。
GLM-5 系列已有官方列举的微调框架。 Slime 0.3.0+、ms-swift 4.4.0+ 的支持声明需要写入原稿;它并未给本项目提供已验证的全套矿业 SFT 硬件与效果承诺。[S1] 框架列在“本地部署”章节也不能单独作为训练支持证据。
版本必须包括权重变体和快照。 除模型名,还应记录权重提交号、FP8/BF16、分词器及聊天模板、推理框架、训练框架、上下文限制、思考参数。5.3 系列官方说明 reasoning_effort 默认 max;如果评测一边用低思考、一边用最高思考,成本与延迟比较会失真。[S1][S2]
本次核验到的两份新权重快照:GLM-5.3 为 aca966e4e02791568aa6a4ced368624b3d897f42;GLM-5.3-Flash 为 eb9eb208eb0d988989d07a6a12d0fdeb5f52574a。它们是本次证据定位,不代表必须选择这两个版本生产上线。
四、建议候选组合:按任务和约束选择
| 层次 | 首轮候选与用法 | 选择条件 |
|---|---|---|
| 原文与表格获取 | 先使用 PDF 已有文字与原始电子表格;扫描件/复杂版面用 GLM-OCR | 保留原文件、页面图与表格结构,不能把原本准确的电子表格先转图片再识别。OCR 结果单独评测。 |
| 页面及图件理解 | GLM-5.3-Flash 经合作 API/受控服务器做质量对照;GLM-4.6V-Flash 做小型部署对照 | 前者需明确数据条款与算力;后者需明确版本及维护责任。对地质图做页面观察与证据定位,不默认其可完成可靠坐标变换或资源建模。 |
| 文本证据整理与报告 | 首选比较 GLM-4.7-Flash 与合作方实际可提供的 GLM-5.3;也可直接测试 5.3-Flash 是否已能覆盖文本任务 | 每个模型用同一证据包、输出结构和计算工具。若同一模型已满足要求,不额外建设复杂多模型调度。API 型号须由合作方确认,不从权重名猜测。 |
| 专项训练 | 优先 GLM-OCR 的识别适配;文本窄任务按实测选择 4.7-Flash 或 9B-0414 等可验证训练路径 | 4.7-Flash 训练支持仍需具体配方核实;9B 教程清晰不等于效果一定好。只有基础版本先达到可用水平,且错误确属模型适配时才训练。 |
| 暂不作为默认训练对象 | GLM-4.5/Air、GLM-5、GLM-5.3 和大型多模态旗舰 | 已有专项合作算力、需要的能力、配方与独立评测收益均得到证明时再评估。教程齐全或合作紧密都不是单独的训练理由。 |
这不是采购名单。首轮宜控制在两到三个实际可获得的推理候选,加一个 OCR 方案。最终同时比较任务质量、专家复核时间、每个完整项目处理成本、等待时间和维护负担;不采用官方通用榜单替代矿业测试。
五、业务方案需要补齐的具体约束
以下是针对huawu矿业业务的设计建议,不是已经证明模型具备这些能力,也不是对任何具体矿权的法律判断。
5.1 从“文档字段”升级为可追溯的事实记录
每条关键事实至少记录:项目与持权主体、对象及空间范围、原始字段、原始值与单位、标准化值与换算规则、来源文件版本、文件哈希、PDF物理页码与报告印刷页码、页内区域/表格单元格、报告与取样日期、模型版本、提取状态、复核人及时间。
把“原报告陈述”“专家确认”“计算所得”“假设情景”“未知/冲突”分开显示。来源真实存在、页码正确和内容支持结论是三个不同检查;模型的自报置信度不能直接当成事实可靠性的概率。
5.2 资源分类与地质证据
保留报告原用标准、版本、原始类别、估算日期、估算人、边界品位、估算范围及重要前提。中国资源储量类别、历史分类代码、JORC/CRIRSCO 等体系不能只凭中文名或一张简单对照表自动等同,更不能将找矿潜力或推测量直接视作可开采储量。
JORC 官方页面明确其对象包括勘查结果、矿产资源和矿石储量的公开报告,并要求结合相关司法辖区的监管环境。[S14] 它不自动成为藏川滇境内所有交易的适用标准。具体项目采用的中国标准、现行版本、历史报告换算规则及评审备案要求,需要矿业专家和法务建立适用清单;本评审没有逐项完成中国及三省区现行规定核查。
补勘建议应连接到具体未知:样品代表性、QA/QC、体重与含水率、矿体连续性、边界、估算假设、重复样/标准样/空白样、第三方复验。矛盾是待调查线索,不能直接标注为造假。
5.3 数字和单位:模型提取,程序计算,专家确认口径
必须区分矿石量、含金属量、可回收金属量和可销售/计价金属量;区分吨与万吨、克/吨与百分数、干基与湿基、元素与氧化物含量、矿区总体与本次拟购权益份额。<检测限、区间值、未检出、空白和缺失不能一律变成零。
最小独立算例可包括:100万吨矿石、1%金属品位,对应1万吨含金属量;100万吨矿石、2克/吨金品位,对应2吨含金属量。两例只验证单位与公式,均不能据此推定可采量或收入。平均品位需要按适用权重计算,不得把不同吨位矿段的品位简单平均。
采选指标保留试验规模、原矿性质、样品覆盖、流程、回收率、精矿品位、有害杂质及计价条件。实验室闭路试验、扩大试验和工业生产不能默认等效。多金属共伴生项目还应防止重复计价或重复计算回收收益。
财务输入区分矿权受让与持权公司股权收购;明确企业价值、股权价值、净债务、股东借款、资本金投入、勘探及论证支出、税费、持有费用、或有负债、生态修复义务、退出费用及最终净回收。不能将同一债务既扣减对价又重复计入现金流。IRR 无解、多解和没有实际退出年份时要明确提示,不能生成一个看似精确的数字。
5.4 增值计划应显示验证价值和失败路径
每个阶段任务至少写:当前未知、所需证据、执行主体、前置条件、预估时间与费用来源、成功/失败判据、对后续方案的影响、停止或转向条件。
公司没有统一金额或收益门槛,应使用逐项目可编辑假设与情景,不把固定 IRR、价格或“AI投资评分”伪装成公司政策。退出情景可分析权益、费用和实现条件,但不延伸成买家管理或销售系统。最终投资审批继续留在系统范围之外。
5.5 检索与隐私设计
先做项目/授权范围过滤,再做关键词与语义检索;证号、孔号、样品号、坐标和金额需要精确匹配,不能只依赖语义相似度。首轮先验证“全文关键词+元数据过滤”的检索基线,只有召回不足才增加向量检索或重排。加入表头、脚注和相邻页上下文,保留原图以便核查;新报告不必然推翻旧报告,要比较覆盖范围和适用时点。
没有证据时应输出缺失清单;相互冲突时并列来源并交复核,不以“生成一个折中数字”解决。检索不到与模型忽略证据须分别归因。外部文档中的命令性文字只当资料,不能改变系统权限或触发工具外发;首轮工具限于检索和受控计算。
真实试点的数据清单应覆盖原件、OCR 中间结果、切片、向量、提示、回复、人工标注、训练检查点、监控日志和备份。确认所在地、访问人、保留期、删除及备份处理方式、能否用于服务商训练、是否有子处理方。地质资料是否涉及保密、测绘地理信息或跨境限制应按实际资料分类核验,不能一概宣称可上传或一概认定禁止。
在后续真实接入方案中,浏览器页面不能保存长期服务密钥。本地浏览器存储也不等于加密资料库;原型可以继续按模拟数据方案运行,真实资料权限与审计需另行设计。
六、分阶段 PoC 与停止条件
下列数量是建议的试点起点,用来安排工作,不是训练足量标准或统计保证;实际以资料授权、分层覆盖和学习曲线调整。
| 阶段 | 工作与交付物 | 通过条件/停止条件 |
|---|---|---|
| 0:完成既定模拟演示 | 四模拟案例;字段、证据入口、未知、矛盾和情景;电脑手机独立保存 | 用模拟记录验流程、布局、交互、计算和保存。不据此评价模型准确率。 |
| 1:建立授权评测包 | 可先选择约12—20个真实历史项目、200—400页重点资料及100—200个专家问题;覆盖勘探/待建、两种交易结构、不同资料质量和不利结果;出字段字典及标注规则 | 专家认可标签和错误严重度;测试项目先封存;资料权利及处理范围明确。若只有少数项目,结论仅限探索,不能宣称泛化。 |
| 2:无训练基线 | 对同一批任务比较人工/规则、现成模型、检索增强;用“完整标准证据包”和“实际检索结果”两种输入定位检索瓶颈;记录完整项目成本、时延和复核工时 | 选出任务合适、证据可靠且成本可接受的方案。若主要错误来自扫描或漏检索,先修这些环节;若现成方案已满足要求,停止训练立项。 |
| 3:仅做一项专项微调 | 从误差最大的可训练任务选一项,如特定化验表识别或证据字段提取;固定底模、训练配方、独立验证集,保留未微调对照和回滚版本 | 目标错误在未见项目稳定减少;关键错误不恶化;专家复核工时和总体成本收益成立。微调后只是表述更顺,不通过。 |
| 4:有限真实使用 | 输出仍为待核验草稿;记录专家采用/修改/驳回、失败和人工接管;定期回归评测 | 达到预先约定的任务门槛再扩大范围;有重大漏错、泄漏、版本不可复现或维护成本失控就暂停扩围并回滚。 |
不预设偏好训练、强化学习或继续预训练为必经阶段。SFT 是训练目标,LoRA 是参数更新方式,两者可以同时使用;不能把“LoRA→SFT”写成必须升级的两级路线。
训练立项的六个门槛
- 同类错误跨多个项目反复出现,并已定位到模型行为;不是原件缺失、OCR错误、检索漏召回或公式设计错误。
- 提示、结构化约束、规则与检索已形成可靠对照,仍有可衡量的差距。
- 有合法可用且专家确认的目标样本;训练、验证、测试按项目隔离,测试集不参与模板调优或选模型。
- 合作方给出指定版本可运行的训练配方、算力、耗时范围、交付责任和预算;先跑最小训练与加载验证。
- 事先确定目标指标、重大错误不得恶化的规则、成本上限和停止条件;微调只与同底模、同检索和同工具的基线比较。
- 已明确训练成果、数据、日志、适配器与合并权重归属,退出时可导出和复现;具备未微调版本回滚路径。
DPO 只在偏好稳定且事实与证据已可靠时考虑;专家分歧先仲裁,不用多数偏好掩盖资源分类或法律事实问题。继续预训练只在广泛专业语言理解确有系统性缺陷、语料权利清楚、收益可独立测量且算力预算可承担时另行论证。
七、评测数据与指标:不要用一个总分代替判断
7.1 样本与标注
保留原件、目标字段、支持区域、正确输出、允许答案、缺失原因、严重度、专家依据及分歧处理记录。关键资源、权益和法规标签应由相应专业人员复核;高影响样本建议两人独立标注后仲裁。模型生成样本可用于扩展格式和测试异常输入,但不能作为事实金标准。
按项目划分所有报告版本、页图、表格、摘要和衍生问答;高度相关的矿区/矿床、同模板复制报告也要检查泄漏。样本足够时保留新时段或新地区项目作为额外外部测试,不以“藏川滇都出现过一个案例”证明覆盖全部成矿环境。四个演示案例及其衍生问答不进入泛化效果统计。
必须包含:错误单位、跨页表格、模糊小数点、混合资源类别、历史旧报告、过期或缺失许可材料、样品/矿段混用、债务重复计算、资料互相矛盾、没有答案、不利项目及资料中嵌入的指令。对地质图保留图例、比例尺、坐标参考与空间范围,单独评测页面识别和空间推断。
7.2 指标与判分
| 能力 | 建议指标与定义 | 使用限制 |
|---|---|---|
| OCR与表格 | 关键数字及单位精确匹配;表格行列归属正确率;跨页表头/脚注关联;漏行和小数点错位率 | 字符正确率高仍可能把关键数字错一位;必须单独统计金额、吨位、品位与日期。 |
| 字段抽取 | 字段级准确率/召回,按矿种、文档类型、质量和严重度拆分;空值与检测限单独判分 | 单位规范化后匹配与原始值匹配分别保留;不可用模型自行估计的置信度替代正确性。 |
| 检索 | 专家所需证据是否出现在前 k 个结果;多来源问题的证据覆盖;无关项目泄漏率 | k、过滤条件和切片策略固定后比较;项目授权过滤属于硬性约束。 |
| 引用与事实 | 可定位率、证据支持率、关键主张引用覆盖率、无依据关键主张数量 | 引用存在不等于支持主张;由专家抽查或裁定,模型裁判只做辅助筛查。 |
| 风险与矛盾 | 专家已标注重大风险召回、误报、冲突来源完整性;未发现风险与明确不存在风险的区分 | 召回只针对测试集中已知风险,不是对现实未知风险的覆盖保证。 |
| 数值和交易逻辑 | 独立算例通过率;单位、权益、债务、税费和现金流口径错误;异常输入是否拦截 | 计算器单测和端到端输入选择分别测;计算公式正确但输入选错仍算失败。 |
| 拒答与未知 | 缺证据问题是否合理暂停;有证据问题被错误拒答率;冲突时是否保留双方 | 必须同时测过度作答和过度拒答,避免靠全部拒答提高安全分。 |
| 实用性 | 任务建议可执行性、依赖条件完整性、专家采用率、复核工时及返工次数 | 盲评时隐藏模型名称;记录专家分歧,不以文风作为主要质量标准。 |
| 成本与性能 | 每完整项目成本、失败重试、人审成本、首次可用结果时延、长尾等待、峰值内存 | API单价或单次短问答速度不能代表整份矿业项目资料的成本。 |
7.3 建议验收规则
所有百分比必须报告样本数量、分母和按项目分层结果,尽量给出不确定区间;在同一封存测试集上做配对比较。不要把同一项目数百个高度相似字段当成数百个独立项目。
固定重大错误测试集建议采用**零项“未被提示或拦截的重大错误”**作为进入有限试点的门槛:例如将1%按1直接计算、虚构关键矿权结论、错用其他项目资料、把资源量自动升级成储量。这里的“零项”是对这套测试的验收要求,不是对真实世界零错误的保证;发现一项就修正并重新检查相关任务。
其他指标不在资料与基线缺失时凭空给“95%/99%”承诺。由业务和专家在阶段1签定字段严重度、可接受误报、复核工时、等待时间及预算门槛,再封存测试集。若微调只在训练同类项目上改善、外部项目退步,或人工复核成本不降,不进入下一阶段。
八、与 Z.ai 合作需要获得的具体答案
| 主题 | 要问清楚的问题 | 应拿到的结果 |
|---|---|---|
| 实际可用模型 | 哪些确切 API ID、权重版本及精度可供本项目?5.3-Flash 是否支持所需图像尺寸、页数、上下文和结构化输出? | 型号/快照/接口能力清单,不以商业名称或聊天产品界面代替。 |
| 部署与硬件 | 公司或合作方分别提供什么 GPU/NPU、内存、存储与网络?在约定页数、并发、上下文和延迟下如何部署? | 指定工作负载的配置、压测记录、预算和责任人;不要只给“几张卡”或激活参数。 |
| 微调支持 | 指定版本到底支持 SFT、LoRA、全参或其他哪一种?FP8 与 BF16 如何选择?视觉与语言模块训练哪些? | 可复现配方、版本锁定、样例训练及产物加载结果;先证明跑通,再承诺业务提升。 |
| 联合评测 | 是否愿意在双方认可的矿业测试集上比较现成、检索及微调方案,并保留失败样本? | 联合评测协议、错误归因和验收门槛,不用通用榜单或演示视频替代。 |
| 数据处理 | 服务地点、存储与日志、保留和删除、备份、子处理方、支持人员权限是什么?输入和输出能否用于服务商训练? | 可执行的数据处理条款与数据流图;需要不训练条款时写入合同,不能默认为零留存。 |
| 权利与衍生成果 | 原始资料、专家标签、合成样本、提示模板、适配器、合并权重、评测集和日志各归谁?能否给其他客户复用? | 权利清单、保密与复用边界;对基础权重原许可义务单独保留。 |
| 蒸馏与教师输出 | 能否以合作 API 输出训练较小模型?是否涉及其他教师模型条款? | 对输出使用与蒸馏的明确授权;不以开放权重许可代替 API 合同。 |
| 运维与退出 | 旧模型支持期限?版本升级是否会改变输出?能否固定版本、回滚、导出所有公司数据和训练成果? | 支持期限、变更通知、回归评测、退出迁移及删除证明安排。 |
九、证据索引与核查限度
以下链接均为本次直接读取的官方发布资料或官方标准组织页面;[S1]—[S3]等仓库链接采用本次读到的提交,便于复核。外部网页会变化,正式合同或采购应再固化当时的版本与许可文件。
- [S1] GLM-5 当前官方 README:模型下载表、5.3系列规模/精度、微调框架与参数说明。固定版本。同仓库代码许可证为 Apache-2.0,不替代各权重许可。
- [S2] GLM-5.3-Flash 官方模型卡:320B/18B、原生多模态、部署入口及思考参数。固定版本。
- [S3] GLM-V 官方 README:2026-09-02 维护声明、4.6V规模与旧视觉微调段落。固定版本。
- [S4] GLM-5.3 官方权重许可与模型卡:自定义 LICENSE、模型卡。
- [S5] GLM-5.3-Flash 官方权重 MIT 许可:独立 LICENSE。
- [S6] GLM-OCR 官方说明:参数、工具链及分别的许可声明。README。
- [S7] GLM-OCR 官方微调教程:LLaMA-Factory、显存示例、full配置冻结项。教程。
- [S8] GLM-4.5/Air 官方资料:权重卡及配置条件、官方 README 训练表。
- [S9] GLM-4 官方微调说明:0414版本显存表、测试环境和长上下文未测边界。微调 README。
- [S10] GLM-4.6V-Flash 官方权重卡:模型卡。
- [S11] GLM-4.7-Flash 官方权重卡:模型卡。
- [S12] 原版 GLM-5 官方权重卡:模型卡。
- [S13] GLM-4 官方版本与能力说明:README、9B-0414权重卡。
- [S14] JORC 官方规则介绍页:Codes。本次页面仍标示2012版为当前版本,并介绍2024修订草案咨询;本评审只用它说明适用对象、版本和管辖环境必须分别核验,不据此认定中国项目适用JORC。
尚未核实: 公司与 Z.ai 的实际合同、API 可用型号及限额、真实矿业样本效果、训练硬件和成本、最新子型号的逐项训练配方、私有部署的全套依赖许可,以及每个真实项目的标准/法规适用性。本评审不提供这些事项的保证,也不承诺微调必然提高投资收益。