ZZXY PRIVATE AI

私有化 AI 应用与业务智能体

不是再上一套独立的"AI 系统",而是给已有的 LIMS、MES、QMS、OA、ERP 补一层能力:让模型跑在您自己的服务器或内网里,读懂您的文档和业务数据,输出带原文出处、可被人核对的结果。判断与签字,仍然由您的专业人员完成。

数据不出内网答案带出处与现有系统对接可配套验证文档

先说结论:不是所有场景都值得上 AI

过去两年我们接触的需求里,有相当一部分在评估阶段就建议客户先不要做——不是技术上做不了,而是投入产出不成立,或者前置条件(数据、流程、责任划分)还没准备好。把这件事写在最前面,比在 PoC 结束后再解释更负责任。

一个基本判断标准:这项工作现在是不是由人在做、做得慢、且答案有据可查?三个条件同时成立,AI 才有明确价值;缺一个,就需要重新讨论方案。

通常成立的场景

  • 制度、标准、SOP、方法规范分散在几百上千份文档里,人找一次要十几分钟,且经常找到过期版本
  • 大量格式相近的文档需要录入或核对:提单、发票、检测原始记录、病历、合同条款
  • 新人上手周期长,老员工大量时间消耗在重复答疑上
  • 报告、总结、说明类文本有固定结构,人写初稿的时间远多于改稿
  • 需要跨系统查数才能回答的问题,目前靠人工在几个系统之间来回切换

建议先不要做的场景

  • 源头数据本身不全、不准或版本混乱——先做数据治理,否则 AI 只会把错误答得更流畅
  • 要求结果 100% 正确且不设人工复核环节,例如直接输出放行结论、诊断结论、合规判定
  • 知识总量只有几十份文档且更新频繁——用一个好的检索和文档管理更划算
  • 目标是"减员"而非"提效",但流程上并没有可以移除的环节
  • 业务规则每月大改,且没有人负责维护知识库与评估集
我们的边界原则:AI 负责检索、初稿和结构化,人负责判断、复核和签字。凡是涉及资质、放行、诊断、法律后果的结论,系统只提供依据和候选项,最终结论由具备相应资格的人员作出并留痕。这一点会写进方案和合同,不会在项目中途变通。

三类落地场景

每一类都按"输入什么—系统给出什么—人在哪里介入"来定义,而不是按技术名词来定义。

企业私有知识库

检索增强生成 / RAG
输入

制度文件、作业指导书、标准与方法规范、设备手册、历史项目资料、会议纪要,含 PDF、Word、Excel、扫描件。

输出

自然语言提问,返回直接答案 + 引用段落 + 文件名与版本 + 页码定位,可一键跳转原文核对;命中不足时明确回答"知识库中未找到依据",而不是编造。

人在哪里介入:知识库的文件范围、版本有效性和权限分级由业务部门维护;涉及考核、处罚、对外承诺的答案,仍需按原有审批流确认。

文档结构化处理

识别 / 抽取 / 核对
输入

格式相近但排版不统一的业务单据:提单与发票、检测原始记录、病历文本、合同、报关与报检材料。

输出

按字段抽取为结构化数据并回写到业务系统,逐字段标注置信度与来源位置;对低置信字段和前后矛盾项主动挂起,形成待人工确认清单。

人在哪里介入:低置信字段逐条确认;关键字段(金额、批号、结果值、当事人)默认强制人工复核,复核动作全部留痕。

业务智能体

嵌入既有流程的动作
输入

已有系统中的一次业务事件:一条工单、一份委托、一次异常记录、一封邮件。

输出

按预设规则完成受限动作:生成报告初稿、跨系统取数并交叉核对、按条件提醒相关人、拟写回复草稿并挂到审批流。每个动作可调用的接口范围是白名单式的。

人在哪里介入:所有对外发出和数据写入动作默认停在"待确认"状态,由人点确认后执行;可按业务风险等级逐项放开或收紧。

这三类可以单独实施,也可以叠加在同一个项目里。多数客户从第一类或第二类切入,跑顺之后再考虑第三类——智能体的风险在于它会"动手",前两类只是"给答案"。

技术架构:每一步为什么存在

直接把文档丢给大模型问答,在正式业务里几乎一定会翻车。下面这条流水线上的每一个环节,都对应一类具体的失败模式。

01 文档解析 版式还原 · 表格重建 扫描件 OCR 02 切分与元数据 按条款/章节切分 版本 · 生效日 · 密级 03 混合检索 向量 + 关键词 权限过滤前置 04 重排序 Re-rank 精排 上下文拼装 05 生成与约束 强制引用出处 无依据则拒答 06 评估集与回归:Bad case 回流 离线处理(建库时执行一次,文档更新时增量执行) 在线处理(每次提问实时执行)

上图为标准处理链路。实际项目中,01 和 02 的工作量通常占整体的六成以上——决定效果上限的是文档处理质量,不是模型选型。

环节不做或做不好会出现什么我们的处理方式
01 文档解析 跨页表格被打散、双栏 PDF 串行、扫描件识别错行,导致后面所有环节都在错误内容上运行。 按文档类型分别配置解析策略;表格结构单独还原并保留行列关系;扫描件先做质量分级,低质量件走人工补录而不是硬识别。解析结果抽样人工校验后才入库。
02 切分与元数据 按固定字数切分会把一条完整条款切成两半,检索出来的片段缺少前提条件,答案在字面上正确、在业务上是错的。 按条款、章节、记录单元等业务边界切分;每个片段附带来源文件、版本号、生效日期、适用范围和密级,供检索时过滤与在答案里回显。
03 混合检索 只用向量检索时,对编号、型号、标准号、人名这类专有符号召回极不稳定("HJ 505" 与 "HJ 605" 语义几乎相同)。 向量检索与关键词检索并行后合并;权限过滤在检索阶段前置执行,越权文档从候选集里直接排除,而不是生成后再屏蔽。
04 重排序 召回的十几个片段里只有两三个真正相关,全部塞给模型会稀释注意力,答案开始跑偏。 用重排序模型对候选片段精排,只保留高相关片段进入上下文;按 token 预算裁剪,保证长文档场景下上下文不溢出。
05 生成与约束 模型在没有依据时倾向于"编一个看起来合理的答案",这是业务场景里最危险的一类错误。 提示词层面强制"仅依据给定片段作答";答案与引用做一致性校验;检索置信度低于阈值时直接返回"未找到依据"并给出相近文档线索,把不确定性交还给人。
06 评估与回归 换个模型、改个提示词、加一批文档,效果可能整体下滑,但没人发现,直到业务部门投诉。 上线前与业务方共同构建评估问题集并记录基线;任何模型、提示词、知识库变更后重跑评估集,对比基线;线上 Bad case 定期回流补入评估集。

效果如何衡量

"准确率 95%" 这种说法在没有定义题目范围之前没有意义。我们用一组可以在您自己数据上复现的指标来验收。

指标含义怎么用
检索命中率正确依据是否出现在检索返回的前 N 个片段中。这是效果的上限。检索没召回,后面再强的模型也答不对。优先优化这一项。
答案有据率答案中的关键结论是否都能在引用片段里找到对应原文。直接对应"会不会胡说"。低于约定值不予验收。
合理拒答率知识库中确实没有依据时,系统明确说明"未找到"的比例。刻意在评估集里放入超纲问题。一个从不拒答的系统是不可信的。
字段抽取准确率文档处理场景下,按字段统计的抽取正确比例,分关键字段与一般字段。关键字段(金额、批号、结果值)单独统计,标准高于一般字段。
人工复核工作量引入系统后,同样一批业务需要人工确认的条目数与耗时。真正的业务收益指标。它比任何模型分数都更能说明系统是否值得留下。
响应时间在约定并发下的首字返回时间与完整回答时间。按实际部署硬件实测,不引用厂商标称值。
评估集由客户业务人员和我们共同构建,一般 100—300 题,覆盖高频问题、边界问题和超纲问题,题目与标准答案归客户所有。我们不会在未见到贵司真实数据前,承诺任何具体的准确率数字。

能力边界

区分现成能力、需评估能力和后续方向,避免把规划内容当作交付承诺。

现成能力

已具备的工程能力

以下能力已有可运行实现,具体配置与交付边界以合同及演示确认为准。

  • 文档批量入库与增量更新
  • 版式文档与表格解析
  • 按业务边界切分与元数据管理
  • 向量与关键词混合检索
  • 重排序精排
  • 引用溯源与原文定位
  • 低置信拒答策略
  • 角色权限与文档密级隔离
  • 问答与检索界面
  • 知识库管理后台
  • 提问与操作日志审计
  • 评估集管理与回归对比
  • 云端模型与本地模型双接入
  • 字段抽取与置信度标注
  • 待确认清单与人工复核留痕
项目评估

需按客户条件确认实现方案

以下内容不作为默认现成功能,需在需求与技术评估阶段逐项确认。

  • 与业务系统对接:与 LIMS、MES、QMS、OA、ERP 的接口,取决于对方系统是否提供开放接口、数据库读写权限及厂商配合程度,需逐个系统评估。
  • 扫描件识别质量:取决于原件清晰度、印章遮挡、手写比例与版式一致性。需先用真实样本做识别质量摸底,再确定是否可自动化及自动化比例。
  • 本地 GPU 私有化部署:取决于可用硬件、并发要求、上下文长度与运维条件,需要在评估阶段完成选型与实测。
  • 模型微调:多数场景通过检索优化即可满足,不默认微调。确需微调时,需评估标注数据规模、许可条款与后续维护成本。
  • 电子签章与法律效力:如流程涉及,需根据客户采用的 CA 证书与签章平台确认对接方案。
  • 语音输入与转写:取决于录音条件、方言与专业术语覆盖,需实测后确认可用范围。
后续方向

持续增强方向

当前不作为现有功能承诺;如项目有明确需求,可在需求阶段确认实现条件与范围。

  • 多智能体分工协作完成跨部门长流程
  • 基于业务数据的异常模式主动发现与预警
  • 知识库内容冲突与过期条款的自动巡检

部署形态与硬件量级

"私有化"有几种不同程度,对应的数据边界、成本结构完全不同,需要先对齐概念再谈方案。

形态数据边界成本结构适用情况
公有云模型 API 提问内容与命中片段会发送至模型服务商;知识库原文可保留在本地,仅传输片段。 无硬件投入,按调用量计费,用量波动直接反映在账单上。 数据敏感度不高、希望快速验证效果、用量不确定的起步阶段。优先选用已完成备案或登记的国产模型服务。
专属云 / 私有云 模型运行在客户专属实例或客户自有云账号内,不与其他租户共享。 实例常驻费用为主,成本相对可预测。 已有云上业务系统、要求数据不出自有云账号、但暂不打算自购硬件。
本地 GPU 部署 模型权重与全部数据均在客户机房或内网,可完全离线运行。 一次性硬件投入 + 电力与运维成本,长期用量大时单位成本更低。 数据不允许出内网、有机房与运维条件、并发和用量稳定可预估的场景。

本地部署的硬件参考量级

模型规模显存参考(4bit 量化)说明
7B 级约 6—10 GB单张消费级或入门专业卡即可运行。适合结构化抽取、分类、摘要等边界清晰的任务。
14B 级约 10—16 GB知识库问答的常见起点,在多数中文业务问答上表现与成本较平衡。
32B 级约 20—28 GB需要较强推理与长上下文的场景。通常需要专业计算卡。
70B 及以上约 40 GB 起,常需多卡成本显著上升。多数企业场景不必上到这一档,把预算投在文档处理和检索优化上收益更高。

以上为选型阶段的参考量级,用于判断预算区间,不是采购依据。实际显存占用还受上下文长度、并发数、KV 缓存和量化方式影响,最终配置以在贵司真实并发条件下实测为准。嵌入模型与重排序模型另需少量显存,通常可与主模型共卡。

数据、合规与受监管场景

我们的客户集中在检测、制药、医疗器械、医疗和安全生产领域,这些行业里 AI 不是"能不能用"的问题,而是"以什么身份用"的问题。

数据处理原则

  • 模型服务优先选用已完成备案或登记的国产大模型
  • 数据分级后再入库,涉密与个人信息文档按级别限定可访问范围
  • 权限过滤在检索阶段前置,越权内容不进入模型上下文
  • 提问、命中片段、生成内容、人工复核动作全程留日志,可按人员与时间检索
  • 训练与调优仅在合同明确授权的数据范围内进行;未经授权,客户数据不用于任何模型训练
  • 合同中约定数据留存期限与项目结束后的清除方式

受监管场景的处理方式

  • AI 输出不进入放行、判定、诊断等决策链,仅作为依据检索与初稿工具
  • 凡进入受控流程的内容,保留完整审计追踪:谁提问、依据哪一版文件、谁复核、何时确认
  • 知识库文件版本与生效日期强制管理,过期版本在答案中明确标识
  • 如系统需纳入质量体系,可配套计算机化系统验证文档(URS、风险评估、IQ/OQ/PQ 方案与报告)
  • 验证范围与责任分工在合同中写清;软件不能替代体系运行,也不承诺"上了系统即可通过检查"
需要说明的是:计算机化系统验证的主体责任在使用方。我们提供符合 GAMP 5 框架的文档模板、配置记录与测试执行支持,并配合现场检查提供技术说明,但不能代替贵司质量部门完成体系判断与放行审批。

实施路径与验收方式

验收标准在 PoC 之前就写清楚,而不是等系统做完再讨论算不算达标。

STEP 01

场景与数据评估

圈定 1—2 个场景,清点文档数量、格式与质量,确认数据密级与责任人。产出可行性判断与不建议做的部分。

STEP 02

评估集与 PoC

与业务方共同出题建立评估集并约定通过线,用真实(脱敏)数据跑通链路,给出基线数据。不达标则终止或调整范围。

STEP 03

工程化与集成

补齐权限、日志、管理后台与增量更新机制,完成与业务系统的接口对接和部署环境搭建。

STEP 04

并行试运行与移交

与原有人工方式并行一段时间,比对差异、回流 Bad case,培训维护人员后正式移交。

验收依据是评估集跑分 + 并行期业务比对,而不是"系统已部署完成"

启动前需要贵司确认的事项

纳入知识库的文档范围与密级划分
文档的责任维护部门与更新机制
评估集出题人与验收通过线
数据是否允许出内网、可接受的部署形态
需对接的业务系统及其接口条件
人工复核环节的岗位与责任划分
是否需要配套验证文档及其范围
上线后由谁负责知识库与评估集维护

费用构成

不在官网标价——同样一句"做个知识库",不同的文档量、接口和部署方式,造价可以差好几倍。这里说明的是钱花在哪些项上。

一次性投入

项目建设期发生,与实施范围直接相关。

  • 软件授权(按约定版本与用户规模)
  • 实施服务:文档处理、切分策略配置、提示词与检索调优
  • 接口开发:按需对接的业务系统数量与复杂度
  • 历史文档整理与入库
  • 本地部署时的服务器与 GPU 硬件
  • 如需要:计算机化系统验证文档编制与执行

持续性支出

上线后按年度或按量发生。

  • 模型调用费(云端方案)或电力与硬件折旧(本地方案)
  • 年度技术服务与版本更新
  • 知识库增量维护与评估集回归
  • 业务规则调整带来的配置变更

影响造价的主要变量:文档总量与格式复杂度(扫描件比例尤其关键)、需要对接的系统数量、部署形态、并发规模、是否需要验证文档、以及人工复核流程的改造深度。我们会在评估阶段给出分项估算,而不是先报一个总价再谈范围。

常见问题

它会不会一本正经地胡说八道?
这类错误无法在原理上被完全消除,只能通过工程手段把它压到可控范围并让它可被发现。我们的做法是:答案强制附带引用原文,用户可以直接跳转核对;检索置信度不足时系统返回"未找到依据"而不是硬答;上线前用评估集测出"答案有据率"和"合理拒答率"作为验收依据。更重要的是流程设计——凡是有后果的结论,系统只提供依据,由人确认。
我们的数据会不会被拿去训练模型?
不会。客户数据仅用于合同约定的本项目,未经明确书面授权不用于任何模型训练或调优。如果选择本地部署形态,数据和模型权重完全在贵司内网,物理上不存在外传路径;如果选择云端模型,我们会协助确认服务商的数据处理条款,并在方案中限定仅传输命中片段而非全量文档。数据留存期限与项目结束后的清除方式会写进合同。
要准备多少数据才能开始?
知识库问答场景没有硬性门槛,几百份文档就可以开始,关键不是数量而是质量:版本是否清晰、内容是否现行有效、有没有明确的维护责任人。反过来,如果文档本身版本混乱、新旧并存,文档量越大效果越差。文档抽取场景则需要一批真实样本(一般每类几十份)来做识别质量摸底,才能判断哪些能自动化、自动化到什么比例。
必须买 GPU 吗?
不一定。如果数据敏感度允许,用已备案的国产模型 API 起步是更划算的选择,没有硬件投入,效果验证也快。只有在数据完全不能出内网、或长期调用量大到云端成本超过硬件摊销时,本地 GPU 部署才成立。我们会在评估阶段用贵司的实际用量做一次两种方案的成本测算,再决定,而不是默认推荐买硬件。
能承诺准确率达到 95% 吗?
在没有见到贵司真实数据和题目范围之前,任何具体的准确率数字都是不负责任的。同一套系统,回答"这个参数的限值是多少"和回答"这个方案有没有合规风险",准确率不在一个量级上。我们的做法是:先与业务方共同建立 100—300 题的评估集并约定通过线,PoC 阶段跑出基线数据,达标才继续,不达标就终止或调整范围。承诺写在评估集上,不写在宣传语上。
上了 AI 之后能减多少人?
我们不以减员作为项目目标,也不建议客户这样立项。实际观察到的变化通常是结构性的:查找依据、录入核对、写初稿这类工作的耗时下降,而复核、判断、异常处理的比重上升。如果贵司的流程中确实存在可以移除的环节,那是流程重构的成果,AI 只是让它变得可行。用"人工复核工作量"这个指标去衡量,比用编制数更真实。
能和我们现有的 LIMS / ERP / OA 打通吗?
需要逐个系统评估,取决于对方是否提供开放接口或数据库访问权限、以及原厂商的配合程度。有开放接口的情况相对直接;只有界面没有接口的老系统,需要讨论其他方案,成本和稳定性都会有变化。我们不会在未接触对方系统前承诺"都能打通"。如果这套业务系统本身也在更换计划内,可以一并讨论——我们在 LIMS、MES、QMS 等系统上有完整交付能力。
在 GMP / ISO 13485 / CMA 体系下能用吗?
可以用,但要明确身份。在这些体系下,AI 输出被定位为辅助工具的产出,不进入放行、判定或合规结论;凡进入受控流程的内容保留完整审计追踪。如果系统需要纳入质量体系管理,我们可以配套 GAMP 5 框架下的验证文档(URS、风险评估、IQ/OQ/PQ)并配合现场检查提供技术说明。但验证的主体责任在使用方,软件不能替代体系运行。
项目大概要多久?
取决于场景复杂度和文档情况。单一场景、文档质量较好、不涉及复杂接口的项目,从评估到并行试运行通常在两到三个月量级;涉及多系统对接、大量扫描件处理或需要验证文档的项目会更长。评估阶段结束时我们会给出分阶段的时间表,其中会标明哪些环节的耗时取决于贵司内部配合(如文档整理、评估集出题、接口权限开通)。

预约一次场景评估

不是产品演示会,是一次针对贵司具体流程的可行性讨论。带上您手头最耗时的那件事,我们一起判断它适不适合用 AI 解决。

  • 梳理候选场景,明确哪些值得做、哪些建议先不做
  • 清点文档与数据条件,识别前置工作量
  • 对齐部署形态与数据边界要求
  • 给出评估集设计思路与验收标准建议
  • 不把规划能力当作现成功能承诺
电话:13716687203 邮箱:info@zzxytech.com
填写需求表单

沟通前可以先准备

以下信息能让第一次沟通直接进入实质讨论,没有也可以先聊。

  • 希望解决的具体工作,以及目前由谁、花多长时间在做
  • 涉及的文档大致有多少份、什么格式、是否有扫描件
  • 数据能否出内网,是否有机房与运维条件
  • 需要与哪些业务系统交互
  • 是否处于 GMP、ISO 13485、CMA 等体系管理下
北京中泽信业科技发展有限公司方案咨询:13716687203 info@zzxytech.com