微信扫码

  • 138-3822-3726

138-3822-3726

< >
资讯动态 首页 > 新闻资讯

人工智能开发生命周期的八个核心阶段是什么?

作者:文熙信息科技 日期:2026-08-10 点击:2
一键分享

以下阶段在首次构建时按顺序运行,然后只要系统处于生产状态,就会全部或部分重复运行。


1. 问题定义


首先要决定的是人工智能是否是合适的工具。许多问题用规则、数据库查询或简单的启发式方法就能更快、更可靠地解决。如果问题确实需要模型,团队会定义两种成功标准:一是技术指标,例如验证集上的精确率和召回率;二是业务指标,即模型必须提升的指标,例如减少退款、加快工单处理速度或降低相对于当前基线的预测误差。


16.jpg


可行性问题与目标同样重要。是否存在已标注的数据?或者需要自行生成?错误预测的代价是什么?漏判欺诈的欺诈模型与拦截合法客户的模型,其误差特征截然不同,这种不对称性应决定哪个指标需要优化。伦理和监管审查也应从这里开始,因为预先排查问题用例远比构建完成后再进行修正要划算得多。


2. 数据收集


团队需要识别并获取模型将要学习的数据:内部数据库、事件流、API、物联网传感器和公共存储库。数据量远不如代表性重要。仅从单一地区、单一客户群体或单一季节提取的数据集,可能会导致模型在其他任何地方都无法正常运行,因此,数据采集计划应根据模型实际服务的人群进行评估。


治理始于数据获取,而非部署。每个数据源都需要符合GDPR等法规的法律依据、来源记录以及明确的所有者。生产团队和消费团队之间的数据合同有助于防止上游模式变更在数月后悄无声息地破坏数据管道。


3. 数据准备


原始数据往往包含重复值、缺失值、格式不一致以及标签错误等问题。预处理阶段需要将原始数据转化为可用于训练的数据集:数据清洗、数据源合并、类别值编码以及数值范围归一化。对于监督学习而言,标注通常是此阶段成本高的环节,因此需要评估标注质量,例如,可以安排多位标注者标注同一样本,并检查他们的标注一致性。


具破坏性的准备错误是数据泄露:让来自未来或目标本身的信息渗入训练特征。例如,一个基于仅在客户取消订阅后才会填充的字段训练的客户流失模型,在测试中可能表现出色,但在生产环境中却毫无用处。出于同样的原因,基于时间的数据应该按时间顺序而非随机分割。每个准备好的数据集都应该进行版本控制,以便任何模型都可以追溯到生成它的确切数据。


4. 模型设计


设计会根据问题、数据和运行约束选择合适的算法系列和架构。严谨的起点是一个简单的基线:基于表格数据的线性模型或梯度提升树。该基线设定了更复杂架构必须超越的标准,并且在结构化业务数据上,它通常能胜出。


设计是一个权衡的过程,而非追逐排行榜。深度网络或许能提高准确率,但会牺牲可解释性。在信用评分等受监管的决策中,可解释的模型可能是一项法律要求,而非个人偏好。推理约束也会影响模型架构:一个必须在移动设备上几十毫秒内给出结果的模型,与一个需要整夜处理批量评分的模型,其设计截然不同。TensorFlow、PyTorch 和 Scikit-learn 等框架使得在确定方案之前,可以方便地对这些选项进行实验。


5. 模型训练


训练是指模型将参数拟合到数据的过程,通常神经网络会采用随机梯度下降法,而集成方法则会构建决策树。围绕这个核心循环,是一系列工程设计:使用随机或贝叶斯策略搜索学习率、深度和正则化等超参数;提前停止以防止过拟合;以及设置检查点,以便在长时间运行失败后能够恢复,而无需重新启动。


类别不平衡问题需要通过重新加权或重采样进行显式处理,否则模型会学习忽略通常重要的稀有类别。每次训练运行都应记录其数据集版本、代码提交、超参数和结果指标。实验跟踪是系统性改进与盲目猜测之间的区别所在。


6. 模型评估


评估过程使用从未见过的数据来验证训练好的模型,测试集仅被访问一次。指标的选择至关重要:在不平衡数据上,即使模型从未标记出任何异常,也可能获得接近完美的准确率,仅仅是因为正类样本稀少。精确率、召回率、F1 分数和校准度能够更真实地反映模型的预测性能。


平均值会掩盖失败案例,因此结果还应按细分市场进行细分:例如地区、设备、客户类型和人口统计群体。如果一个模型整体表现良好,但对某个群体表现不佳,这既是公平性问题,也是业务问题。SHAP 和 LIME 等可解释性方法可以帮助团队检查哪些特征驱动了各个预测结果,并发现那些学习了捷径而非预期信号的模型。


7. 部署


部署是将模型投入生产环境的过程,部署模式取决于工作负载:例如,用于夜间作业的批量评分、用于交互式预测的实时 API,或者在延迟和连接性限制下无法往返云端的边缘部署。Docker 用于标准化运行时环境,而 Kubernetes 则负责跨环境的扩展和回滚。


典型的部署失败是训练和服务流程之间的偏差:训练流程中特征的计算方式与生产代码中略有不同的计算方式,这会导致准确率下降,但不会抛出任何错误。在训练和服务流程中共享特征计算代码可以消除这种差异。新模型也应该逐步上线:首先以影子模式运行,对实时请求进行评分但不执行任何操作;然后以金丝雀模式运行,服务于一小部分流量,并在全面切换前设置经过测试的回滚路径。


8. 监控和维护


生产模型的退化主要体现在两个方面。数据漂移是指输入发生变化:例如新产品、新的用户行为或上游字段的重命名。概念漂移是指输入和输出之间的关系发生变化:去年安全的交易模式今年可能被视为欺诈。统计监控系统会将实时输入分布与训练分布进行比较,并在两者出现偏差时发出警报。


20.jpg


由于真实数据存在延迟,实时准确率的衡量变得复杂:欺诈确认或客户流失结果可能在预测后数周才会出现,因此团队在此期间会跟踪替代指标。重新训练会按计划触发,或者在监控指标超过阈值时触发,MLflow 等工具用于管理模型版本,而 Evidently AI 则用于监控模型偏差。在 Webisoft,我们构建和部署企业级 AI 解决方案,并采用完整的生命周期管理,确保模型在发布后持续发挥作用,而不是悄然失效。


本文链接:http://www.rhjmzc.cn/newsdetail_3400730.html


上一条:人工智能开发生命周期的应用有哪些?

下一条:人工智能开发类型及其在企业中的应用是什么?