从深度学习、ReAct 这类基础概念,到 Ollama、Gradio 这类工程工具,再落到知识库与运维场景。

一、模型与推理范式

深度学习

深度学习用多层神经网络从原始数据里学特征,而不是依靠人工构造规则。卷积网络拿图像局部模式,循环网络拿时序依赖,Transformer 用自注意力拿长距离关系。训练本质是反向传播把损失传到参数,再用梯度下降更新。数据质量、标注一致性和评价集分层,往往比换一个更新的网络结构更影响结果。

工程上常把流程拆成数据管线、训练环、推理服务三段。训练环要记录超参数与随机种子,否则结果无法复现。推理要看延迟、吞吐和漂移:线上分布和训练集不一致时,模型会突然变脏。对业务团队而言,先定一个可量化的指标和误判成本,再决定用多深的模型;否则容易把调参当成目标本身。

YOLO

YOLO 把目标检测当成一次回归:一张图划分网格,每个格子直接预测框和类别,因此推理快。从 v1 到后续版本,主干、损失和标签分配不断改,但“单阶段、端到端”这条主线没变。工业现场用它做人员、车辆、缺陷检测,关键指标是召回、误报和端侧延迟,而不是论文里的 COCO mAP。

落地时先用自己的数据微调,类别要少而准。输入尺寸、NMS 阈值和置信度要按现场光照调。量化到 INT8 前要校准集。漏检和误报的代价不同,安防更怕漏,质检更怕误。把难例从生产视频里抠出来再标注,比盲目换更大模型更有效。部署后持续看混淆矩阵,类别漂移时及时重训。

什么是ReAct?

ReAct 是 Reason + Act:模型先思考下一步,再调用工具,把观察写回上下文,循环直到能回答。它让大模型跳出纯文本,去查搜索、跑代码、读数据库。Agent 框架里的工具循环大多是这个模式。关键不是提示词里写了 Thought,而是观察必须来自真实工具输出。

落地要限制工具白名单、参数校验和最大轮次。没有观察就允许下结论,模型会幻觉。工具失败要明确返回错误,让下一轮改策略。对用户展示时,可折叠中间步骤,避免把内部推理全抛出。评估用任务成功率而不是文笔。ReAct 适合需要最新信息或计算的问题;纯知识问答不必强行走工具,以免又慢又贵。

CoT、ToT与ReAct对比

CoT 让模型先写出中间推理再给答案,适合算术和需要分步的题。ToT 把思路展开成树,在多个候选路径上搜索,适合规划类任务,代价是调用次数明显增加。ReAct 把推理和行动交错:想一步、调用工具、观察结果、再想,适合检索和需要外部环境的问题。

选型看任务是否需要外部事实、是否允许多次调用。纯推理用 CoT 就够;要搜索或执行代码就用 ReAct;候选空间大且可打分再用 ToT。共同风险是胡编步骤。要用可验证的观察约束模型,并设最大步数。评估时不要只看最终答案,还要看工具是否被滥用。把三种模式写成可切换策略,比绑死某一种提示词更利于迭代。

二、工程工具

Ollama

Ollama 在本地拉起大模型,用类 OpenAI 的 HTTP API 提供对话和嵌入。模型以 Modelfile 描述,可改系统提示、参数和来源。对开发者来说,它把“下载权重、量化、起服务”收成几条命令。适合内网试用、离线演示和把私有文档留在本机。

显存不够时选量化档,并限制上下文长度。API 兼容不等于行为兼容,工具调用和 JSON 模式要实测。多模型并存时用标签管理版本。服务不要裸露到公网。和 RAG 搭配时,嵌入模型与对话模型要分开评估。日志里记录模型名和参数,否则同样提示结果对不上。Ollama 降低了本地推理门槛,生产级还要补并发、鉴权和监控。

Gradio

Gradio 用几行 Python 就能把模型函数包成可交互的 Web 界面,适合演示分类、生成和语音任务。它自动生成输入组件、排队和分享链接,常用于 Hugging Face Spaces 和内部验收。

做演示时要把输入长度、文件类型和并发限制住,避免把 GPU 打满。接口不要默认公网可写生产数据。复杂工作流可以和 FastAPI 组合,Gradio 只负责界面。版本之间组件 API 变化较快,示例代码要钉死版本。若产品需要权限、审计和多租户,应迁到正式前端,而不是长期把 Gradio 当生产门户。

JSONL

JSONL(JSON Lines)是每行一个 JSON 对象的文本格式,适合流式写入和按行处理大规模记录。训练数据、日志导出和批处理任务常用它,因为不必把整个数组读进内存。

约定包括:UTF-8、一行一条、对象之间不要逗号。错误行可以跳过而不毁掉整个文件。和普通 JSON 数组相比,追加新记录成本低。注意换行必须是记录边界,字段内的换行要转义。工具链上 jq、pandas 和多数训练框架都认这个格式。写文件时定期 flush,并校验每行能被解析。压缩用 .jsonl.gz 保持按行可拆分。

CodeGraph

CodeGraph 把代码变成节点和边:文件、符号、调用和依赖关系可查询。Agent 和代码搜索可以沿图走,而不是只靠全文关键词。对大型单体和多仓库尤其有用,能回答“谁调用了这个接口”。

构建图需要解析器、增量更新和跨语言统一标识。精度取决于能否解析宏、反射和动态加载。过期图比没有图更危险,提交后应触发局部重建。

落地时先服务跳转和影响分析,再接到自动重构。权限上图等于源码索引,访问控制要和代码库一致。评测看查询延迟和边的正确率,而不是节点数量海报。

三、落地形态

企业知识库 开发与设计

企业知识库要把文档、制度、工单和对话沉淀成可检索的知识,并控制谁能看见什么。设计上要有来源、版本、权限和过期时间,否则检索结果会过时或泄密。问答场景常叠加向量检索,但结构化目录和权限过滤仍然是基础。

入库要做解析、切片和元数据打标,表格与扫描件走专门管道。更新策略必须能撤回错误条目。评估看引用是否可追溯到原文,而不是只看回答流畅。权限按空间和文档 ACL 下推到检索层。运营上指定知识管理员,避免全员乱写。没有治理的知识库很快会变成不可信的网盘。

Aiops智能运维

AIOps 把监控、日志、调用链和变更记录放进同一套分析管道,用异常检测替代纯阈值告警。目标不是再堆一块大屏,而是缩短“发现异常到定位变更”的路径,减少半夜无效叫醒。

落地顺序通常是:先统一指标口径,再做基线与关联分析,最后才上自动止损。没有干净的 CMDB 和变更审计,模型很容易把发布当成故障,或把故障当成流量高峰。

评估效果要看告警压缩率、平均定位时间和误报回退,而不是模型准确率海报。人工确认过的工单必须回流训练,否则智能运维会停在演示阶段。

AI Design

AI Design 指用大模型辅助界面与视觉设计:从文字生成线框、从截图还原组件、再到和 Figma 往返改稿。常见工具链包括 Claude 做结构化描述、Figma 做可编辑稿,以及各类 stitch / open design 插件把生成结果接进设计系统。

它擅长探索多种布局,但不懂品牌约束和可访问性细节。落地时应把设计 token、间距和组件库作为上下文,而不是每次从空白生成。评审仍要人看对比度、触控热区和空状态。生成图不能直接当切图生产。把 AI 当加速草图的同事,最终交付以设计系统为准,才能避免每页风格漂移。

Harness Engineering

Harness Engineering 关注如何给 Agent 套上缰绳:工具边界、上下文组装、评估和运行时隔离。模型本身会变,真正决定可靠性的是外围:哪些文件能改、命令超时、测试如何门禁、失败如何回滚。好的 harness 让同一模型在仓库里可重复干活,而不是每次聊天都从零解释项目。

实践包括仓库内技能文档、沙箱、差异审阅和自动评测集。权限默认最小,网络和密钥白名单。观测记录每步工具调用,便于定位循环。把提示、工具和策略当成代码做版本管理。评估用真实任务而非合成闲聊。Harness 工程的目标是把 Agent 变成受控的自动化工人,而不是更会说话的聊天窗口。