1.1 AI应用的定义、边界与核心价值
我做了几年企业数字化,聊到 AI 应用,总有人把它和“大模型”“算法”“自动化脚本”混在一起。我给团队的解释很朴素:AI 应用是把模型能力装进业务流,让某个环节的输入、处理、输出变快、变准、变得可规模复制。它不只是一次问答,也不只是一个炫酷 demo。边界也在这里——模型只负责它擅长的部分,流程、权限、数据、人工兜底,仍要由产品来兜住。
从产品经理视角看,核心价值有三块:省时间、降门槛、提质量。客服每天少写 200 封邮件,运营十分钟生成 50 条标题,分析师把周报从一天压到一小时的初稿。投资人会问我,这值多少钱。我会反问他,这个环节原来占多少人力、错误率多高、响应速度是否影响成交。答案够具体,AI 应用才有落点。
我常对团队说,别把 AI 应用做成烟花。它要像水电,安静地流进业务。价值衡量用三把尺:人力节省、错误下降、响应提速。
1.2 AI应用场景有哪些:ToC、ToB、ToG 全景扫描
我画过一张 AI 应用地图。ToC 面向个人:学习助手、生活助理、健康咨询、娱乐创作、情感陪伴。用户买单的是即时满足和低门槛。创业者喜欢这里,流量大,付费难。
ToB 面向企业:营销内容、客服、销售助手、研发 copilot、人力招聘、供应链预测、财务对账。我陪销售拜访客户,老板关心降本,业务主管关心好用,IT 关心安全。ToB 场景碎,付费意愿靠 ROI 撑。
ToG 面向政府与公共部门:政务热线、城市治理、公共法律、应急指挥、政策问答。我参与过政务问答项目,数据分级、权限审计、信创适配是门槛。ToG 周期长,价值在效率与公平。
1.3 高频场景拆解:内容生成、智能问答、数据分析与自动化决策
内容生成。我见过内容团队用 AI 做选题、标题、脚本、图片、视频初剪。省的是草稿时间,不是创意判断。人负责调性和事实核查,模型负责铺量。
智能问答。企业知识库、客服、员工 IT 支持、政策咨询。我的经验:问答准不准,七成看知识库质量,三成看模型和检索。RAG 是常见做法。用户要的是答案带出处。
数据分析与自动化决策。我陪 CFO 看报表,AI 能把自然语言转 SQL,做归因,生成洞察。自动化决策用在风控、补货、排班、定价。边界是高风险决策要留人工审批。模型可以建议,责任在人。
1.4 场景选择与可行性判断:需求、数据、ROI 与风险
我判断一个 AI 应用场景,先问需求。谁疼?多疼?多久疼一次?有人愿意为它掏钱或腾预算吗?伪需求常是“老板觉得酷”,一线不用。真需求是每天有人重复干、干得烦、还容易错。
再看数据和 ROI。数据在哪儿?能不能取?干净吗?合规吗?ROI 算三块:人力节省、收入提升、风险成本下降。我见过一个客服项目,模型答得不错,数据权限没打通,上线拖了半年,ROI 被拖没了。
风险要摆上台面。幻觉、隐私、版权、监管、供应商锁定。我的做法:低风险场景先跑,高频小闭环先上。别一上来碰核心交易。场景选择不是找最炫的,是找最值得先做的。
我常跟刚入行的产品经理说,场景想清楚只是拿到入场券,技术栈选错,后面每一步都贵。AI应用开发不像传统软件,模型、数据、检索、评测、成本,几个变量互相拉扯。我做过ToB客服、企业知识库、内容生成中台,踩过的坑比写过的PPT多。这一章聊技术底座,不堆名词,讲我怎么做判断。
2.1 大模型API、开源模型与本地部署选型
选型会上,团队总有人问:用GPT、Claude,还是开源Llama、Qwen?我的回答先看业务阶段。验证期,大模型API最省事。接一个Key,一天出Demo,适合需求还没定型的场景。API按Token付费,弹性好,不用管GPU。小团队做AI应用开发,这条路最快。
放量阶段,成本、合规、延迟会逼你重新算账。开源模型能私有化,数据不出域,适合金融、政务、医疗。代价是GPU、推理框架、运维人力。我陪CTO算过,一张A100按小时烧钱,并发一上来,缓存和量化必须做。本地部署不是技术炫耀,是数据主权和长期成本的平衡。
我踩过一个小模型陷阱。为了省Token,选了个7B模型做合同问答,幻觉多到法务拒绝签字。人工返工成本比API贵三倍。我的选型清单:任务难度、并发量、数据敏感度、预算、团队运维能力。小场景API先跑,大企业混合架构。别一刀切。
2.2 Prompt工程、RAG、微调与Agent框架
Prompt工程是AI应用开发的基本功。我让团队把Prompt当SOP写:角色、目标、约束、输出格式、示例。客服问答加一句“不确定就拒答”,幻觉能降一截。Prompt能调风格、控格式、防跑偏。模型不知道企业私有知识,Prompt救不了这个。
RAG是我最常用的方案。企业文档切块、向量化、检索、拼上下文,再让模型回答。知识库问答、政策咨询、客服助手,RAG先上。微调适合调风格、固定格式、领域术语。拿微调灌知识,更新慢,成本高。Agent框架适合多步骤任务,查订单、发邮件、调CRM。我的建议:Agent从单点闭环做起,别造万能助手。
技术组合看场景。内容生成用Prompt加轻量微调。智能问答用RAG加Prompt。工作流自动化用Agent加API工具。框架选LangChain、LlamaIndex、Dify、Coze,看团队熟悉度和部署要求。框架是脚手架,不是房子。我见过为了用框架把简单问题做复杂的团队,上线时间翻倍。
2.3 数据准备、向量数据库与知识库构建
数据准备是脏活累活。我做过一个企业知识库项目,七成时间花在清洗PDF、Excel、Confluence页面。文档版本乱、权限杂、表格图片难解析。分块大小影响召回,太小丢上下文,太大噪声多。我的做法:按标题层级切,保留元数据,表格单独处理。更新机制要提前设计。
向量数据库选型看数据规模、延迟、过滤、运维。Milvus、Qdrant、Weaviate、PGVector、Elasticsearch都能用。小团队用PGVector省事,数据上亿考虑Milvus。知识库构建不只是向量,权限、出处、版本、标签都要进元数据。政务项目里,检索前按部门过滤,用户看不到不该看的。
知识库需要运营。文档过期,答案就错。我建议设知识负责人,每月 review 高频问题,用户点踩就回看检索和生成。知识库质量决定问答上限。模型换一代,知识库烂,效果还是烂。这是长期活,不是一次性项目。
2.4 评测、监控、安全与成本控制
评测是上线前的刹车。我见过只看Demo就发布的团队,线上被用户骂到关停。评测集要覆盖真实问题、标准答案、检索命中、生成质量、拒答边界。自动评测跑回归,人工抽检看体验。指标看准确率、召回率、幻觉率、响应时间、满意度。没有评测,迭代就是盲人摸象。
监控要记录请求、检索结果、模型输出、Token消耗、延迟、报错。异常报警接上值班。安全方面,提示注入、数据泄露、越权访问、敏感内容都要防。输入输出过滤,权限校验,审计日志。我做金融项目时,任何回答都要能追溯到文档和权限。安全不是加个关键词黑名单就完事。
成本控制要进产品设计。API按Token,向量检索按量,GPU按小时。优化手段:缓存高频问答、小模型路由、上下文压缩、批处理。我算过一笔账,客服机器人每天一万次调用,Token成本能吃掉项目利润。成本、效果、体验三个变量,产品经理要一起管。上线后才发现烧钱,回本很难。
我手机里存着一张截图,2023年3月,一个企业知识库项目上线第一周,用户满意度32%。两个月后,数字爬到81%。这中间没有换模型,没有加GPU,全靠把RAG管线拆开重做。这一章我拿四个自己深度参与的项目,讲AI应用从Demo到能用、好用的真实过程。每个案例都有翻车、有返工、有上线。
3.1 实战案例:企业知识库智能问答与RAG应用
那是一家做工业设备的公司,售后维修手册堆了二十年,PDF、Word、扫描件混着放。客服每天接三百通电话,老师傅凭经验答,新人翻文档翻到哭。老板想做个智能问答,让新人也能快速上手。我接这个项目时,Demo只花了两天,RAG跑通,效果看着还行。
上线第一周,灾难。用户问“XX型号泵体密封圈更换周期”,系统从三份不同年份的手册里各取一段,拼了个自相矛盾的答案。用户按错的周期换了密封圈,机器漏油,投诉到老板那里。我连夜查检索日志,发现问题出在分块策略。按固定512字符切,一份手册的警告段落和操作段落被拦腰截断,检索时把警告丢了,只召回操作步骤。
返工方案我做了三件事。PDF解析换成带版面分析的方案,表格单独提取成结构化数据。分块改成按标题层级切,每个块保留所属章节路径、文档版本号、适用机型。检索环节加了一道元数据过滤,用户问具体型号,先按机型筛再向量检索。这三步做完,准确率从52%拉到79%。
知识库的更新机制才是真正的坑。维修手册每季度修订,旧版本必须下线。我设计了一套文档版本管理:同手册只保留最新版可检索,旧版归档但带“已过期”标签。用户提问时如果命中过期内容,系统会提示“该文档已被新版替代”。这个功能救过我们一次,某型号安全阀参数改过,老客服还在按旧参数指导客户,系统拦住了。
权限设计也是血的教训。售后部门和研发部门用同一套知识库,但研发的测试报告不该给售后看。早期没做权限过滤,售后问了个技术参数,系统把研发的内部测试报告片段返回去了。虽然没造成泄密,但这事吓得我连夜加了RBAC。检索前先按用户角色过滤文档范围,再做向量匹配。政务项目里这套逻辑更要命,不同科室的数据必须是物理或逻辑隔离的。
知识库运营我后来固化成一个流程。每周跑一次高频问题报表,检索命中率低于60%的问题自动进待办。每月让业务专家review十组问答,标记“答案有用”或“答案有误”。有误的案例反哺分块和Prompt优化。这个闭环跑了半年,知识库从“能用”变成“好用”。我总结一句话:RAG的效果上限不在模型,在数据治理。
3.2 实战案例:AI客服、销售助手与工作流自动化
第二个案例是一家电商公司,客服团队八十人,大促期间咨询量翻五倍,临时招人培训来不及。老板想用AI客服顶掉六成重复问题。我进去先做了一件事:把过去三个月的客服对话导出,聚类分析。结果发现Top20问题占了总咨询量的73%,退货政策、物流查询、尺码推荐、优惠券使用,全是标准流程。
AI客服方案我分了三条线。标准问答走RAG加Prompt,知识库是商品详情、售后政策、物流规则。多轮对话走Agent,比如退货流程,Agent会问订单号、确认商品状态、生成退货单、发短信。情绪安抚走另一个Prompt,识别用户语气,触发歉意话术或转人工。三条线用路由分发,简单问题AI答,复杂问题十五秒内转人工。
销售助手是另一个场景。电销团队每天打两百通电话,新人话术不熟,转化率只有老销售的三分之一。我做了个实时话术推荐:通话中转写客户说的话,检索相似场景,弹出推荐回复。老销售的优秀话术被切片入库,新人边打边学。上线一个月,新人转化率从4%爬到9%。这个功能的核心不是模型多强,是话术切片的质量。
工作流自动化我踩过一个坑。客户想让我做个“万能助手”,查订单、改地址、发优惠券、催物流全包。我做了个Agent原型,发现多工具调用时错误率飙升。查订单成功,改地址时API超时,Agent不知道下一步该干嘛,卡住了。我后来砍掉一半功能,只做“查订单+催物流”两个闭环。上线之后反而稳定,日均处理两千次请求。
Agent的可靠性靠工程,不靠模型。我加了几个东西:每个工具调用设超时和重试上限;关键操作前让Agent复述一遍确认;所有API返回结构化JSON,Agent解析失败就降级到人工。这些看起来笨,但线上跑得稳。我见过追求全自动的团队,Agent自作主张给用户退了款,财务追了三天。自动化要划边界,高风险操作必须有人工确认。
成本这块我算过细账。AI客服每天处理一万两千次咨询,Token成本约四十美元。加上向量检索和服务器,月成本不到两千美元。对比之下,一个客服月薪六千人民币,八十人团队。ROI在第二个月就正了。大促期间AI顶住了峰值,没临时招人,省下的招聘和培训成本更可观。
3.3 实战案例:多模态内容生成、审核与运营提效
第三个案例是家内容平台,每天需要生成大量商品描述、活动文案、短视频脚本。编辑团队二十人,产能瓶颈明显。我进去时,他们的流程是:编辑写初稿,主管审,法务过合规,再发布。平均一篇商品描述耗时四十分钟。老板想用AI把初稿时间压到五分钟。
内容生成我用的是Prompt加轻量微调。基础模型用API,Prompt里塞商品属性、卖点、目标人群、平台调性。先跑了一批测试,发现生成质量不稳定,同一款商品,有时写得很专业,有时像地摊广告。我分析原因,Prompt太泛。后来拆成模板:数码产品用“参数+场景+对比”,服装用“面料+搭配+场合”,食品用“口感+原料+食用场景”。模板化之后,初稿可用率从35%提到68%。
图片来源也做了AI处理。商品图背景杂乱,用图像分割模型抠图换白底。详情页需要场景图,用文生图生成“客厅使用”“户外携带”等场景。视频脚本生成走另一条线,输入商品信息,输出分镜脚本和旁白。编辑只需要调整细节,不用从零写。有个编辑跟我说,以前一天憋三篇,现在一天改十篇。
审核环节是重点。AI生成内容必须过三道关:敏感词过滤、事实性校验、版权风险检测。敏感词用规则引擎,快但不够,有些变体能绕过。我加了一层语义审核,用小模型判断“是否包含绝对化用语”“是否暗示医疗功效”。事实性校验比较麻烦,生成内容里的参数、价格、活动规则必须和数据库一致。我做了个结构化校验,AI生成的每个数字都回查数据库。
版权检测是我最紧张的环节。文生图可能撞图,AI写的文案可能撞句。我接入了图片相似度检索和文本查重,生成内容发布前跑一遍。有次一条视频脚本和某竞品文案相似度87%,自动拦截了。后来我强制要求:AI生成内容必须标注,用户投诉要有追溯。平台后来把这条写进了创作者协议。
运营提效不止生成。我用AI做了评论分析,每天抓取商品评论,聚类出“物流慢”“尺码偏小”“色差大”等标签,推给运营和供应链。这个功能帮他们提前发现了一个爆款商品的尺码问题,赶在退货潮前修改了详情页尺码表。运营主管说,以前看评论靠翻,现在看日报靠推。
3.4 从Demo到生产:部署、迭代与团队协作
Demo和生产之间隔着一条河,河里全是细节。我做过一个统计,自己经手的AI项目,Demo平均三天,上线平均六周。多出来的时间花在:异常处理、降级方案、日志监控、性能优化、安全审计。这些东西用户看不见,但缺一个就会翻车。
部署方案看场景。小规模用API加云服务器,一周能上线。中等规模用容器化,K8s管推理服务,按并发自动扩缩。大规模或数据敏感场景走私有化,GPU集群加模型服务框架。我经历过一次大促,API供应商限流,幸好做了本地小模型降级方案,虽然效果差些但没断服务。生产环境不能有单点依赖。
迭代节奏我定了个规矩:每周一个小版本,每月一个大版本。小版本改Prompt、调分块、加FAQ,大版本改架构、换模型、加功能。每次迭代必须跑评测集,指标掉了就回滚。有次我们换了个新模型,通用能力更强,但在我们垂类场景的准确率掉了六个点。评测集拦住了这个变更,节省了两周返工。
团队协作是AI项目最容易被低估的环节。一个AI应用需要产品经理定场景,算法工程师调模型,数据工程师理数据,后端工程师做服务,前端做界面,测试做评测,运维做监控。我见过算法工程师闷头调模型,产品经理不知道进度,上线前一天发现API接口没联调。后来我强制要求:每日站会,每周Demo,文档在线化。
我带队时有个习惯,每个项目设一个“AI质量负责人”。这个人不写模型代码,专门盯评测集、盯bad case、盯用户反馈。有次质量负责人发现,用户问“怎么退货”的满意度在下降。查日志发现,AI答的是政策原文,用户想要的是操作步骤。我们改了Prompt,满意度回升。这个角色像质检员,没有他,团队容易自我感觉良好。
从Demo到生产,最大的敌人是“差不多就行”。Demo可以容忍80分,生产必须95分以上。剩下的15分靠工程、靠流程、靠人。我常跟团队说,AI应用不是模型秀,是产品。用户不关心你用什么模型,只关心问题有没有解决。上线那天才是开始,不是结束。
我跑过不少行业,发现AI落地这件事,技术只占三成,剩下七成全是行业知识。每个行业有自己的数据形态、合规红线、使用习惯。拿同一套RAG架构去套金融和政务,结果可能完全相反。这一章我聊五个行业的真实落地情况,再谈技术趋势、风险治理,最后给一份我帮企业做过的落地路线图。
4.1 行业落地:金融、医疗、教育、工业与政务
金融行业我参与过三个项目。银行内部知识库、保险智能核保、券商投研助手。金融数据敏感度极高,模型必须私有化部署,数据不出内网。监管要求所有AI输出可追溯、可解释。我做过一个风控辅助系统,模型给出拒贷建议时,必须附上具体规则和客户数据片段。纯黑盒模型过不了合规。金融场景里幻觉等于误导,我们设了双人复核机制,AI只做初筛,最终决定权在人。
医疗行业我聊过十几家医院。医生对AI信任度低,这是好事。我见过一个病历质控系统,AI标出遗漏项,医生确认后才修改。辅助诊断场景更谨慎,影像初筛结果只做参考,诊断报告由医生签发。医疗数据不能出医院,我们做本地部署,模型量化后跑在科室服务器上。伦理审查是硬门槛,涉及患者数据的项目要过医院伦理委员会。有个项目因为没做数据脱敏,被叫停了三个月。
教育行业我接触过两家公司。一家做作业批改,一家做个性化答疑。学生数据涉及未成年人,合规要求比成人更严。内容安全是红线,AI生成的讲解不能出现价值观偏差。我见过一个答疑机器人,学生问历史事件,AI答得中立,但家长投诉“立场不够鲜明”。后来我们加了价值观对齐层,所有输出先过安全模型。教育场景的落地节奏慢,家长和学校都怕出错,试点周期比金融还长。
工业场景我印象最深。一家汽车零部件工厂,用AI做视觉质检。产线上零件每分钟过六十个,人眼盯不过来。我们部署了边缘盒子,跑轻量检测模型,缺陷识别率从人工的82%提到96%。工厂环境恶劣,油污、震动、光线变化,模型要定期用新数据微调。设备预测性维护是另一个场景,振动传感器数据加时序模型,提前三天预警轴承故障。工业客户不看模型参数,只看停机时间减少了多少。
政务行业我做过两个项目。12345热线智能助手、政策匹配系统。政务数据分级严格,不同科室数据逻辑隔离。我们做检索时先按用户身份过滤文档范围,再做向量匹配。政策更新快,今天发的文件明天可能废止。我们建了版本管理,旧版归档但标记过期。用户提问命中过期政策时,系统会提示“该政策已被新文件替代”。政务场景要求零幻觉,答不上来就转人工,不能编。
4.2 技术趋势:多模态、Agent、端侧AI与具身智能
多模态是这两年最明显的变化。我最近做的项目全是图文混合输入。用户拍一张设备照片问“这个零件型号是什么”,或者上传一份带表格的PDF问“第三季度数据”。早期方案是OCR加文本模型,表格和图表信息丢失严重。原生多模态模型能直接理解版面,省掉中间环节。我测过一个保险理赔场景,用户拍事故照片,模型识别车辆损伤、估算维修范围,准确率比OCR方案高二十个点。
Agent框架在快速成熟。工具调用标准化之后,Agent可以串联搜索、数据库、API、邮件。我见过销售Agent自动查客户历史、写跟进邮件、排日程。但Agent的自主性必须分级。低风险操作全自动,高风险操作要人工确认。上一章聊过Agent卡住的坑,现在框架有了超时、重试、状态机,可靠性好了不少。我判断未来两年Agent会从“演示品”变成“生产力工具”,前提是工程化跟得上。
端侧AI我亲自试过。手机跑了一个三十亿参数的小模型,离线问答、摘要、翻译都能用。端侧优势是隐私、低延迟、无网可用。企业场景里,工厂边缘设备跑质检模型,医院科室服务器跑病历脱敏。模型压缩和NPU芯片进步很快,端侧能做的事越来越多。我见过一个离线会议记录工具,录音不上传,本地转写加摘要,法务部门特别喜欢。
具身智能我参观过几家机器人公司。机械臂加视觉加语言模型,能理解“把红色零件放到左边盒子”这种指令。工业分拣、仓储搬运先落地,家庭场景还早。挑战在数据采集,机器人操作数据比文本数据难获取。安全也是问题,机械臂伤人事件有过报道。我判断具身智能会在三到五年内先在封闭工业环境规模化,开放环境需要更长时间。
4.3 风险合规:数据隐私、版权、伦理与幻觉治理
数据隐私是AI应用的第一道红线。我处理过用户数据脱敏,原则是最小化收集、加密存储、访问审计。国内PIPL、欧盟GDPR都要求告知同意、目的限制、跨境评估。企业用AI之前,数据分类分级是前提。我见过一家公司把客户合同直接喂给公有大模型,后来被法务叫停。内部知识库要做权限隔离,研发数据不能给售后看,患者数据不能给行政看。
版权风险在生成式AI里特别突出。训练数据要有授权,生成内容要查重。文生图容易撞图,我接过一个项目,AI生成的商品海报和某图库作品相似度91%,差点被告。文本生成也要查重,AI写的文案可能撞句。我现在的做法是生成内容发布前跑图片相似度检索和文本查重。平台侧要求标注AI生成,用户有知情权。商用场景必须确认版权归属,否则风险自担。
伦理问题我见过几个真实案例。招聘AI筛简历,训练数据里男性工程师占比高,模型给女性简历打分偏低。算法偏见来自数据偏见,需要人工复核和定期审计。医疗AI的伦理审查更严,涉及生命健康不能试错。政务AI要避免歧视性输出,比如政策匹配不能因为户籍或年龄区别对待。我建议企业设AI伦理委员会,业务、法务、技术三方参与。
幻觉治理是AI应用最大的技术风险。金融、医疗、政务场景里,幻觉等于事故。我的做法分四层:RAG grounding让答案带引用;事实性校验把生成数字回查数据库;不确定性表达让AI说“我不确定”;人工兜底转专家。评测集里专门放幻觉案例,每周跑一次。我见过一个法律咨询AI编造法条,用户差点按错的条款起诉。幻觉治理不是模型问题,是产品问题,必须工程化解决。
4.4 企业AI应用落地路线图与组织能力建设
我帮企业做过AI落地规划,一般分四步走。场景扫描阶段,找高价值低风险场景,比如内部知识库、会议纪要、客服辅助。试点验证阶段,选一个部门小范围跑,跑通ROI再推广。规模推广阶段,建平台、定规范、做培训。组织固化阶段,把AI能力嵌入业务流程,设专职团队运营。我见过跳过试点直接全员推广的,三个月后没人用了。
组织能力建设是落地成败的关键。AI项目需要三种人:懂业务的专家、懂模型的工程师、懂产品的运营。我见过只招算法工程师的团队,做出来的东西没人用。AI产品经理要既懂业务痛点又懂技术边界。数据治理团队负责数据清洗、标注、权限。我建议设立“AI质量负责人”角色,专门盯评测集和bad case,不写模型代码。
文化阻力常被低估。业务部门怕AI替代自己,消极配合。我的做法是先做助手不做替代,让业务人员参与设计。培训他们用AI工具,设立AI创新奖鼓励提场景。高层要有耐心,AI不是快药,第一年可能只有局部收益。我见过一个企业,老板要求三个月见效,团队仓促上线,出了合规事故,项目直接砍掉。小步快跑,边跑边修,比等完美方案更实际。
评论
发表评论