十二年 Java 之后,我打算怎么进 AI 应用这一行
上个月换了工作。前十二年做的是电商、短链、测试平台这类 Java 后端,新公司的方向是把大模型用到制造业的文档和流程里。方向定了,但怎么进这一行,我想了挺久。
不是换语言
一开始我以为是从 Java 换到 Python。后来发现不是。Python 一周就能写顺手,真正要换的是判断问题的方式。
后端的问题大多是确定的:接口要么对要么错,压测数据要么达标要么不达标。模型相关的问题不是。一个 PDF 解析方案,准确率 90% 算不算成?取决于客户拿它干什么。这种”看用途定标准”的思路,我以前基本不用。
三件先想清楚的事
第一,我的优势在哪。 不在模型本身,那是算法团队的事。我的优势是把不稳定的东西包成稳定的系统:容错、降级、可观测、可回滚。模型输出不稳定,这恰好是我熟悉的领域——上游不可靠时系统该怎么设计,做过支付对接的人都懂。
第二,哪些东西不要碰。 训练模型、调参、写论文,这些不碰。精力放在”模型出来的结果怎么变成客户能用的功能”上。
第三,怎么衡量自己有没有进步。 我给自己定的标准很土:能不能独立把一个 AI 功能从需求做到上线,中间不需要别人兜底。做到了算入门,做到三个算站稳。
先做什么
第一个活是解析客户的技术文档 PDF。文档没有书签,几百页,要按章节切出来给下游用。听起来像个解析问题,其实是个”模型不靠谱时怎么办”的问题。这正好是我想练的。
后面的文章大概都会围绕这类事:模型给了一个不太对的结果,系统怎么把它变对,或者至少变得可用。