Agent Infra
前置:写过一个能跑起来的聊天机器人或 Agent。不需要懂运维,也不需要用过任何一个下面提到的产品。
一、一个客服机器人上线的第一周
假设你做了一个客服机器人。本地跑通了:用户提问,它调模型,需要的时候查一下订单系统,然后回答。这时候你手上就是一个文件、几百行代码,跑得挺好。
然后你把它放到公司内网,让二十个同事试用。一周之内会依次发生这些事:
这六件事有一个共同点:没有一件属于「客服机器人」这个业务本身。 如果你接着再做一个报销助手、一个代码审查机器人,它们会原样再撞一遍,一件都不会少。
既然每个 Agent 都要重做一遍,那就干脆把它们从业务里抽出来,做成一层所有 Agent 共用的东西。这一层就是本板块说的 Agent Infra,共七个专题、55 篇。上面六件事分别对应其中六个专题,第七个(训练环境)晚一点再说。
二、这一层和上下两层怎么分
站内一共三个板块。它们不是三个话题,而是同一条链路上的三段 —— 从你写的业务代码,一直到显卡:
分界线不好背,但很好试。同一个现象 ——「用户说这次回答变慢了」—— 三个板块给出的排查方向完全不同:
| 如果慢的原因是 | 那这是哪一层的事 |
|---|---|
| 模型本身吐字就慢了:显卡上挤着太多请求,轮到你这条的时候一个字一个字往外蹦 | AI Infra |
| 模型不慢,但这一个问题被你的程序拆成了七八次模型调用,一次一次串着来 | Agent 应用 |
| 模型不慢,调用次数也没变,但请求先在队列里排了两秒,或者被发给了一台刚刚才恢复的机器 | Agent Infra |
三者的差别可以浓缩成一次试探:把模型供应商换成另一家,问题还在不在?
还在,而且跟「机器人怎么想问题」也没关系 —— 那它就属于 Agent Infra。换完就好了,说明卡在模型那一侧,属于 AI Infra;换了没用、但把编排流程改一改就好了,属于 Agent 应用。
三、七个专题分别管什么
七个专题不在同一个时间尺度上。前五个都发生在「用户按下回车到看到回答」这几秒之内,后两个则要跨过这几秒 —— 一个跨到进程重启之后,一个跨到下一次会话: