感觉ai就是人类社会养孩子,从0把人类社会从子宫里面重新跑一遍
首先最开始人们希望让机器对一些模式进行识别,催生了一些最基础的机器学习来做特征识别(手写数字识别这种),这就像是制造一个人的眼睛
之后人们希望不只是识别而是智能,所以考虑到人类与其他动物的智力区别似乎来自于高级的语言抽象,于是大语言模型应运而生,制造出了一个人的大脑
而单一的大脑只能交流,想让他们来做一些事情,就需要给他们手,在现实世界中自然就是给llm装上机械臂或机器人外壳(具身智能,但是很困难,数据太少,需要较长周期的强化学习),同时在虚拟世界中让llm有手脚(tooluse)
在这个过程中,人们发现简单的llm加tool是比较弱的,还需要一些工程上的改进,很自然地去使用人类自身的成功经验:记忆缺失(加上各种memory机制)、知识缺失(RAG)、失败经验(Reflexion)、草稿修订(Self-refine)、多种可能尝试(ToT/GoT),此时所谓的Agent就诞生了,也就是在虚拟空间中的一个人
之后还是很自然,我们可不可以把Agent的这些操作拆分开,不让Agent做全面的人,而且分工协作组成一个team?当然可以,我们可以把memory专门让一个Agent来管理并提供给其他Agent需要的记忆,可以把检索的工作让一个专门Agent负责,一个manager来拆分任务,在草稿修订中一个人负责产出、一个人负责批评建议、一个人负责改正,让不同的team来独立探索之后把成果筛选合并。如此种种也很显然地与人类社会从原始社会的单人全能走向之后的专业的人做专业的事,分工协作创造更大的收益(多人一定更好?maybe not)
而现在学界和业界在多Agent上的研究主要瓶颈就在于如何把握架构的灵活性和固定性,因为永远没有一个固定的架构可以满足各种各样的需求,但是过于灵活又容易出现架构的冗余和混乱(就像某些大公司的管理混乱,迟钝的架构反而阻碍了效率和创新),而这里的度的把握也让普通大众意识到Agrnt和人的管理都很重要且很难(所以那些领导说不定真的很辛苦?雾),但是我认为人们能给出一个差不多的结果,但是永远没有最好(现实的管理这么多年也一直在进步?退步?),而且也有些研究发现多Agent的通信效率之低、以及多一个员工多一份token之类的问题使得这种组织架构带来负收益。
那我们再往后展望,很多人觉得下一步的方向是持续学习,也就是让AI形成闭环loop迭代,自己改进,自己评价。像不像管理一个country,我们只需要宏观调控,然后让看不见的大手去调节Agent。。。
总结
AI发展经历了 有👀→有🧠→有✋🤚→变成🥸→组成👯→闭环🧬
人则经历了 当子宫孕育AI→给Agent当导师→给一群Agent当老板→给Agent文明当上帝
以上是自己的一些浅谈,有错误请指出,不同意见欢迎讨论