标签 大模型 下的文章

  宛若一颗“核弹”, 其冲击波不但震动了整个科技领域, 而且已达成破圈效应, 在全球范畴内引发了AI热潮。

  虽然, 被好多人当作「正正经经地瞎扯乱说」来调侃, 可是, 这没办法拦住业内对它那具有革命意义的看好态度: 英伟达的创始人黄仁勋觉得, 这属于人工智能领域的关键时候;微软的CEO Satya表明, 它会重新塑造几乎全部的软件, 甚至是整个互联网;还有从业者大声叫嚷, 这是AGI也就是通用人工智能发展进程里的一座里程碑。

  一轮接一轮的科技革命, 极易使人陷入宏大叙事的激动与焦虑之中, 反而常常致使背后基本逻辑遭受忽视, 其实这是一个语言类对话模型, 它的成功源自背后大规模语言模型(Large Model, LLM)这些年取得的迅猛进展, 这才是更值得备受关注以及深入讨论的问题关键所在。

  本次, Park 直播, 会由极客公园创始人, 以及总裁张鹏, 和「乱翻书」主理人潘乱一同主持, 特别邀请了中国大模型领域的多位创业者进行连麦, 一起去聊聊火爆背后, 大模型的底层逻辑, 以及未来应用。

  直播可能会聊到:

  1. 为什会成为人工智能的“杀手级应用”, 它又会带来哪些变革性的改变。它究竟还会带来什么样翻天覆地的革命变动。

  2. 为什么所有公开的对 GPT-3 的复现都失败了?

  3. 对话 AI/聊天机器人是下一代人机交互的曙光吗?

  4. 到底大模型能力的边界处于何处, 它是否会迅速抵达本身的瓶颈, 是否会进入到平台期? 后续它又会怎样去演进?

  5. 除了对话之外, 大模型还有哪些应用方向是值得去予以关注的, 并对属于创业公司的机会究竟在哪里提出疑问呢?

  6. GPT - 3是在2020年发布的, 可是为何一直到现在我们才发觉并且开始思索其背后的范式转变? GPT - 4还有哪些能够想象的空间?

  2月26日,这一天是周日, 就在下午14:00的时候, 要在Park那里进行直播相见!

  嘉宾介绍

  周明, 是澜舟科技的创始人以及 CEO, 他如今担任着中国计算机学会的副理事长, 同时还是创新工场的首席科学家, 以前曾出任国际计算语言学学会的主席, 也当过微软亚洲研究院的副院长, 在 2021 年创立了认知智能公司澜舟科技, 其专注于去开发最为先进的下一代认知智能技术, 这涵盖了自然语言以及多模态信息的理解与生成, 还有机器翻译、知识图谱、问答和推理、行业搜索、知识服务等等。

  黄民烈, 身为清华大学计算机科学与技术系长聘副教授, 是聆心智能的创始人, 还是自然语言生成与智能写作专委会的副主任。其主要研究领域涵盖大规模语言模型、对话系统、自然语言生成以及拟人化AI。他曾以第一完成人的身份荣获中国人工智能学会吴文俊人工智能科技进步奖一等奖。他是研发任务型对话系统平台以及世界上最大的中文对话大模型EVA、OPD, 智源中文大模型CPM的核心研发成员, 在知识对话、情感对话方面有着开创性成果。

  罗江春, 其身份为一览科技创始人兼CEO、风行在线创始人兼董事。他拥有清华大学机械工程跟企业管理双学士、美国赖斯大学计算机科学硕士学位。在2005年时, 他创办了「风行在线」, 借此开创了中国互联网高清视频产业的机会。他创新研发出了全球首款“边下边看”视频软件以及FSP点播平台, 从而推动风行成为全球领先的网络视频平台。到了2017年, 他创办了一览科技, 其侧重于视频商用服务领域, 并且在人工智能应用方面投入了海量的研究以及落地实践。在2018年的时候, 有人曾在乌镇的世界互联网大会上做出预测, 提出AIGC也就是机器生成视频内容, 在5年之内将会实现, 并且会成为主流。

  肖涵, 身为 Jina AI 的创始人以及 CEO。, 这个 Jina AI , 属于一家开源初创企业, 它专门聚焦于基于深度学习的多模态搜索以及生成式 AI 的相关领域。而且, 它总计得到过来自像 GGV、云启资本、SAP 这般的中美投资机构所给予的 3750 万美元的融资。从 2020 年创立以来, 这家公司连续两年都登上了 CB 全球 Al 百强的榜单, 还光荣地登上了 DACH AI 30 2020 的榜单。还有, Jina Al 十分推崇工程师文化, 并且积极地拥抱开源。设在德国柏林的公司总部, 在中国设有办公室, 在美国也设有办公室。团队成员来自微软, 来自谷歌, 来自腾讯, 来自Adobe等顶尖科技公司, 覆盖超过全球10多个国家。

  有个叫龙海涛的人, 他是启元世界联合创始人, 同时担任CTO。他是深度强化学习技术方面的专家, 曾经任职于阿里巴巴认知计算Lab担任系统架构师, 在那里带领团队完成了「双十一」搜索架构的搭建工作, 他还曾是IBM中国研究院的研究员。启元世界(.ai)是一家科技公司, 这家公司专注于通用人工智能领域, 其致力于去创造那种人与AI能够共生的世界, 它已经成功打造出了AI玩家、AI角色、AI设计师、AI指挥官等众多产品方案, 这些方案能为游戏、数字人、虚拟世界提供高质量内容以及互动体验。

  chatgpt

  为什么被称为

  llm

  要弄清楚为什么用这个大号简称来称呼它,得从背后的技术逻辑和产品特性两部分来看。

  人们称它为

  LLM

  的时候,说的其实就是大模型,更准确地指向它背后用海量数据和复杂算法支

  持的一类程序系统。这类技术用数学框架模仿人类对话能力,训练模型的时候会把爬取的网页文章、

  书籍文件甚至社交平台的聊天信息都吃掉,目的是让模型自己能关联词语关系,进而预测出上下文的

  合理表达。像它的参数动不动就上万亿级别,这就有了被叫做大模型的硬件条件。

  它被称作核心语言模型还有其他原因。训练时得扫完千万本书的文字规律,这个过程比早期技术

  多用上百倍时间和资金。它内部运算逻辑属于模仿神经网络架构的系统,也就是人为制造出互相交错

  的神经突触结构。这个模式让计算机模仿生物器官的工作规则,先感知文字模式、再由模式推导输出

  的套路变得更贴近真实对话中的推断链条。举个具体场景,一个人让老模型说段子活跃气氛,可能得

  到一条直勾勾的冷笑话;改问大模型,结果就成了根据使用者当下语境甚至预设人设的定制包袱。

  业界把这个领域称作大模型研究,也和研发策略有关。以前的系统专门针对任务开小灶:做翻译

  的模型单独学翻译库,测情感的模型只刷评分和词库标签。这类分科精炼的方法虽然能让机器更快处

  理专项问题,但跨维学习的能力天然受限制。训练大语言的理念反而像个什么活都通吃的小孩,不管

  你要写新闻稿、改代码还是写情诗都不需要分体再训。背后的科学假设在于:只要吞进去的文类和套

  路足够多、模型结构又能关联不同领域的字词关联规律,单一一套程序就能代替千上万个专科小模型。

  这样一来,叫它为大语言就有了区别于单功能的命名意义。

  也有批评视角值得放进来聊聊。有些人认为它并不算新概念中的大模型产品,因为现有技术依然

  没有真正理解语义,输出信息时会胡编乱造虚构来源。这种逻辑硬伤在大模型中更突出:越是看似通

  情达理的表述,当中间隐藏着知识硬伤时就显得破绽诡异。比如让系统以专家身份回答医学生提问,

  有概率出现事实错误但形式上正确的专业用语结构。这样的两面性让大模型的光环之外裹着一层技术

  本质的矛盾张力:模仿人性思维又无法规避机械算力的原始桎梏。用户发现这个秘密后也更容易理解

  为什么要用这个既直白又中立的词汇来形容。

  从现实应用角度来看它被归为此类的必然性更大。开发团队为了规避法律责任和公关危机,在产

  品说明书和用户协议里用了大量法律语言来做能力限制。这类文字实际效果是告诉用户,请理解为这

  是统计学概率输出结果而不是人脑级的推理决策。这种限定符合技术层面的基本逻辑,刚好也用到了

  大范围预训练的标签,内外就通顺了。用户摸不着参数的复杂后台,接触端直接能用自然语言交流的

  功能让很多人误以为自己在操作智慧体,此时产品身份的描述必须明确切割虚实——机器学得会预测

  文本但摸不着情感和真实认知,这才是称其为大语言模型时想区别的根本。

  对普通消费者来说怎么感知这两个称谓的区别,直接决定了技术普及的门槛高低。举个生活场景

  中的对比——比如有人开发了一款只擅长教小朋友认字的

  APP

  ,人们会说这是工具辅助系统或是人

  工智能程序。但如果某个应用既会查资料写总结、也能续写神话新版本、还能用二十种语言写邀请函,

  这就必然触达到用户对大模型的直观体验。实际运行中用户感知到它不像一台自动机而更像是肚子里