20 分钟,把 20 个 AI 核心概念一次讲透

1 评论 450 浏览 5 收藏 38 分钟

从神经网络的权重调整到迁移学习的技能复用,再到分词、嵌入与注意力机制,AI 的底层逻辑其实并不玄乎。OpenAI 平台的 Token 拆分实践与 Transformer 架构,把这 20 个核心概念串成一条清晰的学习路径。

如果你试过学 AI,你大概至少有过一次这种念头……

「这到底是怎么回事?」

满屏术语。满屏工具。而互联网上每个人说起来,都觉得是常识。

学 AI,真的会让人头皮发麻。

尤其是如果你不是直接从事相关工作的时候——那感觉简直像在学一门全新的外语。

但我意识到了一件事之后……

AI,其实没那么玄乎。

一旦你摸清底层的原理,尤其是大语言模型(LLM)是怎么工作的、现代 AI 工具是怎么搭起来的,一切就都串起来了。

这篇故事,我会用最朴素的方式,把 20 个最重要的 AI 概念拆开讲一遍。

不堆术语。不绕弯子。只有清楚的解释和直观的例子——就像当初有人能这样讲给我听就好了。

从基础开始吧

1. 神经网络

说白了,神经网络就是一层层连在一起的小单元,这些小单元叫神经元(neuron)。

你可以把它想成一条流水线。

数据从输入层进去,穿过一层层隐藏层,最后从输出层出来,变成一个预测结果。

但里面到底发生了什么?

最简单的理解,就是「一步步细化」。

同样的输入被反复处理,每过一层,模型就多理解一分。

比如在一个图像模型里:

1.最开始的层认的是边缘、纹理这类粗东西

2.中间的层开始认出形状、图案

3.越往深处,就能认出真正的物体了

就像是像素 → 形状 → 含义的进阶。

现在,重点来了……

神经元和神经元之间,每条连接都有一个叫权重(weight)的东西。

你可以把权重理解成一个个「重要度打分」,决定一个神经元对另一个影响多大。

那训练一个神经网络是干嘛?

说白了,就是反反复复调这些权重,调到模型开始给出准确结果为止。

而到这里,事情就开始疯狂了。

现代 AI 模型,尤其是大语言模型,可不只是几个权重,而是几十亿个。

它们协同作战,把原始输入变成真正有意义的东西。

2 迁移学习

从零开始训练一个神经网络,听着很酷……直到你发现它贵得离谱。

要海量数据、要强力算力、还要大把时间。

这时候,迁移学习(transfer learning)就登场了——老实说,它改变了整个游戏规则。

不从零起步,而是拿一个已经在宽泛任务上训练好的模型,适配到更具体的事上。

所以你不是从零开始盖楼……你是在一栋能住人的楼顶上接着盖。

理解它最轻松的角度:技能复用。

想象一下你已经会骑自行车了。

再学摩托车,是不是就简单多了?

因为你不是从零学起,你只是在已有的技能上做适配。

迁移学习,就是这么回事。

一个预训练模型已经学透了数据里的一般规律,你针对自己的场景微调它时,它学习速度更快、所需精力也更少。

而这里有个重点……

现在绝大多数现代 AI,实际就是这么跑的。

大公司把巨型基础模型训一次,然后像我们这样的开发者,可以针对特定任务进行适配。

这就是为什么你不必手握几十亿数据点或离谱算力,也能做出强大的 AI 应用。

现在是 Transformer Stack(栈)部分

3. 分词

模型要理解任何文本,第一步都得先把文本拆成更小的块。这个过程叫分词(tokenization)。

模型不像我们那样读句子,它处理的是叫 Token 的微小单元。这些 Token 就像模型内部给语言用的「字母表」。

但 Token 不总是一个完整的词。

有时候它是整个单词,有时候只是词的一部分。比如「playing」可能被拆成「play」和「ing」两块。而像「dog」这种又短又常见的词,通常会原样保留。

fig-5

你可以在这里试试

OpenAI 平台 探索开发者资源、教程、API 文档和动态示例,把 OpenAI 平台用透。

你可能会想……那为什么不用完整的词?

图由TERRA拍摄,来自Unsplash

乍一看有点怪,但背后是有道理的。

语言是极其复杂且不断演变的。新词不断冒出来,有人拼错、有人混着用、有人自创变体。如果一个模型试图存储所有可能的词汇,词汇量将会变得极其庞大。

分词通过保留一组固定的构建模块来解决这个问题。模型不硬记每个词,而是学习常见模式和可复用的片段。所以哪怕撞上一个从没见过的词,它也能靠拆成熟悉的零件来理解。

这就是为什么 AI 并不真的像人那样「读」文本。

它读的是 Token,从 Token 里,一步步把意义拼出来。

4 嵌入

文本拆成 Token 之后,下一步是把这些 Token 变成模型真正能操作的东西。

这就轮到嵌入(embeddings)上场了。

fig-7

每个 Token 被转成一个向量,说白了就是一串代表它含义的数字。模型不直接碰单词,而是拿这些数字表示来工作。

一个很好用的类比:地图。

每个词在高维空间里都有一个坐标。意思相近的词靠得近,八竿子打不着的词离得远。比如「doctor」和「nurse」挨在一起,而「doctor」和「mountain」就隔了十万八千里。

尽管这个空间有几百上千个维度,它依然能捕捉有意义的关系。某些词之间的差异,遵循着一定的规律。比如「actor」和「actress」的关系,和「prince」和「princess」的关系。

有意思的是,模型并不像我们那样理解语言。它不以定义或规则为基础进行思考。

它靠距离和方向来理解含义——把词摆进一个「关系变成几何」的空间里。

5 注意力

到这里,事情开始变得真正有趣。

一个词的意思不是固定的,它取决于上下文。

就拿「apple」这个词来说。在一个句子里,它可能指水果。在另一个句子里,它可能指一家公司。

那模型怎么判断到底是哪个意思?

光靠嵌入不够,因为它给每个 Token 的表示是固定的,它无法完整地捕捉词义如何随上下文变化而变化。

于是注意力(attention)出场了。

注意力机制让每个词都能看一眼句子里所有其他词,然后判断谁才是重要的。模型不再对每个词一视同仁,而是学会盯住最相关的那些。

所以如果句子是「She bought shares in Apple」,模型会对「shares」和「bought」投入更多注意力,从而明白这里的「Apple」是家公司,不是水果。

真正厉害的地方在于,模型不再逐字阅读了。

它一次看完整句话,动态决定该把注意力放哪。

而正是注意力,才真正开启了现代AI的新时代。

在这之前,模型是从左到右一步步处理文本的,经常丢掉远距离的关系。注意力改变了这一切——让模型看到全局,理解所有元素之间的联系。

6.Transformer

我们前面聊的所有零件——Token、嵌入、注意力——最终都汇聚到一个地方。

那个地方,就是 Transformer。

fig-9

它是当今几乎所有现代 AI 系统背后的架构。

Transformer 出自 2017 年那篇著名的论文《Attention Is All You Need》。其理念出奇地简单:不再逐字处理文本,而是将注意力作为核心机制,让模型同时处理所有内容。

这一转变改变了一切。

Transformer 就是堆叠多层注意力,加上简单的处理模块。信息在这些层级间传递时,会逐步得到提炼和完善。

在早期的层级里,模型先理解基本结构——比如语法、句式。

随着层级的深入,它开始捕捉词与词、概念与概念之间的关系。而到更深的层,它已经能处理复杂的推理和连接。

这不是魔法,只是反复精炼。

Transformer 最大的优势之一,是它处理数据的方式。

老模型必须顺序读文本,一次一个词。又慢,能处理的上下文又有限。

Transformer 没这个毛病。

它并行处理所有 Token,速度快得多,还能靠 GPU 这类现代硬件扩展到巨大规模。

这就是为什么 GPT、Claude、Gemini、Llama 全都依赖这套架构。

把镜头拉远,整条流水线长这样:

1.文本拆成 Token。

2.Token 变成向量。

3.Transformer层利用注意力机制来理解各个部分之间的联系。

这条简单的链路,支撑着你今天用的大部分 AI。

现在我们了解什么是大语言模型

7. LLM(大语言模型)

现在,我们把前面所有东西,接到大多数人每天真正接触的东西上——大语言模型,也就是 LLM。

fig-10

从宏观层面来看,LLM(语言学习模型)本质上就是一个基于海量文本训练的Transformer模型。什么书、网站、代码……动辄几千亿甚至几万亿个 Token。

那训练的目标是什么?

出乎意料的简单。

模型学习的方式,就是预测下一个 Token。

就这么简单。

听起来简单到不像是真的。

但当这个动作在数万亿个样本上重复无数次,有意思的事情发生了。

模型开始摸到语言里的规律。它学会句子怎么组织、想法怎么连接、甚至推理怎么推进。时间一长,这看起来就很像「理解」了——虽然本质上只是超大规模的模式学习。

这就是为什么这些模型能:写代码、回答问题、翻译语言、解释复杂话题——哪怕从没被专门训练过做这些事。

「大语言模型」里的「大」,指的是参数数量。

这些是模型在训练中学到的内部数值,现代模型有几千亿个。

在那个规模上训练,可不便宜。要庞大算力,经常烧掉几百万美元。

但换来的是一个能泛化到各种问题、生成出奇有用输出的系统。

所以当你用 ChatGPT、Claude、Gemini 这些工具时……

你其实是在跟一个靠「一遍遍重复同一件简单事——预测下一个是什么」学会语言的模型打交道。

8 上下文窗口

每个 AI 模型,都有「一次能记多少」的上限。

这个上限,叫上下文窗口(context window)。

fig-11

它指的是模型在单次交互里能处理的最大 Token 数,包括你输入的和模型回应的。说白了,就是模型的短期工作记忆。

早期的模型,这块记忆小得可怜。

比如早期版本的 GPT,一次只能处理几千个 Token。长对话聊着聊着就把前面的细节丢了,大文档还得删减或拆分。

但现在,情况完全变了。

现代模型能处理大得多的上下文。有的能一次消化整本书、整段长对话、大块代码。这让它们在「上下文真的重要」的真实任务里好用得多。

不过,有个坑。

更大的上下文窗口,是要付代价的。

它需要更多内存、更多计算资源,而且通常会导致响应速度变慢。因此,虽然理论上越大越好,但实际上也会使系统更笨重、运行成本更高。

而且就算上下文窗口够大,还有一个隐蔽的限制。

模型不会平等对待输入的每一部分。

它更关注开头和结尾,埋在中间的信息有时会被忽略。这通常被叫做「lost in the middle」问题。

所以,尽管上下文窗口越来越大、越来越好……

它依然不完美。

理解了这点,你就能明白为什么模型有时会「忘记」你明明在前面讲过的东西。

9 温度

语言模型生成文本时,并不是直接挑下一个词。

在后台,它会算出每个可能的下一个 Token 的概率,然后决定选哪个。

这时候,温度(temperature)登场了。

fig-12

温度控制着这个选择有多「严谨」或「放飞」。

温度很低时,模型走稳妥路线。

它几乎总是选概率最高的那个 Token,这使得输出结果更可预测、更集中、更一致。这就是为什么低温处理非常适合编写代码、总结内容或任何准确性比创造性更重要的任务。

把温度调高,模型就活络起来了。

它不会总是选择最佳选项,而是会根据概率探索其他可能性。这增加了多样性,使输出结果感觉更自然或更具创意,这对于头脑风暴或撰写同一内容的不同版本等场景非常有用。

如果温度再升高,情况就会变得难以预测。

模型可能给出更出人意料、更天马行空的回答,但也容易在长输出里迅速失去连贯性。到那个程度,它不太在乎准确,纯粹是在做实验。

该模型或许能产生更出人意料或更具想象力的回答,但也可能很快失去连贯性,尤其是在输出较长内容时。此时,准确性不再是重点,实验性才是关键。

因此,实际上,温度只是控制模型行为的一种方式。

数值越低,精度和可靠性越高;数值越高,创造性和多样性越高。

选择合适的平衡点完全取决于你想从中获得什么。

10 幻觉

这是你认真用 AI 时,最先撞上的现象之一。

有时候,模型给你的回答听起来底气十足……结果却是错的。

这就叫幻觉(hallucination)。

fig-13

它可能煞有介事地提到一篇根本不存在的论文,推荐一个从没造出来的 API,或者把一句编造的话说得像人尽皆知。最棘手的是——它听起来真的很像那么回事。

那为什么会这样?

因为从根本上说,语言模型的目标不是讲真话。

它的目标是生成最「顺理成章」的下一段文本。

它从海量数据里学到了模式,它的工作就是让模式延续得自然、连贯。但它并不会真的去核实自己说的是不是对的。

所以,如果一句假话看起来像是「该出现的下一句」,模型就会信心满满地把它编出来。

而这就是幻觉在真实场景里成为大麻烦的原因。

你不能盲目相信输出,尤其是涉及事实、代码、重要决策的时候。

这就是为什么今天很多系统都在想办法减轻这个问题——比如把模型锚定在真实数据上,连上可信文档,或者尽可能让它引用来源。

说到底,模型非常擅长「听起来是对的」。

但它仍然需要一个人类(你)去确认——它到底是不是真的对。

讲完 LLM,我们聊聊训练与优化

11. 微调

微调(fine-tuning)发生在模型已经掌握了基础之后。

它不是从零训练,而是拿一个预训练模型,在一个更小、更聚焦的数据集上继续训练。模型已经懂通用语言了,你不需要从零教它,只是把它往某个方向带一带。

你可以把它理解成「专业化」。

通用模型也许什么都能答,但如果你想让它在一个特定领域特别能打,就可以用更精准的数据去微调它。

比如你想要一个懂法律文件的模型,就让它继续在合同、案例摘要、法律解释上训练。时间一长,它回应的方式就越来越贴那个领域。

但这是有代价的。

微调通常要更新模型内部参数的很大一部分。而这些模型巨大,这个过程需要硬核基础设施。

你得有足够内存把整个模型装进去,还得带上训练需要的所有额外数据。对超大的模型来说,这往往意味着好几块高端 GPU 和大量算力。

所以,微调虽然强大,却不总是轻量、好搭的。

它给你控制和定制,但你得为它的复杂度和成本买单。

12.RLHF(基于人类反馈的强化学习)

到目前为止,我们聊的都在解释「模型怎么学会语言」。

但它没解释一件重要的事……

为什么现代 AI 模型感觉这么贴心、这么礼貌、这么会聊天?

答案,就是 RLHF。

fig-15

从核心说,RLHF 把模型从「只会预测下一个 Token」变成了「感觉跟人类期望对得上」的东西。

没有它,模型照样能生成流畅的文本——但不一定有用、安全,甚至不一定得体。它只会延续看起来最可能的模式,不管那对你有没有帮助。

那 RLHF 是怎么解决的?

它把人类判断塞进了训练流程。

不只依赖原始数据,模型由「人们真正偏好什么」来引导。对给定的 prompt,模型生成多个候选回答,人类来比较——哪个更有帮助、更清楚、更安全。

时间一长,模型就学会偏向人类反复选中的那类答案。

有意思的是,模型并不是直接背下那些答案。

它学到的是一种「偏好感」。

它开始理解:

1.好答案长什么样

2.怎么正确遵守指令

3.什么时候该避开有害或误导性的回应。

这就是为什么现代聊天机器人和老系统感觉完全不同。

它们不只是流利,它们像是在努力帮你。

即使没有 RLHF(或类似的对齐方法),模型依然强大……

但在真实应用里,它会远不够可靠、不够安全,也难用得多。

13.LoRA(低秩适配)

我们刚聊完微调有多猛。

但有个问题。

微调一个巨大模型,意味着更新几十亿个参数,很快又贵又难管。不是谁都有那种基础设施。

这时候,LoRA 登场了。

fig-16

LoRA 不改整个模型,而是采用了一种轻量级的方法。

它保持原始模型不变,并在其基础上添加一些可训练的小组件。这些额外组件与完整模型相比非常小——通常只占总参数的百分之几。

所以,你不需要重写整个系统,只需要在需要的地方进行一些小的调整。

这背后的想法,聪明得有点意外。

微调一个模型时,大部分变化其实不需要全尺寸的更新。它们可以用小得多的变换来近似。LoRA 就抓住这一点,把变化压缩进一个紧凑的形式。

这为什么重要?

因为它让微调的门槛骤降。

过去要好几块高端 GPU 的事,现在常常一台机器就搞定。而且不用存一个模型的多个完整版本,你可以存不同的 LoRA 适配器,按任务切换。

简单说,LoRA 给了你微调的好处……

却不用背上它通常附带的高昂成本。

14 量化

模型越大,跑起来越费劲。

要更多内存、更多算力、更猛的硬件。

这时候,量化(quantization)登场了。

fig-17

量化说白了,就是让模型更小、更便宜地运行——通过更高效地存储权重。

在全精度模型里,每个权重用一大串比特存储。量化把这个尺寸压下来,有时压得相当狠,整个模型占用的内存就少得多。

思路很简单:牺牲一点精度,保住大部分有用的信息。

当你把每个权重的尺寸缩小,影响会飞快地累积。

一个本来要吞掉海量内存的模型,可以突然小到能在更亲民的硬件上跑。而且出人意料的是,质量掉的往往比你预期的少得多,尤其是适度量化的时候。

这也是大型模型变得越来越实用的关键原因之一。

当你看到有人用桌面 GPU 甚至笔记本跑强力模型,他们通常用的不是完整版。他们用的是被压缩过、以适应现实约束的量化版本。

简单说,量化,就是把大型 AI 模型从巨型数据中心……

搬进日常机器的关键。

现在我们理解提示与推理

15. 提示工程

只要你多少用过 AI,你多半已经注意到一件事……

你提问的方式,非常非常关键。

这就是提示工程(prompt engineering)的全部意义。

fig-18

这是通过调整输入数据,使模型能够提供更好、更有用的输出结果的过程。

同一个问题,换两种问法,可能得到完全不同的结果。

你说「解释一下 API」,模型通常给你一个宽泛、表面的答案。但如果你问「用一个真实例子讲讲 REST API 怎么处理认证」,你就给了它方向,输出立刻变得聚焦、实用。

好的 prompt 不在于复杂,而在于清晰。

当你把想要的讲清楚,模型就更可能给你正好的东西。有时候要设定角色,比如让它以资深工程师的身份作答。有时候要给例子、拆步骤,或者只是把格式和语气说具体。

时间一长,你会意识到一件重要的事。

提示工程不只是一个技巧,不是一个权益之计。

它是你和模型沟通的主要方式。

而它带来的差别,是巨大的。

一个模糊的 prompt 给你泛泛而谈的输出。一个精心设计的 prompt,能给你结构化、准确、真正能用的东西。

🔗:https://medium.com/@Deep-concept/list/ai-art-prompts-e71cb2dcda05?source=post_page—–b7dd3ad2b506—————————————

16 思维链(CoT)

有时模型答得烂,不是因为它什么都不会,而是因为它跳答案跳得太快。

这时候,思维链(chain of thought)登场了。

fig-19

它是一种引导式方法:让模型分中间步骤来解决问题,而不是直奔最终结果。对涉及逻辑、数学,或任何需要多步推理的任务,帮助往往很大。

一个简单的理解方式是这样的:

如果你只要最终答案,模型可能太依赖模式匹配。但如果你鼓励它更仔细地处理问题,它就更有可能得出正确的结果。

比如你让模型直接解一道乘法题,它有时会猜错。但要是先让它把问题拆成小块再合并,答案就可靠多了。

这就是为什么思维链常被形容成「给模型一块草稿纸」。

不逼它秒答,而是允许它分小步处理任务。对许多推理密集型的问题,这么一个小改变,能带来大不同。

简单说,更好的结果,往往来自给模型留足推理的空间……

而不是逼它一步跳到底。

现在聊聊构建 AI 系统

17. RAG(检索增强生成)

还记得我们前面聊过的幻觉问题吗?

RAG,就是对付它最实用的手段之一。

fig-20

思路很简单。

不只依赖模型已经知道的东西,而是在它回答的那一刻,给它接入真实、相关的信息。

生成回答之前,系统先从知识源里检索有用的文档。这些文档随后作为上下文喂给模型,模型用它们生成更有根据的回答。

你可以这样想。

模型不再凭记忆硬答,而是被允许先查一下资料。

比如你做一个客服助手。当有人问价格、问政策时,系统不瞎猜。它先到你内部文档里拉最新信息,然后由模型用清楚、自然的方式讲出来。

这个方法厉害的地方,在于角色的分工。

模型负责理解问题、解释答案。知识库负责提供真材实料的事实。

而这带来一个巨大的优势。

如果你的信息变了,不用重新训练模型。只要更新文档,系统马上就会用上新数据。

简单说,RAG 把模型从「靠记忆」……

变成了「能读、能核实、带着真实上下文回应」的东西。

而这就是它在真实场景里可靠得多的原因。

18 向量数据库

所以,如果 RAG 的核心是取回正确的信息……

系统到底是怎么找到它的?

这就轮到向量数据库(vector database)出场了。

fig-21

向量数据库不按传统方式存文本,它存的是嵌入——我们前面讲过的「含义的数字表示」。

这让系统能基于语义相似度搜索,而不是死抠关键词。

实际跑起来是这样的:

你的文档先被拆成小块,每一块转成一个嵌入。这些嵌入随后存进数据库。

用户提问时,那个查询也被转成嵌入。系统然后找与它最近的已存向量——也就是含义最接近的那些——把它们作为上下文返回。

它和传统搜索的差别,就在这里。

如果你用精确关键词搜,很可能因为措辞不同而漏掉相关信息。但用向量搜索,系统依然能找到正确内容,因为它懂的是词背后的意图,而不只是词本身。

这就是 RAG 能跑得这么顺的原因。

模型检索的不只是文本,它检索的是最相关的「含义」。

处理这类搜索的工具不少,包括 Pinecone、Weaviate、Qdrant,甚至 PostgreSQL 配上支持向量查询的扩展。

简单说,向量数据库,就是让 AI 系统越过关键词匹配……

开始像人一样思考着搜索的东西。

19.AI 智能体

到目前为止,我们聊的全都聚焦在「生成文本」的模型上。

但如果模型真的能动手做事呢?

这就是 AI 智能体(AI agent)登场的地方。

fig-22

AI 智能体,说白了就是一个能采取行动的模型,而不只是回应。它不会停在答案上——它能调用工具、跑代码、搜信息、调 API,把这些步骤组合起来完成一个任务。

换句话说,它从「想」走到了「做」。

大多数智能体在一个简单的循环里运转。

它们观察当前情况,决定下一步做什么,采取行动,然后根据变化重复这个过程。模型就坐在这个循环的中心,每一步都是决策者。

想象一个在修 bug 的编程助手。

它读问题、翻代码库、找出可能出错的地方、写修复、跑测试、看哪里挂了,再调整方案直到一切正常。每一步都依赖前一步,模型随着新信息不断自我调整。

这很强大,但也是麻烦开始的地方。

每一步都可能出错,而小错会累积。一个看起来简单的任务,一旦牵扯连续多个决策,就可能变得不可靠。

这就是为什么做好智能体,不只是让它们「能打」。

而是让它们「靠谱」。

现代系统非常强调规划、验证、重试和自我纠正,来让这些多步工作流不跑偏。

简单说,AI 智能体,就是把语言模型变成能在现实世界里真正动手干活的系统的东西。

20 扩散模型

到目前为止,我们主要聊的是文本。

那图像呢?

这就轮到扩散模型(diffusion model)了——众多现代图像生成器背后的技术。

fig-23

这个想法,反直觉得让人意外。

模型不是学怎么直接画图,它先学怎么「毁掉」图。

训练时,真实图像被一遍遍加噪,逐渐破坏,直到变成一团完全的噪点。然后模型被训练去逆向这个过程——一步步学会去噪、恢复原图。

要生成新东西时,流程就翻转过来。

你从纯噪声开始。

然后,一点一点地,模型把它清理干净——补上结构、形状、细节,直到一幅完整的图像浮现。每一步都在精炼结果,由你的 prompt 引导,把随机变成有意义。

「扩散」这个名字来自物理学:粒子随时间随机散开,就像墨水在水里化开。

在这里,模型学的正是反方向——如何从那种随机里,找回秩序。

有意思的是,这个想法已经不限于图像了。

同样的方法,现在被用来生成视频、音频、3D 内容,甚至用在设计分子、预测蛋白质结构这类科学领域。

简单说,扩散模型,就是让 AI 从纯噪声……

变成你能真正看到、听到、用到的东西的技术。

原文标题:20 Most Important AI Concepts Explained in Just 20 Minute

原文链接:https://medium.com/lets-code-future/20-most-important-ai-concepts-explained-in-just-20-minute-b7dd3ad2b506

作者:Deep concept

审核:李泽慧

编辑:魏心语

本文由人人都是产品经理作者【TCC翻译情报局】,微信公众号:【TCC翻译情报局】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 迁移学习让普通人也能搞AI应用,这个点说得很实在。但要注意,预训练模型的底子好不好直接决定迁移效果,用开源小模型还是商业大模型作为起点,差距不小。所谓“站在楼顶盖楼”,地基其实是别人给的,选哪栋楼也得花心思。

    来自广东 回复