20 分钟,把 20 个 AI 核心概念一次讲透
从神经网络的权重调整到迁移学习的技能复用,再到分词、嵌入与注意力机制,AI 的底层逻辑其实并不玄乎。OpenAI 平台的 Token 拆分实践与 Transformer 架构,把这 20 个核心概念串成一条清晰的学习路径。

如果你试过学 AI,你大概至少有过一次这种念头……
「这到底是怎么回事?」
满屏术语。满屏工具。而互联网上每个人说起来,都觉得是常识。
学 AI,真的会让人头皮发麻。
尤其是如果你不是直接从事相关工作的时候——那感觉简直像在学一门全新的外语。
但我意识到了一件事之后……
AI,其实没那么玄乎。
一旦你摸清底层的原理,尤其是大语言模型(LLM)是怎么工作的、现代 AI 工具是怎么搭起来的,一切就都串起来了。
这篇故事,我会用最朴素的方式,把 20 个最重要的 AI 概念拆开讲一遍。
不堆术语。不绕弯子。只有清楚的解释和直观的例子——就像当初有人能这样讲给我听就好了。
从基础开始吧
1. 神经网络

说白了,神经网络就是一层层连在一起的小单元,这些小单元叫神经元(neuron)。
你可以把它想成一条流水线。
数据从输入层进去,穿过一层层隐藏层,最后从输出层出来,变成一个预测结果。
但里面到底发生了什么?
最简单的理解,就是「一步步细化」。
同样的输入被反复处理,每过一层,模型就多理解一分。
比如在一个图像模型里:
1.最开始的层认的是边缘、纹理这类粗东西
2.中间的层开始认出形状、图案
3.越往深处,就能认出真正的物体了
就像是像素 → 形状 → 含义的进阶。
现在,重点来了……
神经元和神经元之间,每条连接都有一个叫权重(weight)的东西。
你可以把权重理解成一个个「重要度打分」,决定一个神经元对另一个影响多大。
那训练一个神经网络是干嘛?
说白了,就是反反复复调这些权重,调到模型开始给出准确结果为止。
而到这里,事情就开始疯狂了。
现代 AI 模型,尤其是大语言模型,可不只是几个权重,而是几十亿个。
它们协同作战,把原始输入变成真正有意义的东西。
2 迁移学习

从零开始训练一个神经网络,听着很酷……直到你发现它贵得离谱。
要海量数据、要强力算力、还要大把时间。
这时候,迁移学习(transfer learning)就登场了——老实说,它改变了整个游戏规则。
不从零起步,而是拿一个已经在宽泛任务上训练好的模型,适配到更具体的事上。
所以你不是从零开始盖楼……你是在一栋能住人的楼顶上接着盖。
理解它最轻松的角度:技能复用。
想象一下你已经会骑自行车了。
再学摩托车,是不是就简单多了?
因为你不是从零学起,你只是在已有的技能上做适配。
迁移学习,就是这么回事。
一个预训练模型已经学透了数据里的一般规律,你针对自己的场景微调它时,它学习速度更快、所需精力也更少。
而这里有个重点……
现在绝大多数现代 AI,实际就是这么跑的。
大公司把巨型基础模型训一次,然后像我们这样的开发者,可以针对特定任务进行适配。
这就是为什么你不必手握几十亿数据点或离谱算力,也能做出强大的 AI 应用。
现在是 Transformer Stack(栈)部分
3. 分词

模型要理解任何文本,第一步都得先把文本拆成更小的块。这个过程叫分词(tokenization)。
模型不像我们那样读句子,它处理的是叫 Token 的微小单元。这些 Token 就像模型内部给语言用的「字母表」。
但 Token 不总是一个完整的词。
有时候它是整个单词,有时候只是词的一部分。比如「playing」可能被拆成「play」和「ing」两块。而像「dog」这种又短又常见的词,通常会原样保留。

你可以在这里试试
OpenAI 平台 探索开发者资源、教程、API 文档和动态示例,把 OpenAI 平台用透。
你可能会想……那为什么不用完整的词?

图由TERRA拍摄,来自Unsplash
乍一看有点怪,但背后是有道理的。
语言是极其复杂且不断演变的。新词不断冒出来,有人拼错、有人混着用、有人自创变体。如果一个模型试图存储所有可能的词汇,词汇量将会变得极其庞大。
分词通过保留一组固定的构建模块来解决这个问题。模型不硬记每个词,而是学习常见模式和可复用的片段。所以哪怕撞上一个从没见过的词,它也能靠拆成熟悉的零件来理解。
这就是为什么 AI 并不真的像人那样「读」文本。
它读的是 Token,从 Token 里,一步步把意义拼出来。
4 嵌入
文本拆成 Token 之后,下一步是把这些 Token 变成模型真正能操作的东西。
这就轮到嵌入(embeddings)上场了。

每个 Token 被转成一个向量,说白了就是一串代表它含义的数字。模型不直接碰单词,而是拿这些数字表示来工作。
一个很好用的类比:地图。
每个词在高维空间里都有一个坐标。意思相近的词靠得近,八竿子打不着的词离得远。比如「doctor」和「nurse」挨在一起,而「doctor」和「mountain」就隔了十万八千里。
尽管这个空间有几百上千个维度,它依然能捕捉有意义的关系。某些词之间的差异,遵循着一定的规律。比如「actor」和「actress」的关系,和「prince」和「princess」的关系。
有意思的是,模型并不像我们那样理解语言。它不以定义或规则为基础进行思考。
它靠距离和方向来理解含义——把词摆进一个「关系变成几何」的空间里。
5 注意力
到这里,事情开始变得真正有趣。

一个词的意思不是固定的,它取决于上下文。
就拿「apple」这个词来说。在一个句子里,它可能指水果。在另一个句子里,它可能指一家公司。
那模型怎么判断到底是哪个意思?
光靠嵌入不够,因为它给每个 Token 的表示是固定的,它无法完整地捕捉词义如何随上下文变化而变化。
于是注意力(attention)出场了。
注意力机制让每个词都能看一眼句子里所有其他词,然后判断谁才是重要的。模型不再对每个词一视同仁,而是学会盯住最相关的那些。
所以如果句子是「She bought shares in Apple」,模型会对「shares」和「bought」投入更多注意力,从而明白这里的「Apple」是家公司,不是水果。
真正厉害的地方在于,模型不再逐字阅读了。
它一次看完整句话,动态决定该把注意力放哪。
而正是注意力,才真正开启了现代AI的新时代。
在这之前,模型是从左到右一步步处理文本的,经常丢掉远距离的关系。注意力改变了这一切——让模型看到全局,理解所有元素之间的联系。
6.Transformer
我们前面聊的所有零件——Token、嵌入、注意力——最终都汇聚到一个地方。
那个地方,就是 Transformer。

它是当今几乎所有现代 AI 系统背后的架构。
Transformer 出自 2017 年那篇著名的论文《Attention Is All You Need》。其理念出奇地简单:不再逐字处理文本,而是将注意力作为核心机制,让模型同时处理所有内容。
这一转变改变了一切。
Transformer 就是堆叠多层注意力,加上简单的处理模块。信息在这些层级间传递时,会逐步得到提炼和完善。
在早期的层级里,模型先理解基本结构——比如语法、句式。
随着层级的深入,它开始捕捉词与词、概念与概念之间的关系。而到更深的层,它已经能处理复杂的推理和连接。
这不是魔法,只是反复精炼。
Transformer 最大的优势之一,是它处理数据的方式。
老模型必须顺序读文本,一次一个词。又慢,能处理的上下文又有限。
Transformer 没这个毛病。
它并行处理所有 Token,速度快得多,还能靠 GPU 这类现代硬件扩展到巨大规模。
这就是为什么 GPT、Claude、Gemini、Llama 全都依赖这套架构。
把镜头拉远,整条流水线长这样:
1.文本拆成 Token。
2.Token 变成向量。
3.Transformer层利用注意力机制来理解各个部分之间的联系。
这条简单的链路,支撑着你今天用的大部分 AI。
现在我们了解什么是大语言模型
7. LLM(大语言模型)
现在,我们把前面所有东西,接到大多数人每天真正接触的东西上——大语言模型,也就是 LLM。

从宏观层面来看,LLM(语言学习模型)本质上就是一个基于海量文本训练的Transformer模型。什么书、网站、代码……动辄几千亿甚至几万亿个 Token。
那训练的目标是什么?
出乎意料的简单。
模型学习的方式,就是预测下一个 Token。
就这么简单。
听起来简单到不像是真的。
但当这个动作在数万亿个样本上重复无数次,有意思的事情发生了。
模型开始摸到语言里的规律。它学会句子怎么组织、想法怎么连接、甚至推理怎么推进。时间一长,这看起来就很像「理解」了——虽然本质上只是超大规模的模式学习。
这就是为什么这些模型能:写代码、回答问题、翻译语言、解释复杂话题——哪怕从没被专门训练过做这些事。
「大语言模型」里的「大」,指的是参数数量。
这些是模型在训练中学到的内部数值,现代模型有几千亿个。
在那个规模上训练,可不便宜。要庞大算力,经常烧掉几百万美元。
但换来的是一个能泛化到各种问题、生成出奇有用输出的系统。
所以当你用 ChatGPT、Claude、Gemini 这些工具时……
你其实是在跟一个靠「一遍遍重复同一件简单事——预测下一个是什么」学会语言的模型打交道。
8 上下文窗口
每个 AI 模型,都有「一次能记多少」的上限。
这个上限,叫上下文窗口(context window)。

它指的是模型在单次交互里能处理的最大 Token 数,包括你输入的和模型回应的。说白了,就是模型的短期工作记忆。
早期的模型,这块记忆小得可怜。
比如早期版本的 GPT,一次只能处理几千个 Token。长对话聊着聊着就把前面的细节丢了,大文档还得删减或拆分。
但现在,情况完全变了。
现代模型能处理大得多的上下文。有的能一次消化整本书、整段长对话、大块代码。这让它们在「上下文真的重要」的真实任务里好用得多。
不过,有个坑。
更大的上下文窗口,是要付代价的。
它需要更多内存、更多计算资源,而且通常会导致响应速度变慢。因此,虽然理论上越大越好,但实际上也会使系统更笨重、运行成本更高。
而且就算上下文窗口够大,还有一个隐蔽的限制。
模型不会平等对待输入的每一部分。
它更关注开头和结尾,埋在中间的信息有时会被忽略。这通常被叫做「lost in the middle」问题。
所以,尽管上下文窗口越来越大、越来越好……
它依然不完美。
理解了这点,你就能明白为什么模型有时会「忘记」你明明在前面讲过的东西。
9 温度
语言模型生成文本时,并不是直接挑下一个词。
在后台,它会算出每个可能的下一个 Token 的概率,然后决定选哪个。
这时候,温度(temperature)登场了。

温度控制着这个选择有多「严谨」或「放飞」。
温度很低时,模型走稳妥路线。
它几乎总是选概率最高的那个 Token,这使得输出结果更可预测、更集中、更一致。这就是为什么低温处理非常适合编写代码、总结内容或任何准确性比创造性更重要的任务。
把温度调高,模型就活络起来了。
它不会总是选择最佳选项,而是会根据概率探索其他可能性。这增加了多样性,使输出结果感觉更自然或更具创意,这对于头脑风暴或撰写同一内容的不同版本等场景非常有用。
如果温度再升高,情况就会变得难以预测。
模型可能给出更出人意料、更天马行空的回答,但也容易在长输出里迅速失去连贯性。到那个程度,它不太在乎准确,纯粹是在做实验。
该模型或许能产生更出人意料或更具想象力的回答,但也可能很快失去连贯性,尤其是在输出较长内容时。此时,准确性不再是重点,实验性才是关键。
因此,实际上,温度只是控制模型行为的一种方式。
数值越低,精度和可靠性越高;数值越高,创造性和多样性越高。
选择合适的平衡点完全取决于你想从中获得什么。
10 幻觉
这是你认真用 AI 时,最先撞上的现象之一。
有时候,模型给你的回答听起来底气十足……结果却是错的。
这就叫幻觉(hallucination)。

它可能煞有介事地提到一篇根本不存在的论文,推荐一个从没造出来的 API,或者把一句编造的话说得像人尽皆知。最棘手的是——它听起来真的很像那么回事。
那为什么会这样?
因为从根本上说,语言模型的目标不是讲真话。
它的目标是生成最「顺理成章」的下一段文本。
它从海量数据里学到了模式,它的工作就是让模式延续得自然、连贯。但它并不会真的去核实自己说的是不是对的。
所以,如果一句假话看起来像是「该出现的下一句」,模型就会信心满满地把它编出来。
而这就是幻觉在真实场景里成为大麻烦的原因。
你不能盲目相信输出,尤其是涉及事实、代码、重要决策的时候。
这就是为什么今天很多系统都在想办法减轻这个问题——比如把模型锚定在真实数据上,连上可信文档,或者尽可能让它引用来源。
说到底,模型非常擅长「听起来是对的」。
但它仍然需要一个人类(你)去确认——它到底是不是真的对。
讲完 LLM,我们聊聊训练与优化
11. 微调
微调(fine-tuning)发生在模型已经掌握了基础之后。

它不是从零训练,而是拿一个预训练模型,在一个更小、更聚焦的数据集上继续训练。模型已经懂通用语言了,你不需要从零教它,只是把它往某个方向带一带。
你可以把它理解成「专业化」。
通用模型也许什么都能答,但如果你想让它在一个特定领域特别能打,就可以用更精准的数据去微调它。
比如你想要一个懂法律文件的模型,就让它继续在合同、案例摘要、法律解释上训练。时间一长,它回应的方式就越来越贴那个领域。
但这是有代价的。
微调通常要更新模型内部参数的很大一部分。而这些模型巨大,这个过程需要硬核基础设施。
你得有足够内存把整个模型装进去,还得带上训练需要的所有额外数据。对超大的模型来说,这往往意味着好几块高端 GPU 和大量算力。
所以,微调虽然强大,却不总是轻量、好搭的。
它给你控制和定制,但你得为它的复杂度和成本买单。
12.RLHF(基于人类反馈的强化学习)
到目前为止,我们聊的都在解释「模型怎么学会语言」。
但它没解释一件重要的事……
为什么现代 AI 模型感觉这么贴心、这么礼貌、这么会聊天?
答案,就是 RLHF。

从核心说,RLHF 把模型从「只会预测下一个 Token」变成了「感觉跟人类期望对得上」的东西。
没有它,模型照样能生成流畅的文本——但不一定有用、安全,甚至不一定得体。它只会延续看起来最可能的模式,不管那对你有没有帮助。
那 RLHF 是怎么解决的?
它把人类判断塞进了训练流程。
不只依赖原始数据,模型由「人们真正偏好什么」来引导。对给定的 prompt,模型生成多个候选回答,人类来比较——哪个更有帮助、更清楚、更安全。
时间一长,模型就学会偏向人类反复选中的那类答案。
有意思的是,模型并不是直接背下那些答案。
它学到的是一种「偏好感」。
它开始理解:
1.好答案长什么样
2.怎么正确遵守指令
3.什么时候该避开有害或误导性的回应。
这就是为什么现代聊天机器人和老系统感觉完全不同。
它们不只是流利,它们像是在努力帮你。
即使没有 RLHF(或类似的对齐方法),模型依然强大……
但在真实应用里,它会远不够可靠、不够安全,也难用得多。
13.LoRA(低秩适配)
我们刚聊完微调有多猛。
但有个问题。
微调一个巨大模型,意味着更新几十亿个参数,很快又贵又难管。不是谁都有那种基础设施。
这时候,LoRA 登场了。

LoRA 不改整个模型,而是采用了一种轻量级的方法。
它保持原始模型不变,并在其基础上添加一些可训练的小组件。这些额外组件与完整模型相比非常小——通常只占总参数的百分之几。
所以,你不需要重写整个系统,只需要在需要的地方进行一些小的调整。
这背后的想法,聪明得有点意外。
微调一个模型时,大部分变化其实不需要全尺寸的更新。它们可以用小得多的变换来近似。LoRA 就抓住这一点,把变化压缩进一个紧凑的形式。
这为什么重要?
因为它让微调的门槛骤降。
过去要好几块高端 GPU 的事,现在常常一台机器就搞定。而且不用存一个模型的多个完整版本,你可以存不同的 LoRA 适配器,按任务切换。
简单说,LoRA 给了你微调的好处……
却不用背上它通常附带的高昂成本。
14 量化
模型越大,跑起来越费劲。
要更多内存、更多算力、更猛的硬件。
这时候,量化(quantization)登场了。

量化说白了,就是让模型更小、更便宜地运行——通过更高效地存储权重。
在全精度模型里,每个权重用一大串比特存储。量化把这个尺寸压下来,有时压得相当狠,整个模型占用的内存就少得多。
思路很简单:牺牲一点精度,保住大部分有用的信息。
当你把每个权重的尺寸缩小,影响会飞快地累积。
一个本来要吞掉海量内存的模型,可以突然小到能在更亲民的硬件上跑。而且出人意料的是,质量掉的往往比你预期的少得多,尤其是适度量化的时候。
这也是大型模型变得越来越实用的关键原因之一。
当你看到有人用桌面 GPU 甚至笔记本跑强力模型,他们通常用的不是完整版。他们用的是被压缩过、以适应现实约束的量化版本。
简单说,量化,就是把大型 AI 模型从巨型数据中心……
搬进日常机器的关键。
现在我们理解提示与推理
15. 提示工程
只要你多少用过 AI,你多半已经注意到一件事……
你提问的方式,非常非常关键。
这就是提示工程(prompt engineering)的全部意义。

这是通过调整输入数据,使模型能够提供更好、更有用的输出结果的过程。
同一个问题,换两种问法,可能得到完全不同的结果。
你说「解释一下 API」,模型通常给你一个宽泛、表面的答案。但如果你问「用一个真实例子讲讲 REST API 怎么处理认证」,你就给了它方向,输出立刻变得聚焦、实用。
好的 prompt 不在于复杂,而在于清晰。
当你把想要的讲清楚,模型就更可能给你正好的东西。有时候要设定角色,比如让它以资深工程师的身份作答。有时候要给例子、拆步骤,或者只是把格式和语气说具体。
时间一长,你会意识到一件重要的事。
提示工程不只是一个技巧,不是一个权益之计。
它是你和模型沟通的主要方式。
而它带来的差别,是巨大的。
一个模糊的 prompt 给你泛泛而谈的输出。一个精心设计的 prompt,能给你结构化、准确、真正能用的东西。
🔗:https://medium.com/@Deep-concept/list/ai-art-prompts-e71cb2dcda05?source=post_page—–b7dd3ad2b506—————————————
16 思维链(CoT)
有时模型答得烂,不是因为它什么都不会,而是因为它跳答案跳得太快。
这时候,思维链(chain of thought)登场了。

它是一种引导式方法:让模型分中间步骤来解决问题,而不是直奔最终结果。对涉及逻辑、数学,或任何需要多步推理的任务,帮助往往很大。
一个简单的理解方式是这样的:
如果你只要最终答案,模型可能太依赖模式匹配。但如果你鼓励它更仔细地处理问题,它就更有可能得出正确的结果。
比如你让模型直接解一道乘法题,它有时会猜错。但要是先让它把问题拆成小块再合并,答案就可靠多了。
这就是为什么思维链常被形容成「给模型一块草稿纸」。
不逼它秒答,而是允许它分小步处理任务。对许多推理密集型的问题,这么一个小改变,能带来大不同。
简单说,更好的结果,往往来自给模型留足推理的空间……
而不是逼它一步跳到底。
现在聊聊构建 AI 系统
17. RAG(检索增强生成)
还记得我们前面聊过的幻觉问题吗?
RAG,就是对付它最实用的手段之一。

思路很简单。
不只依赖模型已经知道的东西,而是在它回答的那一刻,给它接入真实、相关的信息。
生成回答之前,系统先从知识源里检索有用的文档。这些文档随后作为上下文喂给模型,模型用它们生成更有根据的回答。
你可以这样想。
模型不再凭记忆硬答,而是被允许先查一下资料。
比如你做一个客服助手。当有人问价格、问政策时,系统不瞎猜。它先到你内部文档里拉最新信息,然后由模型用清楚、自然的方式讲出来。
这个方法厉害的地方,在于角色的分工。
模型负责理解问题、解释答案。知识库负责提供真材实料的事实。
而这带来一个巨大的优势。
如果你的信息变了,不用重新训练模型。只要更新文档,系统马上就会用上新数据。
简单说,RAG 把模型从「靠记忆」……
变成了「能读、能核实、带着真实上下文回应」的东西。
而这就是它在真实场景里可靠得多的原因。
18 向量数据库
所以,如果 RAG 的核心是取回正确的信息……
系统到底是怎么找到它的?
这就轮到向量数据库(vector database)出场了。

向量数据库不按传统方式存文本,它存的是嵌入——我们前面讲过的「含义的数字表示」。
这让系统能基于语义相似度搜索,而不是死抠关键词。
实际跑起来是这样的:
你的文档先被拆成小块,每一块转成一个嵌入。这些嵌入随后存进数据库。
用户提问时,那个查询也被转成嵌入。系统然后找与它最近的已存向量——也就是含义最接近的那些——把它们作为上下文返回。
它和传统搜索的差别,就在这里。
如果你用精确关键词搜,很可能因为措辞不同而漏掉相关信息。但用向量搜索,系统依然能找到正确内容,因为它懂的是词背后的意图,而不只是词本身。
这就是 RAG 能跑得这么顺的原因。
模型检索的不只是文本,它检索的是最相关的「含义」。
处理这类搜索的工具不少,包括 Pinecone、Weaviate、Qdrant,甚至 PostgreSQL 配上支持向量查询的扩展。
简单说,向量数据库,就是让 AI 系统越过关键词匹配……
开始像人一样思考着搜索的东西。
19.AI 智能体
到目前为止,我们聊的全都聚焦在「生成文本」的模型上。
但如果模型真的能动手做事呢?
这就是 AI 智能体(AI agent)登场的地方。

AI 智能体,说白了就是一个能采取行动的模型,而不只是回应。它不会停在答案上——它能调用工具、跑代码、搜信息、调 API,把这些步骤组合起来完成一个任务。
换句话说,它从「想」走到了「做」。
大多数智能体在一个简单的循环里运转。
它们观察当前情况,决定下一步做什么,采取行动,然后根据变化重复这个过程。模型就坐在这个循环的中心,每一步都是决策者。
想象一个在修 bug 的编程助手。
它读问题、翻代码库、找出可能出错的地方、写修复、跑测试、看哪里挂了,再调整方案直到一切正常。每一步都依赖前一步,模型随着新信息不断自我调整。
这很强大,但也是麻烦开始的地方。
每一步都可能出错,而小错会累积。一个看起来简单的任务,一旦牵扯连续多个决策,就可能变得不可靠。
这就是为什么做好智能体,不只是让它们「能打」。
而是让它们「靠谱」。
现代系统非常强调规划、验证、重试和自我纠正,来让这些多步工作流不跑偏。
简单说,AI 智能体,就是把语言模型变成能在现实世界里真正动手干活的系统的东西。
20 扩散模型
到目前为止,我们主要聊的是文本。
那图像呢?
这就轮到扩散模型(diffusion model)了——众多现代图像生成器背后的技术。

这个想法,反直觉得让人意外。
模型不是学怎么直接画图,它先学怎么「毁掉」图。
训练时,真实图像被一遍遍加噪,逐渐破坏,直到变成一团完全的噪点。然后模型被训练去逆向这个过程——一步步学会去噪、恢复原图。
要生成新东西时,流程就翻转过来。
你从纯噪声开始。
然后,一点一点地,模型把它清理干净——补上结构、形状、细节,直到一幅完整的图像浮现。每一步都在精炼结果,由你的 prompt 引导,把随机变成有意义。
「扩散」这个名字来自物理学:粒子随时间随机散开,就像墨水在水里化开。
在这里,模型学的正是反方向——如何从那种随机里,找回秩序。
有意思的是,这个想法已经不限于图像了。
同样的方法,现在被用来生成视频、音频、3D 内容,甚至用在设计分子、预测蛋白质结构这类科学领域。
简单说,扩散模型,就是让 AI 从纯噪声……
变成你能真正看到、听到、用到的东西的技术。
原文标题:20 Most Important AI Concepts Explained in Just 20 Minute
原文链接:https://medium.com/lets-code-future/20-most-important-ai-concepts-explained-in-just-20-minute-b7dd3ad2b506
作者:Deep concept
审核:李泽慧
编辑:魏心语
本文由人人都是产品经理作者【TCC翻译情报局】,微信公众号:【TCC翻译情报局】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。
题图来自Unsplash,基于 CC0 协议。

起点课堂会员权益





迁移学习让普通人也能搞AI应用,这个点说得很实在。但要注意,预训练模型的底子好不好直接决定迁移效果,用开源小模型还是商业大模型作为起点,差距不小。所谓“站在楼顶盖楼”,地基其实是别人给的,选哪栋楼也得花心思。