标签:AI原理
共 44 篇
什么是 FlashAttention?为什么注意力计算能更快更省显存
FlashAttention 是什么?它没有改变 Transformer 的结果,为什么却能加速长上下文训练与推理?讲清显存读写瓶颈、分块计算与实际意义。
什么是位置编码?Transformer 如何知道词的顺序
Transformer 一次看所有 token,为什么还能分清“我喜欢你”和“你喜欢我”?位置编码是什么、有哪些做法、它和上下文长度有何关系,一文讲清。
什么是 Scaling Law?大模型「越大越强」的底层规律
为什么各家敢砸几十亿训练模型?Scaling Law 是什么、参数量数据量算力该怎么配、为什么说它开始撞墙,以及推理时计算这条新曲线,一文讲清。
什么是 Function Calling?AI 从"只会说"到"能动手"
AI 本来只会生成文字,为什么现在能帮你查天气、算数、订日程?Function Calling(函数调用/工具调用)是什么、怎么工作、和 Agent、MCP 有何关系,一文讲清。
什么是 RLHF?AI 是怎么被"调教"得懂事的
同样是大模型,为什么 ChatGPT 会礼貌回答、拒绝坏请求,而不是胡乱接龙?RLHF 和"对齐"是什么、AI 怎么学会好好说话、又有什么副作用,一文讲清。
什么是扩散模型?AI 绘画和视频是怎么"画"出来的
Midjourney、Sora 这些 AI 是怎么凭一句话生成图片和视频的?扩散模型的"加噪—去噪"原理、为什么它和大模型不一样、一文用大白话讲清。
什么是混合专家(MoE)?为什么超大模型还能跑得动
DeepSeek、Mixtral 都在用的 MoE 是什么?一个"专家会诊"的比喻讲清混合专家模型的原理、为什么它又大又省、和普通大模型有什么区别,一文看懂。
什么是 Token?大模型计费和上下文的基本单位
AI 按 Token 计费、上下文按 Token 算长度,但 Token 到底是什么?一个汉字算几个 Token、为什么 AI 数不清 strawberry 有几个 r,一文讲清。
开源大模型 vs 闭源:Llama、DeepSeek 能替代 ChatGPT 吗?
开源大模型免费又能本地跑,是不是就不用订阅 ChatGPT 了?一文讲清开源与闭源的真实差距、各自适合谁,以及本地部署那些被忽略的隐性成本。
为什么 AI 每次回答都不一样?聊聊 Temperature 与随机性
同样的问题问两遍,AI 给的答案却不同——这不是 bug。一文讲清 Temperature、Top-p 等采样参数是什么,以及什么时候该调高、什么时候该调低。
大模型是怎么工作的?看懂 Transformer 与「预测下一个词」
ChatGPT 背后到底在做什么?用最直白的方式讲清大模型的核心:它其实只是在「预测下一个词」,以及 Transformer、注意力机制、训练两阶段。
什么是 Embedding 向量?一文讲清 AI 语义搜索的核心
RAG、语义搜索、推荐系统背后都靠它——Embedding(向量)到底是什么?用最直白的方式讲清文本怎么变成向量、为什么语义相近向量就相近。