【AI数学】30分钟拆解AI核心公式-复习笔记

上一篇我们搞定了符号,这一篇直接拆解AI论文中出现频率最高的6个公式。每个公式都是:问题→公式→拆解→代码。 前置要求:读完上一篇符号速查手册。 一、Softmax与交叉熵损失 问题:如何把模型输出变成概率? 神经网络输出的是一堆数字(logits),可能是负数、可能很大。我们需要把它们变成概率分布(非负、和为1)。 公式 $$\text{softmax}(x_i) = \frac{e^{x_i}}{\sum_{j=1}^{K} e^{x_j}}$$ 拆解 $e^{x_i}$:指数函数,把任意数变成正数 $\sum_{j=1}^{K} e^{x_j}$:所有指数的和,用于归一化 除法:确保结果和为1 为什么用指数? 因为指数函数会放大差异——大的更大,小的更小,让模型更"自信"。 代码实现 import numpy as np def softmax(x): """ 输入: x, shape (K,) 或 (batch, K) 输出: 概率分布,shape同输入 """ # 减去最大值防止数值溢出(数学上等价) exp_x = np.exp(x - np.max(x, axis=-1, keepdims=True)) return exp_x / np.sum(exp_x, axis=-1, keepdims=True) # 示例 logits = np.array([2.0, 1.0, 0.1]) probs = softmax(logits) print(probs) # [0.659, 0.242, 0.099] print(probs.sum()) # 1.0 交叉熵损失 有了概率,如何衡量预测和真实标签的差距? $$L = -\sum_{i=1}^{K} y_i \log(\hat{y}_i)$$ 其中 $y_i$ 是真实标签(one-hot),$\hat{y}_i$ 是预测概率。 简化形式(单标签分类): $$L = -\log(\hat{y}_{correct})$$ 就是正确类别的概率取负对数。概率越高,损失越小。 def cross_entropy_loss(probs, label): """ probs: softmax输出的概率, shape (K,) label: 正确类别的索引, int """ return -np.log(probs[label] + 1e-10) # 加小数防止log(0) # 示例 probs = np.array([0.7, 0.2, 0.1]) loss = cross_entropy_loss(probs, label=0) # 正确类别是0 print(loss) # 0.357(概率0.7对应的损失) 二、注意力机制(Attention) 问题:如何让模型"关注"输入的不同部分? 翻译"我爱北京"时,生成"Beijing"应该主要关注"北京"这个词,而不是平均关注所有词。 ...

y9 .Z | January 16, 2025 | 27 min | Shanghai

【AI数学】30分钟搞懂AI论文里的数学符号-复习笔记

读AI论文最大的障碍不是英语,是数学符号。看到 $\sum$、$\nabla$、$\mathbb{E}$ 就头大?本文用符号→读法→含义→代码的模式,30分钟帮你扫清障碍。 前置要求:高中数学水平,会基础Python。 一、求和与连乘 1.1 求和符号 $\sum$ 读法:Sigma(西格玛),读作"sum" 含义:把一堆数加起来 公式示例: $$\sum_{i=1}^{n} x_i = x_1 + x_2 + \cdots + x_n$$ 论文中常见形式: 损失函数:$L = \sum_{i=1}^{N} \ell(y_i, \hat{y}_i)$(所有样本的损失加起来) 注意力权重:$c = \sum_{i=1}^{T} \alpha_i h_i$(加权求和) Python实现: import numpy as np # 方法1:直接求和 x = [1, 2, 3, 4, 5] result = sum(x) # 15 # 方法2:NumPy x = np.array([1, 2, 3, 4, 5]) result = np.sum(x) # 15 # 方法3:带条件的求和(论文常见) # 例如:只对正数求和 result = sum(xi for xi in x if xi > 0) 1.2 连乘符号 $\prod$ 读法:Pi(派),读作"product" 含义:把一堆数乘起来 公式示例: $$\prod_{i=1}^{n} x_i = x_1 \times x_2 \times \cdots \times x_n$$ 论文中常见形式: ...

y9 .Z | January 15, 2025 | 25 min | Shanghai

马斯克的超级计算机:算力军备竞赛的开始?

马斯克的xAI团队只用四个月就建成全球最大超级计算机"巨像",这个消息让我下巴都掉了。传统超算建设周期至少2-3年,这速度太疯狂了。 表层:算力军备竞赛的加速 算力是AI发展的核心驱动力,这点我当然兴奋。但冷静下来想,这会不会引发全球算力军备竞赛?“巨像"用了3万多块H100 GPU,一年电费得多少钱?上周跟AI创业公司CTO聊天,他说算力成本占公司开支60%,“跑个大模型训练得等半个月排算力”。 深层:中美超算的技术博弈 中美在超算领域的竞争早已开始。中国的神威·太湖之光和天河二号多次登TOP500榜首,美国通过AMD、英伟达技术优势反超。马斯克这次直接用GPU堆出超算,绕过了传统超算的建设周期,是另一种路径突破。 终局:算力集中的隐忧 更让我担忧的是,高端算力正集中在少数科技巨头手中,中小企业根本用不起。而且,算力竞争会不会像核武器竞赛一样,最终变成资源浪费?毕竟,AI发展的瓶颈从来都不只是算力,还有算法和数据。 马斯克总喜欢搞大新闻,这次的超级计算机到底是进步利器,还是烧钱游戏? 算力不是AI的全部,就像核武器不是战争的全部。真正的AI革命,需要的是算力、算法和数据的平衡,而不是单一维度的军备竞赛。

y9 .Z | September 25, 2024 | 2 min | Shanghai