谁的梦想
诱惑力的睫毛,甜如蜜一般的嘴角,我是一只性感小野猫 ——为了看到阳光,我来到这个世界上
online softmax论文解读 online softmax论文解读
softmax进化Naive Softmax d₀ ← 0 for j = 1 to V do     dⱼ ← dⱼ₋₁ + e^(xⱼ) end for for i &#
2026-02-24
roofline模型 roofline模型
roofline是一种做性能分析的模型差不多是:min(算力,带宽×操作强度) 算力指每秒能做多少浮点数运算 带宽指每秒能搬运多少浮点数 操作强度指一个浮点数需要做多少运算 于是画图,横轴为操作强度,带宽假设恒定,算力恒定,就会出现类似“厂
2026-02-24 Austin
leetcode每日一题No.994腐烂的橘子 leetcode每日一题No.994腐烂的橘子
994.腐烂的橘子在给定的 m x n 网格 grid 中,每个单元格可以有以下三个值之一: 值 0 代表空单元格;值 1 代表新鲜橘子;值 2 代表腐烂的橘子。每分钟,腐烂的橘子 周围 4 个方向上相邻 的新鲜橘子都会腐烂。 返回 直到单
2026-02-05
本赛题一共有三题,由易到难: 题目一: 考察点:考察选手对特定算法的理解和实现能力。 主要任务:实现一个 Online Safe Softmax 算子。 硬件要求:需要在 X86 架构上进行优化,并考虑使用 SIMD 指令集。 题
2026-02-05 Austin
leetcode每日一题No.200岛屿数量 leetcode每日一题No.200岛屿数量
200.岛屿数量给你一个由 ‘1’(陆地)和 ‘0’(水)组成的的二维网格,请你计算网格中岛屿的数量。 岛屿总是被水包围,并且每座岛屿只能由水平方向和/或竖直方向上相邻的陆地连接形成。 此外,你可以假设该网格的四条边均被水包围。
2026-02-04
GPU结构 GPU结构
接触了一些cuda编程的概念后我觉得得先从GPU的结构下手按我逻辑上比较舒服的顺序梳理一下结构 GPU由哪些大部件组成一整张GPU卡由大量SM+全局缓存+显存接口组成 GPU的主存为HBM/GDDR(显存),存放:模型权重
2026-02-02 Austin
很好,这个信息非常关键。4090 + Python 熟 + C++ 有基础 + 框架不熟,这在“推理优化工程师候选人”里是非常好的起点,而且路线应该明显偏向 “先框架 → 再 CUDA → 最后深度 C++”,而不是反过来。 下面我给你一条
2026-01-27 Austin
训练/推理 优化 训练/推理 优化
因为大模型只是比较杂比较乱 我又不太擅长零散的记忆 所以试图把训练和推理的一些知识以一种顺序让自己能串联起来 训练首先训练模型的步骤我们走一个完整流程 文本->张量->loss->梯度->参数更新->check
2026-01-27 Austin
plan-now plan-now
看你这张 JD,它要的”Infra 实习生”其实很明确:大模型/多模态/视频生成的训练与推理基础设施 + 性能优化 + 高并发高可用,并且点名了 算法优化、通信优化、调度优化、计算与通信 overlap。你可以按下面这条
2026-01-27 Austin
大模型基础知识 大模型基础知识
补短 对于模型训练过程中,如果出现样本标签数据分布极其不均衡,通常会采取什么方法来解决问题问题本质loss会被多数类主导,会使得模型只要学会猜多数类就能得高分所以核心目的是:让模型在训练时多关心少数类 解决方式数据层面1.过采样(overs
2026-01-20 Austin
DiT DiT
又回顾了一下DiT运作的方式发现其中有的地方我还不太熟,熟悉之后再大概记录一下 依旧还是像以前的博客一样,左边写被处理的东西,右边括号内写处理方式 训练img(vae encode)latent representation(加噪+time
2026-01-20
数学 数学
线性代数稍微回顾线性代数得到了一些以前我没搞懂或者我看的教学视频/文章没说清楚的结论矩阵乘法举例: | a11 a12 | | x11 | = | a11x11 + a12x21 || a21 a22 |
2026-01-15 Austin
1 / 2