前言又是两场面试,一场是北京的量化公司好像,感觉很不尊重面试者,被我自己pass了。另一家火山模型的SRE,经历不太匹配没后文了。挺迷茫的。
复盘按主题分四块整理:
一、网络与算法基础
二、容器与 K8s
三、存储与中间件
四、大模型 SRE 与 AI Agent
一、网络与算法基础Q1. TCP 三次握手的过程是怎样的?为...
每年我都会在生日当天写点啥,今年也随便写写。想到啥写啥,比较胡言乱语,抱歉。
最近看了两篇文章,大概意思是用fable 5写代码,感觉是神之一手,把自己都不知道怎么定位的bug解决了,认为ai时代下代码已死。我其实非常认同文章里的观点,我对ai编码的恐惧大概是发生在23年年底24年年初。那时候llm还没有像现在这么广泛,但我依然...
前言最近也是遇到了一个线上问题,比较严重,因此和AI对话了几轮,让他帮我总结下问题。有了AI之后,好像很多系统的工程能力都在减弱。我还是维持我的观点,AI是好,但是他只能帮助你50%的工作,架构师、开发的工作是理解业务、设计整个方案、避免踩坑,然后再把具体的实现抛给AI去做。来看遇到的问题吧。
Lettuce 是 Java 生态...
前言周四晚经历了一场面试,整体来说答得不是很好,总共就面试了20分钟左右。基础知识很多都忘了,写篇文章顺道复习下。至于为什么这篇是2,1的话由于我没录音所以很难整理,但问的没那么基础,有时间再整理下。
复盘这次面试的是一个高级运维岗,除了一个项目外,基本都是围绕运维体系提问。
介绍一下 K8s 集群的核心组件面试的时候回答了...
如果说 KV Cache 是大模型推理的”记忆加速器”,那么 PD 分离架构(Prefill-Decode Disaggregation) 就是把这个加速器搬上了高速公路——但同时也带来了一个新问题:记忆本身要运输了。
今天我们就来聊聊:在 PD 分离架构下,KV Cache 面临哪些挑战,又有哪些优化手段?
先回顾:LLM 推理的...
什么是投机解码 (Speculative Decoding)投机解码(Speculative Decoding)是大语言模型推理加速领域的一项创新技术,它通过”先猜后验”的策略,在保持生成质量不变的前提下,将推理速度提升 2-3 倍。这项技术由 Google 等团队在 2023 年提出,迅速成为推理优化的重要方向。
为什么要提出投机...
前言最近在梳理某大模型平台的限流策略,因此也借此梳理下系统有哪些限流手段,最常见的就是用量限流了,例如我们买codex、各种coding plan都有一个几个小时的窗口限制,防止你一次性把token消耗完。仔细想想,这个既简单又很复杂,也许是因为我没设计过这种系统,这次正好让AI帮我梳理下,但我发现他写的有点搓,我反反复复还对话了很...
正文在大语言模型(LLM)的快速发展中,Mixture of Experts(专家混合架构,简称MoE) 成为了提升模型规模与效率的关键技术。DeepSeek-V2、GPT-4、Mixtral等前沿模型都采用了MoE架构,在保持推理效率的同时,将模型参数量推向万亿级别。
什么是MoE?Mixture of Experts(专家混合)...
Multi-Head Latent Attention(MLA,多头潜在注意力)是由 DeepSeek 团队在 DeepSeek-V2 模型中提出的一种创新注意力机制。它在保持多头注意力强大表达能力的同时,显著降低了推理时的 KV Cache 内存占用,是大型语言模型效率优化的重要突破。
为什么要提出 MLA?在传统的 Multi-...
多头注意力机制(Multi-Head Attention)是 Transformer 架构的核心组件,由 Vaswani 等人在 2017 年的论文《Attention Is All You Need》中首次提出。它是现代大语言模型(如 GPT、BERT 等)能够理解和生成高质量文本的关键所在。
为什么要用”多头”?在理解多头注意力...