Zer0e's Blog

Zer0e's Blog

Facing the ideal and the reality.

AI其五:如何设计用量限流系统
前言最近在梳理某大模型平台的限流策略,因此也借此梳理下系统有哪些限流手段,最常见的就是用量限流了,例如我们买codex、各种coding plan都有一个几个小时的窗口限制,防止你一次性把token消耗完。仔细想想,这个既简单又很复杂,也许是因为我没设计过这种系统,这次正好让AI帮我梳理下,但我发现他写的有点搓,我反反复复还对话了很...
去TM的AI其四:什么是MoE架构
正文在大语言模型(LLM)的快速发展中,Mixture of Experts(专家混合架构,简称MoE) 成为了提升模型规模与效率的关键技术。DeepSeek-V2、GPT-4、Mixtral等前沿模型都采用了MoE架构,在保持推理效率的同时,将模型参数量推向万亿级别。 什么是MoE?Mixture of Experts(专家混合)...
去TM的AI其二:什么是多头注意力Multi-Head Attention
多头注意力机制(Multi-Head Attention)是 Transformer 架构的核心组件,由 Vaswani 等人在 2017 年的论文《Attention Is All You Need》中首次提出。它是现代大语言模型(如 GPT、BERT 等)能够理解和生成高质量文本的关键所在。 为什么要用”多头”?在理解多头注意力...
去TM的AI其一:何为QKV和KVCache
前言新的一个系列,讲讲AI的基础知识,主要是给自己看的。至于标题只能说懂得都懂,去TMD的AI。但话这么说,AI又必须得学习,相恨相杀了属于是。第一篇打算讲讲Transformer架构中的很重要的概念,QKV,以及对应的优化KV Cache。当然,正文是AI写的(服了)。 正文什么是QKV?QKV是Transformer架构中最...
【架构之路13】节点与api-server网络不通后发生了什么
前言好久没有写这个系列了,首先我决定重启技术文章的更新,原因是我打算引入AI的编写内容,想了很久,技术文章的某个点深入后,AI也许懂得比我还多,总之先尝试下吧。回到标题,起因是去到客户现场,客户想做整个K8S集群的不可用故障注入,问我有没有什么好的办法。我给了一些方案: 将所有节点进行关机或者重启 将api-server副本数缩0...
AI时代下的一点思考2
AIGC继续聊聊AI。这篇聊聊AIGC。AIGC的全称是AI Generated Content,也就是AI生成内容。这个能聊的就比较多了,有文字,有图片,有音频,有视频等等。其实广义上来说,AI coding也算是AIGC的一种,只是我单独领出来聊了。那接下来就根据生成内容的不同分别聊聊。 AI文学所实话,现在这种视频平台上的文学...
AI时代下的一点思考1
前言我觉得这个社会对AI的焦虑越来越严重了,虽然我也是,但是我其实对大部分的东西还是不看好,但是在一些领域上AI确实令我感到牛逼。自从投资了AI以来,我愈发认为AI目前就是资本的故事。不可否认的,AI确实已经渗透人们生活的方方面面,比如日常的工作、聊天、视频、娱乐等等。但它依旧只是互联网的延申,例如推荐算法、AI文稿等等。最近很想写...
记一次小米售后
前言说实话,我也没想到我会在博客上分享生活琐事,只是突然觉得,偶尔分享分享不那么重要的私事好像也没什么。 叙旧事情的起因是我的小米平板5pro,21年买的,那时候米子刚重新开了平板产品线,那时候幻想的挺好的,我要用平板用来学习、看书,偶尔再刷刷视频。有句名言叫做买前生产力,买后爱奇艺,对此我不能说嗤之以鼻吧,算是有点认可。我刚工作第...
2025年末碎碎念
流水账转眼间又到了这个时候,2025年最后一个月,人生又过了一年!这一年好像发生了很多,又好像十分平淡。又或许每天都在行尸走肉当中。总是想提笔写点什么,但又不知道如何下笔。心中好像有很多想法,但这些想法又好像一团浆糊,黏在脑子里,说不出写不出,只能影响思考。但我还是认为应该留下点什么,在2025年的年底回忆这一年,反思过往。 那...
avatar
Zer0e
耿直的现实主义者 / 无情的bug制造机器 / 不入流的架构师