我为什么开始写这个网站
初衷 我在学习和工作的过程中,曾经写过一些笔记,也用过很多写笔记的工具,这些笔记分散在不同的工具或者平台里,这里面有日记本,微信收藏,有道云笔记,Notion,One Note, Obsidian Vault等等。这些信息很分散,管理起来是...
初衷 我在学习和工作的过程中,曾经写过一些笔记,也用过很多写笔记的工具,这些笔记分散在不同的工具或者平台里,这里面有日记本,微信收藏,有道云笔记,Notion,One Note, Obsidian Vault等等。这些信息很分散,管理起来是...
概述 从 2018 年到 2025 年,GPT 系列用七年时间从一篇不太被看好的论文,变成了改变世界的产品。理解它的演进过程,就是理解 LLM 技术的核心发展脉络。 mermaid timeline title GPT 系列演进 2018 ...
为什么需要注意力 在 Transformer 之前,处理序列数据的主流方案是 RNN 和 LSTM。它们按顺序逐个处理 token——第 3 个 token 必须等第 2 个 token 算完。 这个"必须等待"带来了两个致命问题:不能并行...
RAG 解决了什么问题 LLM 有两个顽固问题:知识截止(训练数据只到某个日期)和幻觉(编造不存在的事实)。RAG(RetrievalAugmented Generation)用外部知识库解决了这两个问题——查询时实时检索相关文档,把文档内...
为什么需要 LoRA 全量微调 7B 模型需要 50+ GB 显存。LoRA 通过低秩分解将可训练参数减少 1000 倍。 核心原理 在预训练权重旁添加低秩矩阵 A 和 B: $$W' = W + \alpha \cdot AB$$ 其中 ...
什么是 Prompt Engineering Prompt Engineering 是通过设计输入文本引导 LLM 产生期望输出的技术。随着模型能力增强,Prompt 技巧也在不断演进。 基础技巧 ZeroShot 直接提问,不提供示例。适...
什么是 AI Agent AI Agent 是能够自主感知环境、制定计划、调用工具、执行行动的 AI 系统。和传统的"输入输出"LLM 不同,Agent 是多轮交互的——它会在思考和行动之间循环,直到完成任务。 mermaid graph ...
推理为什么慢 LLM 推理是自回归的——每次生成一个 token,需要重新计算整个序列的注意力。这导致计算量随序列长度平方增长。 KV Cache 推理时将之前计算的 Key 和 Value 矩阵缓存起来,新 token 只需要计算增量部分...
两条路线 OpenAI 和 Anthropic 代表了 AI 行业的两条核心路线。 OpenAI Anthropic 定位 产品平台 安全研究 代表产品 ChatGPT、GPT API Claude、Claude API 安全策略 RLHF...
开源是核心变量 国产大模型最值得关注的方向,不是谁拿了多少融资,而是开源生态的建立。 阿里通义千问系列全面开源后,国内开发者第一次有了可自部署的、免费用且性能不错的模型。这催生了大量的微调模型和应用生态。DeepSeek 的 MoE 架构和...
Apple 的 AI 哲学 2024 年 WWDC 上,Apple 发布了自己的 AI 战略。和 OpenAI、Google 不同,Apple 的定位很清晰:AI 不是独立产品,而是系统能力。 这意味着 AI 被深度嵌入到 Siri、写作工...
当前差距 在 MMLU、HumanEval 等标准基准上,开源模型正在快速追赶。但在复杂推理、指令遵循和安全性上,闭源模型仍有明显优势。 追赶路径 数据质量:开源模型的训练数据质量在提升,尤其是代码和数学数据 合成数据:GPT4 生成的高质...
为什么用低代码平台 Dify 和 FastGPT 封装了 RAG 的复杂技术栈,让个人开发者能在 10 分钟内搭建一个知识库问答系统。 Dify 实践 yaml 知识库配置: 文档格式: Markdown 切片大小: 500 tokens ...
注意:LLM API 的定价变化非常频繁。本文中的价格信息为 2026 年 7 月的参考值,实际使用前请查看各厂商官网的最新定价页面。 计价方式 LLM API 按 token 计费。核心规则:输入 token 和输出 token 分别计价...
核心能力 GitHub Copilot 不只是代码补全,它能理解上下文、生成函数、写测试和文档。 高效使用 Tab 补全:最基本也是最常用的方式 Ctrl+I:打开 Copilot Chat,用自然语言描述需求 选中代码 → Ctrl+I:...
技术选型 前端 AI 聊天窗口的核心是流式响应——让用户看到逐字生成的效果。 实现要点 javascript async function chatmessages { const response = await fetch'https:...
关于这本书 《Deep Learning》2016 年出版,至今仍是 AI 领域最重要的教科书之一。 十个关键收获 1. 表示学习:深度学习的核心不是分类,而是学习好的表示 2. 反向传播:链式法则的工程实现,所有神经网络的训练基础 3. ...
课程的独特价值 Andrew Ng 的《AI For Everyone》是 Coursera 上最受欢迎的 AI 入门课。它不讲代码,而是教非技术人员理解 AI 的边界。 核心概念 1. 监督学习:AI 最成功的范式,从输入到输出的映射 2...
课程概述 CS229 是 Stanford 的经典机器学习课程,由 Andrew Ng 主讲。和偏重实践的 CS231n 不同,CS229 更强调数学和算法原理。 知识体系 监督学习 线性回归、逻辑回归、SVM、决策树、集成方法 学习理论 ...
核心论点 Stanley 的核心观点是:真正的突破性创新很少来自目标驱动,而是来自基于兴趣的探索。 对 AI 研究的启示 深度学习本身就是"探索"的结果。Hinton 坚持神经网络 30 年,当时没人认为这是正确的方向。如果一切都以短期目标...
开源的真正意义 Meta 开源 Llama 不是慈善,而是一种竞争策略。更多开发者使用 Llama → 更多改进反馈 → 模型变得更好 → 威胁闭源厂商的地位。 安全争论 开源模型可以被任何人下载、修改和部署,这引发了安全担忧。但同时,开源...
电影中的 AI 2013 年 Spike Jonze 的《Her》描绘了一个能与人类建立情感连接的 AI 操作系统 Samantha。电影中没有视觉界面,只有声音和对话。 十年后的现实 ChatGPT 的语音模式已经非常接近《Her》的对话...
工具改变认知 用 Obsidian 之前,我的笔记是线性的——文件夹 → 子文件夹 → 文件。用 Obsidian 之后,知识变成了网络——每个概念都是一个节点,节点之间的连线代表关联。 这不是工具的改变,是思维方式的改变。 双向链接的力量...