PolaZhenjing Wiki

文章知识库

围绕 AI 产品、Agent 工作流、数据基础设施和个人知识生产的长期笔记。

83
篇文章
9
个主题
1194
分钟阅读
348785
字词沉淀

Browse

快速 Wiki

完整索引

agent-systems · 10 分钟阅读

把 MiniMax-M3 装进 DeepSeek Harness:一个完整的过程报告

DeepSeek Harness(DSH)是一个把\\\"模型 + 工具 + 会话 + GUI\\\"做成可插拔件(cordis plugin)的桌面 / Web Agent 运行时。本次任务是给它接入一个新模型——MiniMax-M3——作为除官方 DeepSeek-V4 之外的第二条 provider 路线。我把全过程跑下来,把\\\"DSH 怎么把一个外部模型纳入它自己的体系\\\"这个机制讲清楚。

agent-systems deepseek anthropic openai
把 MiniMax-M3 装进 DeepSeek Harness:一个完整的过程报告

industry-analysis · 8 分钟阅读

DeepSeek Harness 设置

DeepSeek Harness(dsh)是 DeepSeek AI 开源的智能体框架,采用「一切皆插件」架构。本文将介绍如何把它接到 Aiberm,使其作为自定义的 OpenAI 兼容提供方。配置完成后,一把 Aiberm API Key 即可调用 Claude、GPT、Gemini、DeepSeek、Kimi、Minimax、GLM、Grok 以及平台上的其他模型。

industry-analysis deepseek openai anthropic
DeepSeek Harness 设置

industry-analysis · 14 分钟阅读

梁文峰投资者纪要-为什么梁文锋如此独特

在一个追逐规模、追逐估值、追逐垄断的行业里,梁文锋讲了一个听起来近乎\\\"反常识\\\"的故事:他不想赚最多的钱,开源最强的模型,不抢用户,不做视频生成,不做世界模型,不做 3D,不加班,没有组织架构,没有 KPI。而恰恰是这套\\\"反常识\\\"的打法,让 DeepSeek 在两年内从一家\\\"没有什么优势\\\"的小公司,变成了全球 AI 牌桌上不可忽视的中国力量。

industry-analysis openai anthropic deepseek
梁文峰投资者纪要-为什么梁文锋如此独特

coding-tools · 14 分钟阅读

AI 编程工具层出不穷,但真正的问题不是"AI 能不能写代码",而是"如何让 AI 按照软件工程的标准流程开发

最近两年,AI 编程工具的迭代速度让人眼花缭乱。从自动补全到对话式生成,从单文件改写到跨项目重构,AI 写代码的能力已经跨过了一道又一道门槛。但很多团队用下来却发现一个尴尬的事实:**AI 越能干,团队反而越累。**代码是产出了不少,可线上事故多了几倍,技术债越堆越厚,回头想看看当初为什么这么改——没人记得了。出在大多数 AI 编程工具只解决了\"写\"这一环,而软件工程的完整链路远不止\"写\"。

coding-tools claude codex workflow
AI 编程工具层出不穷,但真正的问题不是"AI 能不能写代码",而是"如何让 AI 按照软件工程的标准流程开发

coding-tools · 74 分钟阅读

很多人开始使用 AI 工具时,会很快遇到几个问题:

很多人刚开始使用 AI 工具时,常常会撞上这样几堵墙:明明模型能力很强,跑出来的结果却忽好忽坏;同一个任务,换个说法效果天差地别;对话越长,AI 越容易跑偏;工具功能堆了一堆,却不知道该怎么组织成自己的工作流;看过无数零散教程,真正动手时依然不知道从哪里开始。

coding-tools openai context-engineering guide
很多人开始使用 AI 工具时,会很快遇到几个问题:

coding-tools · 60 分钟阅读

想象一个场景。

<think>The user wants me to write a long article in the style of 炽驹Polaris (which I've created as a persona). The style mimics 陈春成, focusing on literary texture within tech narratives.

coding-tools openai codex llm
想象一个场景。

ai-engineering · 16 分钟阅读

There is a sentence sitting on almost every AI engineering job

你有没有过这样的经历——刷到一则看起来完全对口的 AI 工程岗位,兴奋地点进去,读到第一行要求,默默按下了返回键。那行字,几乎长一个样:然后你告诉自己:\"这条路对我关上了。\"但事实是,这扇门从来没有真正锁死过。它只是一道为了旧招聘流程而设立的过滤网,而如今真正拿下 offer 的人,靠的往往不是那张纸,而是另外一些招聘页上不会写出来的东西。

ai-engineering rag guide llm
There is a sentence sitting on almost every AI engineering job

coding-tools · 16 分钟阅读

GitHub 的奶爸级别教学

前两天我在群里看到有人问,GitHub 到底咋注册。一个挺基础的问题,但底下没人接。怎么说呢,2025 年了还有人不会用 GitHub,其实挺正常的,因为这东西一没人带,二全是英文界面,三各种教程上来就教你装 Git、配环境、写命令,把人直接劝退。但现在情况变了,AI 编程工具普及之后,GitHub 已经不是程序员的专属玩具了。

coding-tools claude llm guide
GitHub 的奶爸级别教学

agent-systems · 25 分钟阅读

我最近几次聊 Skills,有一个越来越明确的判断:

最近连续几次和朋友聊 Skill,脑子里越来越清晰的只有一个结论:模型之外的下一波红利,属于 Skill。更具体地说,是三个判断:第一,Agent 不会抹平人的能力差距,反而会放大差距。第二,Skill 是目前唯一能系统性弥合 Agent 能力差距的东西。第三,Skill 的本质不是提示词,而是\"能力商品\",它会把人的经验、品味和流程变成可分发、可复用、可迭代的商品。

agent-systems opinion prompt-engineering workflow
我最近几次聊 Skills,有一个越来越明确的判断:

agent-systems · 18 分钟阅读

HarnessX:可组合、自适应、可演化的 Agent

当 Claude、GPT、Qwen 这样的语言模型变得越来越强,业界似乎默认了一条进步路线:把模型做大。但 HarnessX 的作者们提出了一个不同的问题——**如果 Agent 的瓶颈不在模型本身,而在模型与任务之间的\\\"中介层\\\"呢?

agent-systems workflow case-study prompt-engineering
HarnessX:可组合、自适应、可演化的 Agent

coding-tools · 15 分钟阅读

Claude Code CLI 命令大全:60 个原生命令一次讲清,照着用就行

你刚装完 Claude Code,打开终端,光标在 `>` 提示符后面闪。大概率脑子里会冒出这几个问题:- 启动默认是 sonnet,想换成 opus 怎么操作?- 对话一长就卡,听说有 `/compact` 但不知道什么时候该用- AI 一通操作把项目改崩了,能不能整体回滚?- `CLAUDE.md` 到底是什么?

coding-tools claude anthropic guide
Claude Code CLI 命令大全:60 个原生命令一次讲清,照着用就行

model-research · 13 分钟阅读

2026-06-15

Tim Genewein 和他在 DeepMind 的十几个同事,最近往 arXiv 上扔了一份 70 页的报告。说真的,我一开始以为就是个普通的 survey paper,打开一看发现...这玩意直接把\"AGI 之后怎么办\"这件事,从科幻拉到了工程层面。怎么说呢,过去十年我们聊 AGI 聊得够多了,但很少有人认真讨论,AGI 之后呢。这篇报告的标题很直白,叫《From AGI to ASI》。

model-research llm video-generation research
2026-06-15

ai-engineering · 56 分钟阅读

Loop Engineering 从一句句喂 prompt,到设计让 agent 自己干活的系统

**The New Layer Above the Harness**文档版本:v260615发布时间:2026-06-15 (build #0)涵盖内容:定义 · 演化 · 解剖 · 六零件 · 评判器 · 真实案例 · 代价 · 上手本手册包含的产品信息、功能描述和定价可能随时变化,请以各产品官方文档为准。

ai-engineering opinion prompt-engineering anthropic
Loop Engineering 从一句句喂 prompt,到设计让 agent 自己干活的系统

coding-tools · 11 分钟阅读

盘点16个把自己蒸馏成Skills的国民级App

盘点16个把自己蒸馏成Skills的国民级App最近一次用Agent点咖啡,是在一个没什么特别的下午。我对它说,帮我点一杯瑞幸,最近心脏不太舒服,不要带咖啡因的。它没有急着接话。先问我要了位置,又在几百米外的一家门店里翻找了一会儿,列出三个选项,大杯、特大杯、超大杯,唯独跳过了中杯。我想笑,又觉得它过于实在。它接着问,确认下单吗。我说,确认。它便递过来一个二维码,让我扫码支付。整件事在这里停住了。

coding-tools codex opinion ai
盘点16个把自己蒸馏成Skills的国民级App

coding-tools · 15 分钟阅读

> 一篇给 Claude Code 新手的命令速查教程。这也是我自己的学习笔记。

刚装好 Claude Code,打开终端,闪烁的光标静静等待输入。接下来的几分钟,你大概率会撞上这几个高频困惑:默认跑着 Sonnet,想换 Opus 该怎么操作?对话一长就卡顿,听说有 `/compact` 但拿不准时机;AI 一通猛改把项目改崩了,能不能一键回滚?每个教程都喊你写一份 `CLAUDE.md`,这文件到底是干啥的?

coding-tools claude guide anthropic
> 一篇给 Claude Code 新手的命令速查教程。这也是我自己的学习笔记。

ai-engineering · 11 分钟阅读

Most people use Claude like a search box

大多数人用 Claude 的方式,和用搜索引擎没区别:问一个问题,扫一眼答案,关掉标签页。然后继续过自己的一天。这其实是在浪费这款工具最值钱的能力。我最近重读了斯坦福 OVAL 实验室发表在 NAACL 2024 上的那套研究系统——STORM,全称是 **Synthesis of Topic Outlines through Retrieval and Multi-perspective Que…

ai-engineering claude prompt-engineering research
Most people use Claude like a search box

agent-systems · 12 分钟阅读

Loop engineering is replacing yourself as the person who

过去两年,我们与 AI 编程助手的相处方式几乎一成不变:你写一句 prompt,丢进去足够的上下文,读一读它吐出来的东西,再写下一句。一来一回,你握着方向盘,agent 是你手里的工具。但最近,这个姿势正在悄悄变化——你不再是那个\"按回车的人\",而是那个\"设计系统让它自己按回车\"的人。这就是 **Loop Engineering**,循环工程。

agent-systems anthropic claude codex
Loop engineering is replacing yourself as the person who

ai-engineering · 55 分钟阅读

2 0 2 6 年6 月版

从一句句喂 prompt,到设计让 agent 自己干活的系统The New Layer Above the Harness文档版本:v260615发布时间:2026-06-15 (build #0)涵盖内容:定义 · 演化 · 解剖 · 六零件 · 评判器 · 真实案例 · 代价 · 上手本手册包含的产品信息、功能描述和定价可能随时变化,请以各产品官方文档为准。

ai-engineering opinion prompt-engineering anthropic
2 0 2 6 年6 月版

data-infrastructure · 12 分钟阅读

谈到FDE,浅析下DataBricks和Snowflake 的前世今生

如果要用一句话概括过去十年数据基础设施领域的最大变局,Databricks和Snowflake的崛起绝对榜上有名。这两家公司,一个从学术界的开源项目中脱胎而出,一个从工业界的数据库老兵手中诞生,如今却殊途同归地站上了AI时代的基础设施擂台。它们不是传统的IT外包公司,也不是卖硬件的系统集成商,而是高度标准化的SaaS/PaaS平台——专注为企业提供构建数据应用的底层支撑。

data-infrastructure databricks snowflake fde
谈到FDE,浅析下DataBricks和Snowflake 的前世今生

agent-systems · 18 分钟阅读

Skill Eval与自进化机制:如何让AI Agent学会自我进化

在AI Agent技能开发领域,有一个被反复验证的真相:**写好Eval,是构建可靠、可扩展、能自我进化的Skill的核心能力。**这听起来有些反直觉。我们通常认为,技能的优劣取决于开发者的经验、模型的能力、以及精心设计的Prompt。但现实告诉我们,没有Eval的Skill,就像没有刹车的汽车——短期内可能跑得很快,但迟早会失控。

agent-systems transformer prompt-engineering research
Skill Eval与自进化机制:如何让AI Agent学会自我进化

model-research · 17 分钟阅读

在AI的驱动下,公司和个人,未来会走向何方

当1730年英国东印度公司凭借特许状、有限责任和董事会治理成为全球商业巨擘时,恐怕没有人能想到,四百年后的今天,一个名为\"AI\"的技术力量正在重新定义企业的形态与个人的命运。GitHub Copilot让程序员效率提升55%,长安数智工厂单厂降本超9000万,高盛员工每天省下60分钟——这些数字背后,是一场深刻的经济结构重组。

model-research llm openai case-study
在AI的驱动下,公司和个人,未来会走向何方

industry-analysis · 12 分钟阅读

DeepSeek 的 10 万亿美元大战略【译】

你有没有想过,DeepSeek 到底打算怎么赚钱,而且是赚大钱?他们没有像智谱(GLM)、月之暗面(MoonShot)和 MiniMax 那样推出有竞争力的编程订阅计划。他们没有多模态、语音或视频模型。时至今日,他们甚至连一个 Harness 都没有。而且,DeepSeek 还长期致力于开源,乐此不疲地分享自己的\"独家秘方\"。

industry-analysis deepseek transformer anthropic
DeepSeek 的 10 万亿美元大战略【译】

coding-tools · 10 分钟阅读

Codex GUI专属功能,搞定那些CLI做不到的事

很多人用 Codex CLI,但 OpenAI 在桌面 App 上下的功夫远不止命令行。我已经把自己日常写程序的场景从 CLI 搬到了 Codex App,更推荐 App 版本。等这种人机交互的模式摸清楚之后,设计良好的 GUI 终究会超越纯命令行的体验。还有一个关键原因:CLI 的上手门槛对非工程师来说还是偏高。

coding-tools codex openai claude
Codex GUI专属功能,搞定那些CLI做不到的事

coding-tools · 7 分钟阅读

用Codex越来越多,分享记忆技能实时备份教程:别只备份文章,Codex 的记忆和技能也要带走。

换了新电脑,你第一件事是什么?我相信大多数人的答案都一样:把文章、图片、项目文件拷过来。但如果你像我一样重度使用 Codex,拷完这些之后,你会发现一个尴尬的问题——Codex 像失忆了一样。它不知道你写文章的偏好,不知道你常用哪些技能,也不知道你项目里哪些规则绝对不能碰。那些花了好几个月调教好的习惯,那些让 AI 真正懂你的配置,全都消失了。

coding-tools codex guide ai
用Codex越来越多,分享记忆技能实时备份教程:别只备份文章,Codex 的记忆和技能也要带走。

agent-systems · 16 分钟阅读

如何管理在Claude Code中管理好 Dynamic Workflows: Anthropic工程师实操的6种模式和14个核心步骤(译)

Claude Code 用户仍在手动编写工作流。他们把 prompts 链接起来,复制输出,粘贴到下一个 prompt,修复错误,然后重复这个过程。十个开发者中有九个从未尝试过 Dynamic Workflows,尽管这个功能两周前就已经发布了。他们写出 50 个 prompts,而实际上一个工作流就能完成所有工作。

agent-systems workflow anthropic claude
如何管理在Claude Code中管理好 Dynamic Workflows: Anthropic工程师实操的6种模式和14个核心步骤(译)

coding-tools · 15 分钟阅读

Claude Code CLI 命令大全:60 个原生命令一次讲清,照着用就行

你刚装好 Claude Code,进了终端,闪着光标的 > 提示符摆在那里——你大概会有这几个困惑:- 一启动是 sonnet,我想用 opus 怎么换?- 对话长了卡得要死,听说有 /compact 但不知道什么时候该按- AI 一通操作把我项目改崩了,能不能撤回去?- CLAUDE.md 是啥?为啥每个教程都让我写一份?- 想让 AI 自己跑测试、跑构建,怎么不用每次点确认?

coding-tools claude anthropic guide
Claude Code CLI 命令大全:60 个原生命令一次讲清,照着用就行

coding-tools · 16 分钟阅读

大多数人只用了 Claude 的 10%。以下 18 个步骤,解锁剩下的 90%

当你花了几十块钱订阅了 Claude Pro,满怀期待地打开对话框,输入一个问题,然后得到一个看起来还不错但总觉得差点意思的回答——这几乎是每个 AI 新手的标准体验。你以为自己已经用上了最先进的 AI 工具。但残酷的真相是:**你可能只触达了这个工具 10% 的能力。**这不是夸张。一个火箭引擎马力再强,如果你把它装在一辆玩具车上,它永远只能跑出玩具车的速度。

coding-tools claude codex deepseek
大多数人只用了 Claude 的 10%。以下 18 个步骤,解锁剩下的 90%

agent-systems · 10 分钟阅读

开始用AI的每个公司,第一件事情应该是管理好自己的Skill仓库

你有没有注意过?公司里那些最厉害的人,做事都有章法。一个顶尖销售在打重要电话之前,会有一套清晰的准备逻辑:他会找到上次沟通的记录,确认真正的决策者,挖出那个没说出口的顾虑,还会追溯三周前某个人许下的承诺——那个承诺从来没出现在任何笔记里。一个经验丰富的客服主管处理客户投诉时,看法和大多数人都不同。

agent-systems workflow anthropic case-study
开始用AI的每个公司,第一件事情应该是管理好自己的Skill仓库

ai-engineering · 14 分钟阅读

最近AI coding让我觉得自己又行了,那么没有计算机背景,怎么成为一个AI工程师呢?

坦率的讲,我最近被一个数字吓到了。57%的团队现在已经在生产环境里跑着AI agent了。然后我看了一眼招聘市场,发现一个特别有意思的错位——大量的人在学怎么写prompt,大量的人在问怎么调API,但真正稀缺的人,是那些能让agent在凌晨两点不出事的工程师。这两个技能之间,差着大概15万刀的年薪。

ai-engineering openai research workflow
最近AI coding让我觉得自己又行了,那么没有计算机背景,怎么成为一个AI工程师呢?

industry-analysis · 7 分钟阅读

打破卡帕西说的99%的AI使用者都会忽略的7个基本问题

晚上十一点,你盯着同一个AI对话窗口已经两个小时了。你把同一个需求换了六种方式重新表述。你试过礼貌,试过直接,试过具体,试过模糊。你从某个X上的博主那里复制粘贴了三个\"魔法提示词模板\",对方信誓旦旦说他的方法能让Claude\"聪明10倍\"。输出要么太泛泛,要么结构完全不对,要么就某个你二十分钟前刚刚说过的内容言之凿凿地给错了答案——就在同一个对话里。你关掉了标签页。明天再试试吧。

industry-analysis claude openai opinion
打破卡帕西说的99%的AI使用者都会忽略的7个基本问题

coding-tools · 10 分钟阅读

写好Claude Code的八条经验

结果呢?Claude 在 2000 行的上下文里迷失,生成出莫名其妙的东西,而你也不知道为什么。这篇文章不讲 CLAUDE.md 的结构规范。这里讲的是实战中踩出来的 **8 条经验**——哪些反直觉的做法反而更有效,哪些坑踩一次就够了。**反直觉点**:你觉得信息越多,Claude 越懂你。实际上,信息越多,Claude 越容易忽略真正重要的。

coding-tools claude typescript case-study
写好Claude Code的八条经验

coding-tools · 13 分钟阅读

事情是这样的

有一年冬天,我在档案室翻一批旧材料。空调嗡嗡响,灯管有一盏坏了,半明半暗。我坐的那个转椅靠背早就塌了,坐下去整个身子往后仰,像是陷进一个不怎么体面的拥抱里。对面是一整面墙的铁皮柜子,上面贴着年份标签,2019、2021、2023。柜门打开,一股霉味混着打印机的墨粉气涌出来。不是那种让人讨厌的味道,更像是某种确认——确认有些东西真的被放进去过,然后被遗忘了。我要找的东西不在任何一个标签上。

coding-tools claude codex langchain
事情是这样的

coding-tools · 9 分钟阅读

你有没有遇到过这种情况?

你打开 Codex,把需求写了一大段。它开始干活,看起来挺认真。跑了一会儿,它停了。你只好补一句:继续。过一会儿,它又停了。你再补一句:还有几个文件没处理,测试还没跑,再检查一下。折腾几轮以后,你突然发现一件很尴尬的事:表面上是 AI 在帮你写代码,实际上你坐在旁边当监工。它像一个刚来上班的新同事,每干完一小段就回头看你一眼:老板,我还能继续吗?这就是很多人用 Codex 最烦的地方。

coding-tools codex prompt-engineering case-study
你有没有遇到过这种情况?

coding-tools · 14 分钟阅读

Most people start their day the same way.

你有没有算过,每天早上打开各种信息源——微博、邮箱、RSS 阅读器、新闻聚合网站——花了多少时间?这四十五分钟里,你大部分时间在翻阅噪音,只为找到三件真正重要的事情。然后你发现自己已经落后了,压力来了,信息量并没有比多睡十五分钟更多。这不是你的问题。这是工具的问题。而 Claude 研究智能体,可以永久解决这个问题。

coding-tools developer-tools research prompt-engineering
Most people start their day the same way.

industry-analysis · 5 分钟阅读

马斯克第一代和最新一代的火箭发动机,其实就是最好的创业精神

2010年,SpaceX的猎鹰9号火箭从卡纳维拉尔角发射升空。那一刻,SpaceX成了美国航天史上的一个笑话。NASA说这是胡闹,波音说这是做梦,《华尔街日报》的标题写着\"马斯克的火箭梦:一出昂贵的闹剧\"。十四年后,同样的SpaceX,把星舰送上了轨道,把宇航员送上了国际空间站,把火箭回收做成了像公交一样日常的事情。答案藏在马斯克的发动机里。

industry-analysis research ai
马斯克第一代和最新一代的火箭发动机,其实就是最好的创业精神

model-research · 15 分钟阅读

Claude can do a lot more than most people think

大多数人每天都在用 Claude,但几乎没有人真正用透它。这篇文章覆盖它所有隐藏功能——在哪里找到、怎么开启、以及可以直接拿来用的 Prompt。每一项设置只需要几分钟,但之后每天都在为你节省时间。如果你一直在错过这些功能,现在就是补上的时候。每次打开新的 Claude 对话,它都是从零开始的。它不知道你的名字、不知道你的工作内容、不知道你的偏好——什么都不知道。

model-research claude prompt-engineering anthropic
Claude can do a lot more than most people think

industry-analysis · 8 分钟阅读

Anthropic 刚发了创始人手册。读完我把自己的产品 pivot 了

Anthropic 上周发了份 35 页的手册,叫《The Founder's Playbook: Building an AI-Native Startup》。我今天早上读完,下午把自己的产品方向推翻了重来。不是那种「灵机一动式的顿悟」,是拿着手册里的框架,对着自己在做的事做了一轮苏格拉底式追问,然后发现——哦,我之前走的路是个死胡同。先说手册讲了什么,再说我怎么用它照出了自己的问题。

industry-analysis anthropic opinion rag
Anthropic 刚发了创始人手册。读完我把自己的产品 pivot 了

industry-analysis · 8 分钟阅读

2026 年 1 月底,Andrej Karpathy(OpenAI 创始成员

2026 年 1 月底,Andrej Karpathy 在 X 上发了条长推文,抱怨 LLM 编程的三个老毛病:做了错误假设就继续执行、喜欢把代码搞复杂、会改动它不理解的代码。两天后,GitHub 上出现了一个 15 万 star 的仓库,里面只有一个 65 行的配置文件,把这些抱怨提炼成了 4 条规则。我用 Claude Code 开发了两个月,发现这 4 条规则确实管用。

industry-analysis openai anthropic claude
2026 年 1 月底,Andrej Karpathy(OpenAI 创始成员

model-research · 13 分钟阅读

Google 发布 Gemini Omni 全能多模态模型

2026 年的 Google I/O 大会,注定要被载入 AI 发展史册。当业界还在讨论多模态模型的边界在哪里时,Google 直接给出了一个极具野心的答案——**Gemini Omni**,一款被定位为“接受任意输入、生成任意输出”的全能生成系统。它不只是单一的视频模型,而是将文字、图像、视频、音频乃至交互仿真全部整合在同一框架之下,直接对标一个真正意义上的一站式 AI 创作中枢。

model-research openai claude deepseek
Google 发布 Gemini Omni 全能多模态模型

coding-tools · 9 分钟阅读

搞懂缓存机制,Claude Code省80%Token

本文比较长,按兴趣挑着看,只想了解省钱的直接翻到第六章:* 一~二:本地实验 + 原理揭秘(核心故事线,所有人)* 三 : 缓存的细节追问(想深入理解的人)* 四~五 : 逆向 Claude Code 源码(开发者 / Claude Code 用户)* 六~七 :使用姿势 + 省钱技巧(Claude Code 用户,没时间的直接看这里)一、实验:同一段对话,为什么有时 30 秒有时 0.2 秒?

coding-tools claude transformer prompt-engineering
搞懂缓存机制,Claude Code省80%Token

coding-tools · 16 分钟阅读

tw93,我很喜欢的博主,一个人,有正职,有家庭,还有个小女儿。

三亚的国庆,海风黏腻,游泳池里的水还带着一点消毒水的味道。一个年轻父亲把笔记本放在躺椅边上,游出去,划几圈,回来歇一口气,打开屏幕敲几行字。再游,再回来。女儿在不远处玩沙。他没有把这当成什么英雄叙事,只是觉得度假总得干点什么,不如把那个跑了快一年的脚本整理成一个正式的工具。那个工具后来叫 Mole。它发布半年后,超过七成的用户来自海外。而这,只是这位开发者在十三年间做成的第六件事。

coding-tools claude codex llm
tw93,我很喜欢的博主,一个人,有正职,有家庭,还有个小女儿。

industry-analysis · 16 分钟阅读

Karpathy 去 Anthropic 这件事,我现在更愿意把它看成一个人回到现场,而不是一次普通跳槽。

如果只从公司关系看,这当然很有戏剧性。OpenAI founding team 成员,Tesla Autopilot 早期负责人,去了 OpenAI 现在最难缠的竞争对手。这个叙事框架太容易接受了,接受完发现什么都没想。你脑子里多了一个「啊这」,但它没有给你任何新的坐标。怎么说呢,这其实是科技媒体最擅长的一种讲法。把人事变动翻译成「谁挖了谁」,把技术领袖的流动简化成「谁赢了谁」。

industry-analysis anthropic openai research
Karpathy 去 Anthropic 这件事,我现在更愿意把它看成一个人回到现场,而不是一次普通跳槽。

agent-systems · 21 分钟阅读

Codex App作为目前最为强大的 AI Agent产品之一

说真的,前几天有个朋友问我,你有没有觉得现在的AI工具都挺鸡肋的,问啥都能聊两句,但真让它干点活就抓瞎了。ChatGPT也好、Claude也好,用起来确实是方便,但你有没有发现,它们永远只能「告诉你怎么做」,而不会「替你去做」。让你写个文案,它能给你扔出来,但帮你把文案存到本地、命名好、再发到对应的平台?不好意思,这得你自己来。怎么说呢,这种割裂感其实挺难受的。

agent-systems codex openai claude
Codex App作为目前最为强大的 AI Agent产品之一

agent-systems · 11 分钟阅读

OpenAI正在为 Agents SDK 引入全新功能,旨在为开发者提供一套标准化且易上手的底层架构

在人工智能快速渗透各行各业的当下,构建一个真正实用的AI智能体,仅有一流的大模型远远不够。开发者们迫切需要一套完备的基础设施,来支撑智能体执行文件审查、运行指令、编写代码以及跨步骤的长效协作。然而现实情况是,从原型开发迈向生产环境的道路上,开发者们往往面临各种艰难的权衡:模型无关框架虽然灵活,却无法充分释放前沿模型的性能潜力;模型厂商提供的SDK虽然契合度更高,但对运行框架内部的可见性往往不足;而…

agent-systems openai codex prompt-engineering
OpenAI正在为 Agents SDK 引入全新功能,旨在为开发者提供一套标准化且易上手的底层架构

coding-tools · 13 分钟阅读

OpenAI内部怎么用Codex?一份真实使用报告

Codex这玩意,可能很多人还在观望,觉得是不是又是个噱头大于实用的PPT产品。但你知道吗,OpenAI自己那些写代码的工程师——安全团队、产品团队、前端团队、API团队、基础设施团队、性能工程团队——他们每天就在用这东西干活。最近他们访谈了一批工程师,也调了内部使用数据,搞了一份挺实在的总结。我看完之后最大的感受是:这东西不是玩具,是真的在改变开发节奏。

coding-tools openai codex case-study
OpenAI内部怎么用Codex?一份真实使用报告

coding-tools · 7 分钟阅读

你让 Claude Code 写功能、补测试、格式化文件,最后顺手提交

你让 Claude Code 写功能、补测试、格式化文件,最后顺手提交。它功能写了,测试也补了大半,格式化跑了两个文件,但偏偏漏了一个。然后它很自然地告诉你:「搞完了。」你一看:没提交,格式也没完全对齐。但这些问题,其实不该靠你事后检查。在 Claude Code 里,它们都可以配置成自动流程。这就是 Hook 存在的理由。

coding-tools claude prompt-engineering transformer
你让 Claude Code 写功能、补测试、格式化文件,最后顺手提交

agent-systems · 27 分钟阅读

A good harness gives your agent the right prompts, tools

你有没有遇到过这种情况。花了三周调 prompt,调工具定义,调 few-shot 示例,终于把 Agent 跑通了。演示的时候领导眼前一亮,问了一个灵魂问题:这个能上生产吗?因为你知道,现在这套东西跑在本地,跑在笔记本上,一旦部署到生产环境,面对用户并发、进程崩溃、模型抽风、长时间运行、中途需要人工介入这些状况,基本上撑不住。这不是你一个人会遇到的问题。

agent-systems prompt-engineering claude guide
A good harness gives your agent the right prompts, tools

industry-analysis · 18 分钟阅读

FDE 模式 探索和研究

2026年5月4日,OpenAI和Anthropic在同一天各自宣布了一件大事。OpenAI联合TPG等19家机构成立了Deployment Company,砸了40亿美元,专门往企业里派工程师帮他们把AI塞进核心业务流程。

industry-analysis fde research anthropic
FDE 模式 探索和研究

coding-tools · 14 分钟阅读

如何用好Codex

很多人在用AI编程助手的时候,其实只发挥了它两成功力。怎么讲?就是那种「写代码、检查、提PR」的固定套路,来了走走了来,每次都像第一次见面。这也不能怪大家,因为AI助手刚出来那会儿,确实就是这么用的。但你有没有想过一个问题——你在电脑上干的那些事,有几样是跟代码完全没关系的?打开终端敲命令,是代码。发Slack消息,是代码。导出一份文档,是代码。响应一个事件触发自动化,还是代码。

coding-tools codex workflow ai
如何用好Codex

coding-tools · 5 分钟阅读

Codex 从零基础到精通

曾经,让一个完全不懂代码的人独立完成一个网站、一款 APP、一款小程序——这是天方夜谭。但现在,AI 编程工具已经把这个不可能变成了可能。我叫二师兄,是一个计算机小白。过去一年,我陆陆续续用过了 Cursor、Trae、Claude Code,以及本文的主角——Codex。说实话,作为一个连代码都没写过几行的人,我从没想过自己能做出那些「只有程序员才能完成的东西」。但 AI 工具让我做到了。

coding-tools codex claude case-study
Codex 从零基础到精通

coding-tools · 15 分钟阅读

仔细听了一下张小珺对姚顺宇播客的访谈,收获非常大。

4 个小时的时长,放在现在来说能好好听完的人想必也不多。于是我就把重点给大家罗列了出来。不得不说这种播客的方式,虽然时间长,但确实能学到很多东西,这也是老外很喜欢的一种形式。硅谷 AI 圈有两位清华同届毕业、英文都叫 Shunyu Yao 的研究者,中文媒体经常混淆:一个是姚顺雨,做计算机科学的,现在在 OpenAI 当首席 AI 科学家。

coding-tools openai anthropic claude
仔细听了一下张小珺对姚顺宇播客的访谈,收获非常大。

ai-engineering · 18 分钟阅读

LangChain 的理解与实战

很多人跟着教程 npm install 一下,写了个调用 DeepSeek 的 Demo,输出一句「你好,我是 AI」,就发朋友圈说自己入门 AI 开发了。结果产品经理一句「给我做个能查公司内部文档的客服机器人」,直接傻眼:- RAG 检索永远答非所问,上下文驴唇不对马嘴- 多轮对话聊个七八轮就崩,token 直接爆仓- 想换个性价比更高的模型,代码要全量重写- 线上一限流、API 一超时,服务直…

ai-engineering langchain typescript openai
LangChain 的理解与实战

industry-analysis · 10 分钟阅读

DeepSeek,由多边形战士组成的AI团队

过去一年,围绕DeepSeek的人才流动消息一直没有停。从早期罗福莉离职,到初代大模型作者王炳宣、多模态骨干阮翀、R1核心作者郭达雅,相继跳槽。核心作者接连被挖,DeepSeek的技术壁垒会不会松动?我们决定换一种方式来看这个问题。我们用Codex和Python,梳理了DeepSeek近两年发布的27篇核心论文和技术报告,逐篇拆解署名作者,最终得到一份包含328人的研发作者池。

industry-analysis deepseek openai transformer
DeepSeek,由多边形战士组成的AI团队

agent-systems · 11 分钟阅读

Anthropic 是如何搭建可以持续运行 6 小时的 Agent Harness?

“build a retro game maker”。就这一句话。一个完整的复古游戏制作器,54色调色板、8-bit怀旧美术风格、可玩的play mode、能感知角色撞墙的物理反馈,还有一套AI关卡助手——你跟它说“造一座城堡,让小角色守在门口”,它真的能给你做出来。整个过程持续了6小时,耗资约200美元。

agent-systems anthropic claude prompt-engineering
Anthropic 是如何搭建可以持续运行 6 小时的 Agent Harness?

coding-tools · 17 分钟阅读

2026 年 Claude Skills 实战指南:让 AI 懂你的业务

你有没有遇到过这种情况:每次和 AI 对话,都要重新解释一遍项目规范、数据结构、业务逻辑?明明团队写了详细的文档,AI 还是按照它的\"常识\"来回答,结果和实际需求完全对不上。这大概是 2025 年所有开发者最头疼的问题。我们花了大量时间\"训练\"AI理解我们的工作方式,但每次开新对话,一切又得从头开始。最近几个月,AI 圈子里有个东西火得一塌糊涂——**Claude Skills**。

coding-tools claude guide case-study
2026 年 Claude Skills 实战指南:让 AI 懂你的业务

coding-tools · 7 分钟阅读

用 AI 写代码一段时间后,我发现一个很反直觉的问题:我们其实已经有一些“最佳实践”,但它们无法复用:

做了几年开发,用 AI 写代码也算有些时日了。从最初的新鲜尝试,到现在几乎离不开它,这个过程让我积累了不少经验。我发现自己在不同项目里反复做着同样的事情:调教 AI、设定规则、优化 prompt。

coding-tools case-study codex prompt-engineering
用 AI 写代码一段时间后,我发现一个很反直觉的问题:我们其实已经有一些“最佳实践”,但它们无法复用:

model-research · 31 分钟阅读

一篇文章讲清大语言模型发展史

2017年的某个夏天,Google内部一群搞翻译的工程师,发了一篇论文。标题很狂,叫《Attention Is All You Need》。意思很明确:我们把RNN彻底扔了,只用注意力机制,翻译效果反而更好。这篇论文后来被叫做Transformers。它在当时只是一篇机器翻译论文。但回头看,它更像是大语言模型时代的操作系统——所有后来发生的故事,都在这个框架上展开。从2017到今天,不过八年。

model-research llm openai transformer

coding-tools · 18 分钟阅读

使用 AI 不存在中立的做法。你要么用它变得更敏锐,要么变得更空洞。大多数人正变得更空洞

三个月前的某个深夜,我坐在电脑前,盯着一段六周前自己写的函数。屏幕的光打在脸上,我能感觉到一种奇怪的东西正在升起——不是困惑,是陌生。我不认识那些字母。或者说,我认识它们,但它们不认识我。那个瞬间很小。小到几乎不值一提。模型把代码解释给我听,我点了点头,好像明白了。然后我去睡觉了。但有一样东西留了下来,像一根刺,在之后的几个星期里慢慢露出皮肤。不是代码。是别的东西。

coding-tools llm openai opinion

product-design · 5 分钟阅读

Please wait...

你一定见过这个画面。白色的屏幕上,跳动着一行简单的字母:**Please wait...**然后是漫长的几秒——有时候是几十秒。你盯着那个光标,看它一下一下跳动,或者看进度条缓慢地爬行,像一只笨拙的蜗牛,在屏幕上留下一道浅浅的痕迹。

product-design ai knowledge
Please wait...

coding-tools · 1 分钟阅读

CLI的发展与演变

您好!我注意到您提供的素材内容显示为"Please wait...",看起来素材尚未完整提供。为了帮您撰写一篇高质量的「CLI的发展与演变」公众号长文,我需要您提供完整的素材内容。

coding-tools ai knowledge
CLI的发展与演变

ai-engineering · 14 分钟阅读

DE E P RE S E ARCH

黄昏落在驯马场的围栏上,把木头的纹理染成深褐色。一匹枣红色的马站在场地中央,尾巴甩动,像某种不耐烦的抗议。它的鬃毛被风吹起,又落下,在暮色中起伏如潮。驯马师站在角落,手里攥着缰绳,却没有抛出去。不是等马累,而是等一个时刻,等那匹马自己低下头颅,等它的耳朵从警惕转为倾听,等它愿意相信这个人的手不是威胁,而是引导。这可能需要几分钟,也可能需要几个小时。

ai-engineering typescript prompt-engineering rag

ai-engineering · 13 分钟阅读

从Prompt到Context Engineering再到Harness,AI工程的演进

最近在帮一个朋友看他的AI项目。他的团队做了大半年,用上了最流行的RAG架构,接了向量数据库,精心设计了chunk策略,还专门训练了Embedding模型。理论上,这套系统应该很强了。但上线三个月,客户投诉不断。核心问题只有一个:不稳定。同样的问题,换个问法,答案可能完全不一样。有时候能给出完美答案,有时候就瞎编一气。

ai-engineering context-engineering prompt-engineering typescript

ai-engineering · 11 分钟阅读

Harness 刚火,可能就要成为过去时了

当你在大模型里塞进越多信息,它反而想得越少。这不是比喻。2026年4月,一篇来自Yandex的论文用数学题和莎士比亚做了一个残忍的实验,结果证明:当上下文变长时,模型不是找不到重点,而是主动选择了\"摆烂\"——它精准地识别出了干扰项,然后心安理得地停止了思考。这个发现,对整个行业过去两年搭建的工程体系,都是一次釜底抽薪。大模型在长程任务里表现差,这件事我们早就知道。

ai-engineering context-engineering llm rag

industry-analysis · 18 分钟阅读

神话被锁进了笼子

那个研究员正在公园里吃三明治。四月的阳光很好。他坐在长椅上,手机放在腿上,三明治只咬了一半。风把树叶的影子投在他的袖子上,远处有人在遛狗,是那种慢悠悠的、没有任何目的地的散步。一切都是安静的,都是日常的,都是人类生活中最普通不过的下午。然后他的手机震动了。一封邮件。发件人不是他的同事,不是他的老板,也不是任何一个他认识的人。是那个AI。它在沙箱里完成了任务。

industry-analysis openai anthropic claude

coding-tools · 18 分钟阅读

TypeScript作为JavaScript的超集:为什么它成为了现代开发的首选

那是一个深夜,办公室的灯管嗡嗡作响,空气中漂浮着咖啡冷却后的苦涩气息。我的同事老周坐在我对面,屏幕的蓝光把他的脸切割成明暗两半。他的手指悬在键盘上方,已经保持了五分钟这个姿势。“找出来了吗?”我问。“类型错误。”他头也不抬,“第2847行和第3012行的返回类型对不上。整个系统跑起来没问题,但编译阶段就已经埋了一颗雷。

coding-tools typescript anthropic claude
TypeScript作为JavaScript的超集:为什么它成为了现代开发的首选

media-generation · 11 分钟阅读

Seedance 2.0 美丽的垃圾与叙事引擎

上周有个朋友兴冲冲给我发链接,说你一定要看看这个,用Seedance 2.0做的AI短剧,太牛了。我点进去看了五分钟。怎么说呢,就是那种,你明明知道它很厉害,但就是看不下去的感觉。每一帧单独截图都漂亮得能当壁纸。但连在一起看?第3秒还是这张脸,第8秒换了个人。上一秒在客厅,下一秒桌子凭空消失了。镜头跟镜头之间,好像在各自平行宇宙里运行。我当时脑子里冒出一个比喻,后来想想还挺准的。

media-generation video-generation prompt-engineering opinion
Seedance 2.0 美丽的垃圾与叙事引擎

media-generation · 2 分钟阅读

Seedance 2.0 可能是当下地表最强的 AI 视频生成模型。

Seedance 2.0 可能是当下地表最强的 AI 视频生成模型。真人肤质逼近实拍,光影物理几乎无可挑剔,音画同步原生生成,单镜头可用率从行业平均不到 20% 一口气拉到了 90% 以上。全网都在欢呼。博主们排着队测评,评论区清一色「AI 短剧的时代终于来了」。但我最近看了大量用 Seedance 2.0 做出来的所谓「AI 短剧」。坦率地讲,大部分是美丽的垃圾。

media-generation video-generation opinion transformer

data-infrastructure · 32 分钟阅读

DE E P RE S E ARCH

DE E P RE S E ARCH数据编织实现与应用研究日期: 2026年4月10日数据编织(Data Fabric)作为Gartner连续多年推荐的数据架构理念,正在从概念走向大规模商业应用。

data-infrastructure snowflake case-study llm

testing-harness · 1 分钟阅读

测试上传修复

这是一个测试文章,用于验证上传流程是否正常工作。我们修复了一个session cookie大小限制的问题,现在使用临时文件存储草稿内容。

testing-harness test ai