最新文章
Opus 5.5 在自主长任务、主动汇报和前置思考上带来了显著变化。本文整理自 Anthropic 官方指南,系统拆解如何在 Claude 应用与 Claude Code 中写好提示词、把控数小时级别的长链路任务、高效验收结果、应对安全防护拦截以及开启 Fast 极速模式,文末附带完整的行动检查清单与原文链接。
“某模型全球第一”的说法越来越常见,但换一个排行榜,名次常常完全不同。这篇文章梳理了 Benchmark 失真的三个常见原因——测试集污染、benchmaxxing、厂商选择性公布成绩,以及 Arena 类平台、综合指数各自的局限,最后给出一份普通人也能直接用的判断清单。
视频是怎么变成 AI 能处理的 Token 的?这篇文章核实了 DeepSeek、Claude、OpenAI、Gemini 对视频输入的真实支持情况——目前只有 Google 把直接输入视频做成了公开 API 能力,2026 年 9 月还上线了能主动导航视频、最高省下 88% Token 的新模式,其余三家不同程度上仍在靠人工抽帧当图片处理。
一张图片是怎么变成 AI 能处理的 Token 的?这篇文章核实了 DeepSeek、Claude、OpenAI(GPT-5.6)、Gemini 各自的图片 Token 化公式——算法路线完全不同,但落到实际 Token 开销上,四家其实都在同一个量级。
AI Engineering 不只是实现产品,更意味着主动塑造构建过程:推动开发循环、做出产品决策、沟通与领导,并以高主动性端到端承担责任。
从第一性原理讲清 LLM 技术栈里都被叫做「缓存」的四层机制:KV 缓存、前缀缓存、Prompt 缓存和语义缓存。它们各自存什么、如何取舍、相互作用时会发生什么,以及最影响缓存复用的五个常见问题。
本文介绍 DeepSeek Harness 的核心理念与功能,并从零完成安装配置,实践 Coding、Web Search、Vision 以及第三方模型接入。
系统梳理 2026 年 AI 模型发布中常见的测试平台与 Benchmark:LMArena、Artificial Analysis、LiveBench、SWE-bench、GPQA、HLE、AIME、MMLU、MMMU 等各自测什么、分数怎么读、又不能说明什么。
从 IPv6 反向 DNS 出发,拆解 ip6.arpa 的 nibble 命名方式、前缀与命名空间的对应关系、DNS 委派机制,以及为什么它不适合当普通网站域名。
Cloudflare 在 2026 年 8 月初用一周时间集中发布了 20 多项 Agent 相关功能,覆盖计算、存储、身份、支付和安全。这篇文章整理其中最值得关注的几个方向:Agent 专属浏览器 Kitesurf、持久记忆服务、沙箱隔离环境,以及让 Agent 能独立付款的钱包机制。