Gemini 3.5 Flash 做 Agent:又快又便宜,什么时候用它
Google 的 Gemini 3.5 Flash 用一点推理深度换来速度和成本上的大赢。快模型什么时候是 Agent 的正确选择,什么时候会悄悄坑你。
SandBase Notes
关于 AI 智能体、模型路由以及构建生产级 AI 系统的洞察。
Google 的 Gemini 3.5 Flash 用一点推理深度换来速度和成本上的大赢。快模型什么时候是 Agent 的正确选择,什么时候会悄悄坑你。
智谱的 GLM-5.1 在 2026 年拿下开源权重模型的 SWE-bench Pro 头名。这个 benchmark 到底测什么、GLM-5.1 的定位、以及怎么把它当编码 Agent 用。
Moonshot 的 Kimi K2.6 是为 Agent 而生的 1T 参数开源 MoE 模型。它真正擅长什么、万亿参数在哪有用在哪没用、以及怎么接进 Agent loop。
2026 年值得当 AI Agent 跑的开源权重 LLM 正面对决指南:Kimi K2.6、DeepSeek V4、GLM-5.1、Qwen 3.6。工具使用、上下文、编码还是成本,分别选谁。
给在生产里跑代码、调工具的 AI Agent 的真护栏:输入校验、动作白名单、沙箱、成本上限、人在回路。附可以直接上线的模式。
Qwen 3.6 是阿里的开源 LLM,体量不大却在 SWE-bench 上越级打怪。为什么对 Agent 来说,一个更小更高效的模型常常是比巨型模型更聪明的默认。
五个能让 AI Agent 既可靠又便宜的设计模式:ReAct、Plan-and-Execute、Reflection、Router、Tool-First,每个都讲清取舍。
用结构化日志、分布式链路追踪和 span 级成本追踪在生产环境调试 AI Agent。该抓什么、该忽略什么,以及那些藏住真实故障的坑。
AutoGen 与 CrewAI 多智能体框架 2026 年正面对比:架构、开发体验、成本,以及各自该在什么场景下选用。