深度文章

Claude Code 提示词指南(2026)

Claude Code 提示词指南(2026)

如何为 Anthropic 原生终端编程智能体 Claude Code 编写提示词,涵盖 CLAUDE.md 文件、斜杠命令、Hooks、MCP 服务器,以及范围明确的工作单式提示词。

深度 Claude Code Imtiaz Rayhan 阅读 1426 2026-04-20
阿里 Qwen3.6-35B-A3B 实测

阿里 Qwen3.6-35B-A3B 实测

Qwen3.6-35B-A3B的实测数据显示了多项性能指标的显著变化。在约1.5万题的中文场景测试中,新版本总准确率为68.1%,响应时间大幅优化至81秒,但单次调用成本增至40.5元。具体维度上,医疗法律类任务准确率上升超过2个百分点,而金融与数学推理任务则下降约4至5个百分点。首次评测的编码能力得分为56.6%,低于前代模型。

深度 大模型评测及优化NoneLinear 阅读 1759 2026-04-19
大模型表格识别能力实测:新一代不一定更强!Qwen3.6与GLM-5V-Turbo双测

大模型表格识别能力实测:新一代不一定更强!Qwen3.6与GLM-5V-Turbo双测

大模型表格识别能力实测显示,新一代模型如Qwen3.6-Plus和GLM-5V-Turbo在表格识别上不一定比前代更强。Qwen3.6-Plus虽编程能力突出,但表格识别准确率从66%降至60%,主要短板包括内容识别错误和结构错乱;GLM-5V-Turbo视觉编程领先,但表格识别仅53%,水印处理和表头还原问题明显。两者表现反映模型迭代中能力发展不均衡,编程优化可能挤占其他训练资源。

深度 大模型评测及优化NoneLinear 阅读 1597 2026-04-10
智谱GLM-5.1实测

智谱GLM-5.1实测

智谱GLM-5.1实测显示其在代码工程和长程Agent任务方面有显著能力提升,该模型在SWE-Bench Pro等基准上取得开源模型第一的成绩,能独立工作超过8小时。评测表明,其推理与数学计算能力提升9.2%,Agent与工具调用能力增强7.5%,突出了深度推理和任务执行的优势。然而,语言指令遵从略有下降,响应时间增加41%,但整体性能进入榜单头部。

深度 大模型评测及优化NoneLinear 阅读 1734 2026-04-09
谷歌Gemma 4 MoE实测

谷歌Gemma 4 MoE实测

基于ReLE基准1.5万道中文测试,Gemma 4 26B MoE展现出极强的低延迟优势,响应较31B版快43%,Agent工具调用能力近乎翻倍。但短板是其中文复杂指令遵从提升微弱,50.3%的准确率远落后于头部开源竞品。业务选型建议:该模型高度契合算力受限、对延迟极敏感的边缘端在线交互场景,不适用于追求极限精准度的核心高阶任务。

深度 大模型评测及优化NoneLinear 阅读 646 2026-04-08
扩展 Managed Agents:将大脑与双手解耦

扩展 Managed Agents:将大脑与双手解耦

Harness 会编码一些假设,而随着模型改进,这些假设会过时。Managed Agents 是我们面向长周期智能体工作的托管服务,它围绕一组接口构建,即使 harness 变化,这些接口也能保持稳定。

深度 Claude Code 非线智能 阅读 3296 2026-04-08
Claude Code 斜杠命令完整清单(2026 版)

Claude Code 斜杠命令完整清单(2026 版)

在一处汇总所有 Claude Code 斜杠命令,包括内置命令、隐藏命令,以及行为类似命令的所谓秘密提示词代码。2026 年更新,并为每项提供示例。

深度 Claude Code Claude Skills Hub 阅读 729 2026-04-08
阿里Qwen3.6-Plus实测

阿里Qwen3.6-Plus实测

Qwen3.6-Plus作为阿里最新推出的旗舰API模型,在本次针对中文场景的综合能力评测中呈现出能力结构的显著变化。其整体准确率从前代的74.6%回调至71.6%,但在语言与指令遵从维度上获得了明显提升,表明模型对复杂中文指令的理解与执行能力增强。然而,这一提升并未抵消其在金融、推理数学及Agent工具调用等多个垂直领域的准确率下降。评测同时关注其性能表现,包括响应时间与成本结构的变动。

深度 大模型评测及优化NoneLinear 阅读 1588 2026-04-03
Claude Code 中的 Skills 与 Custom Commands:何时该用哪一个

Claude Code 中的 Skills 与 Custom Commands:何时该用哪一个

如果你一直在 Claude Code 中构建工作流,可能已经注意到创建斜杠命令有两种方式:Skills(.claude/skills/<name>/SKILL.md)和 Custom Commands(.claude/commands/<name>.md)。两者都会在斜杠菜单中创建 /name,也都接受 $ARGUMENTS。那么它们有何区别,又该在什么时候使用?

深度 Claude Code Quan Dang 阅读 1311 2026-04-03
Claude Code 上下文工程:如何显著提升输出质量

Claude Code 上下文工程:如何显著提升输出质量

上下文工程是使用 AI 编程智能体时最重要的能力。本指南介绍如何组织项目上下文、CLAUDE.md 文件和任务描述,让 Claude Code 尽可能一次就写出高质量代码。

深度 Claude Code Claude Directory 阅读 2166 2026-04-02
面向前端工作流的 Claude Code Skills

面向前端工作流的 Claude Code Skills

构建 Claude Code Skills,通过斜杠命令和结构化指令自动处理前端工作流、落实设计系统规则并搭建组件。

深度 Claude Code OpenReplay Team 阅读 2168 2026-04-01
大模型表格识别能力实测:GPT-5.4小模型与小米MiMo正面交锋,表格识别谁翻车了?

大模型表格识别能力实测:GPT-5.4小模型与小米MiMo正面交锋,表格识别谁翻车了?

本文实测了小米MiMo-V2-Omni与OpenAI的gpt-5.4-mini及nano模型在表格识别任务中的表现。评测显示,MiMo-V2-Omni以58%的准确率位列中游,其短板主要在处理复杂表头和抗水印干扰上。gpt-5.4-mini表现次之,准确率为53%,在水印和表头边界识别上同样存在薄弱环节。而gpt-5.4-nano准确率仅11%,在各项错误类型上均全面崩溃。

深度 大模型评测及优化NoneLinear 阅读 2604 2026-03-26
长时间运行应用开发的运行框架设计

长时间运行应用开发的运行框架设计

在智能体式编码前沿,运行框架设计是影响表现的关键。下面介绍我们如何在前端设计和长时间运行的自主软件工程中进一步推动 Claude。

深度 Claude Code 非线智能 阅读 1725 2026-03-24
第 7 / 14 页 · 共 266 篇