ZeroOne AI
← 返回文章列表

M3 Max 96GB 本地部署 Qwen3.6-35B-A3B:打造 SolidWorks 智能机械设计与企业知识库 AI 工作站

👁 1

M3 Max 96GB 统一内存适合同时运行本地大模型与设计工具链。本文推荐 MoE 架构的 Qwen3.6-35B-A3B(总参数约 35B、单 Token 激活约 3B)配合 MLX 4bit 量化本地部署,打造 SolidWorks 智能机械设计与企业知识库 AI 工作站:mlx-lm 提供 OpenAI 兼容 API,OpenWebUI 做对话入口,通过 SolidWorks MCP 工具调用实现参数化建模,结合 BGE-M3 + Reranker 构建企业知识库 RAG,并规划多模型架构与“小龙虾”本地 AI Agent 平台的演进路线。

一、为什么选择 Apple M3 Max 96GB?

随着本地大模型的发展,Apple Silicon 的统一内存架构越来越适合运行中大型 AI 模型。

对于机械设计、工业自动化、MES、ERPNext、SolidWorks 二次开发等场景,本地部署 AI 有一个非常明显的优势:

设计资料、企业知识库、CAD 文件和源代码可以留在本地。

对于拥有 M3 Max 96GB 统一内存的 Mac Studio 来说,与其只把它当作普通开发电脑,不如将它打造成为一台:

本地 AI + SolidWorks + 企业知识库 + Agent 的智能设计工作站。

本文推荐的核心模型为:

Qwen3.6-35B-A3B

它采用 MoE(Mixture of Experts)架构,总参数规模约 35B,但每个 Token 实际激活的参数规模约为 3B,因此非常适合 Apple Silicon 本地推理。

目前已经存在针对 Apple Silicon 优化的 MLX 量化版本,例如 Qwen3.6-35B-A3B-OptiQ-4bit,可以直接使用 MLX 运行,无需将模型转换成 GGUF。

二、为什么不是 Qwen3-235B?

很多人看到 M3 Max 96GB,会第一时间考虑:

Qwen3-235B-A22B

但是对于实际生产使用,我反而更加推荐:

Qwen3.6-35B-A3B

原因很简单:

1. 运行压力更低

Qwen3.6-35B-A3B 是 MoE 模型。

虽然模型总参数达到 35B,但每次推理只激活其中一小部分参数。

因此:

35B 总参数
 ↓
MoE Router
 ↓
少量 Expert 被激活
 ↓
约 3B 级别激活参数

这使得它特别适合本地 Agent、代码生成和工具调用。

2. M3 Max 96GB 有充足空间

目前已经有 MLX 4bit 版本。

例如社区提供的 MLX-MXFP4 版本,模型权重约 17~20GB;另一个混合 4/8bit MLX 版本约 20GB。

因此:

M3 Max 96GB

模型
≈ 20GB

KV Cache
+
操作系统
+
SolidWorks/MCP
+
知识库
+
Embedding
+
数据库

仍然有较大的余量

这比在 96GB 机器上硬塞超大型模型更加合理。

三、推荐的模型版本

对于 M3 Max 96GB,我建议优先考虑:

Qwen3.6-35B-A3B
 +
MLX 4bit

目前可以选择:

mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit

该版本针对 Apple Silicon 的 MLX 推理进行了量化优化,并提供 mlx-lm 使用方式。

另外也存在:

Qwen3.6-35B-A3B-MXFP4

这类 MLX 原生 FP4 版本,模型权重约 17GB 左右。

四、M3 Max 96GB 推荐软件架构

整个 AI 工作站可以设计成:

┌─────────────────────────────┐
│         OpenWebUI           │
│        AI 对话入口          │
└─────────────┬───────────────┘
              │
              ↓
┌─────────────────────────────┐
│     Qwen3.6-35B-A3B        │
│           MLX              │
└─────────────┬───────────────┘
              │
┌─────────────┼───────────────┐
↓             ↓               ↓
SolidWorks    知识库          编程开发
   MCP         RAG        Python/C#/Qt
↓             ↓               ↓
SolidWorks    PDF/Word       Git/MES
自动建模      Excel/标准      ERPNext

最终目标不是简单地"聊天"。

而是:

让 AI 成为机械设计工程师的数字助手。

五、第一步:安装 MLX

Apple Silicon 最值得优先考虑的本地推理框架之一就是 MLX。

安装:

brew install uv

然后:

uv tool install mlx-lm

验证:

mlx_lm --help

六、直接运行 Qwen3.6

安装完成以后,可以直接运行:

mlx_lm.chat \
  --model mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit

第一次运行时会自动从 Hugging Face 获取模型。

也可以使用 MXFP4 版本:

mlx_lm.chat \
  --model majentik/Qwen3.6-35B-A3B-MLX-MXFP4

对于 M3 Max 96GB,我建议优先测试 4bit/混合量化版本。

七、启动 OpenAI API Server

真正做 Agent 时,不建议一直使用命令行聊天。

更好的方式是:

Qwen3.6
 ↓
MLX Server
 ↓
OpenAI Compatible API

启动:

mlx_lm.server \
  --model mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit

默认服务:

http://127.0.0.1:8000

MLX 模型卡提供了 OpenAI-compatible API 的启动方式,因此后面的 OpenWebUI、Agent、MCP 客户端都可以围绕这个接口进行集成。

八、测试 API

可以通过:

curl http://127.0.0.1:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit",
    "messages": [
      {
        "role": "user",
        "content": "设计一个用于输送带的机械张紧机构"
      }
    ]
  }'

如果能够正常返回结果:

MLX
 ↓
Qwen3.6
 ↓
OpenAI API

就部署成功了。

九、为什么这个模型特别适合 SolidWorks?

SolidWorks 自动设计真正困难的地方,并不是"画一个圆"。

而是:

需求
 ↓
机械原理分析
 ↓
结构设计
 ↓
尺寸计算
 ↓
材料选择
 ↓
标准件选择
 ↓
参数化建模
 ↓
装配
 ↓
工程图
 ↓
BOM

这其实是一个典型的 Agent 问题。

例如用户输入:

设计一个用于滴灌带生产线的导向机构,速度 350m/min,要求减少管带跑偏。

AI 可以首先分析:

生产速度
材料
张力
摩擦
导向方式
安装空间

然后形成设计方案:

方案A:滚轮导向
方案B:V型槽导向
方案C:多滚轮限位
方案D:浮动导向

接下来调用 SolidWorks MCP。

十、SolidWorks + Qwen3.6

推荐架构:

用户
 │
 ↓
Qwen3.6
 │
 ↓
Agent
 │
 ↓
SolidWorks MCP
 │
 ↓
SolidWorks API
 │
 ↓
SolidWorks

AI 不直接操作 SolidWorks。

而是通过工具调用:

create_part
create_sketch
create_extrude
create_hole
create_fillet
create_assembly
create_drawing
export_step
export_pdf

例如:

{
  "tool": "create_part",
  "parameters": {
    "name": "Guide_Roller",
    "diameter": 80,
    "length": 120,
    "material": "45#"
  }
}

Agent 负责规划。

MCP 负责执行。

SolidWorks 负责建模。

这比让大模型直接生成一大段 VBA 更可靠。

十一、企业知识库

机械设计 AI 最重要的部分其实不是模型。

而是:

企业自己的知识。

例如建立:

/KnowledgeBase
│
├── 机械设计手册
├── GB国家标准
├── ISO标准
├── 电机选型
├── 减速机选型
├── 轴承选型
├── 螺栓标准
├── 公差标准
├── 企业设计规范
├── SolidWorks API
├── 设备说明书
├── 历史项目
└── MES技术文档

然后建立 RAG。

十二、RAG 推荐架构

PDF
Word
Excel
CAD文档
技术规范
历史项目
 │
 ↓
Document Parser
 │
 ↓
Chunk
 │
 ↓
Embedding
 │
 ↓
Vector Database
 │
 ↓
Reranker
 │
 ↓
Qwen3.6

Embedding 可以使用:

BGE-M3

检索结果经过 Reranker 后,再交给 Qwen3.6。

这样 AI 就不是"凭经验回答"。

而是:

问题
 ↓
检索企业知识
 ↓
找到相关标准
 ↓
Qwen3.6分析
 ↓
生成设计方案

十三、一个非常实用的例子

以后可以直接问:

M8螺栓用于这个铝型材结构,孔径应该怎么设计?

Agent:

① 查询企业机械设计规范
② 查询GB标准
③ 查询当前结构材料
④ 查询SolidWorks模型
⑤ 判断安装方式
⑥ 给出推荐尺寸
⑦ 调用SolidWorks修改模型

最终:

AI分析
 ↓
知识库校核
 ↓
SolidWorks修改
 ↓
重新检查

这才是真正意义上的:

AI机械设计 Agent

十四、M3 Max 96GB 为什么适合这种架构?

96GB 统一内存最大的优势不是"只能装一个大模型"。

而是可以同时运行:

Qwen3.6
+
Embedding
+
Reranker
+
Vector DB
+
MCP Server
+
SolidWorks
+
Python
+
Docker
+
数据库

例如:

        M3 Max 96GB
             │
┌────────────┼────────────┐
│            │            │
↓            ↓            ↓
Qwen3.6   Vector DB      MCP
│            │            │
│            ↓            ↓
│        企业知识库    SolidWorks
│
↓
Agent
│
├──── Python
├──── C#
├──── Qt
├──── ERPNext
├──── MES
└──── MQTT/OPC

这就是 M3 Max 96GB 真正的价值。

十五、不要把所有任务都交给一个模型

建议建立多模型架构。

主模型:Qwen3.6-35B-A3B

负责:

机械设计
Agent
知识库
技术分析
日常编程

视觉模型: 后续增加 Qwen3.6-VL 或适合 MLX 的视觉版本。

负责:

工程图
装配图
SolidWorks截图
设备照片
检测图片

Embedding:BGE-M3

负责知识库向量化。

Reranker

负责:

提高知识库检索准确率

十六、SolidWorks 自动设计的最终形态

最终可以形成:

用户
 │
 ↓
"设计一个机构"
 │
 ↓
Qwen3.6
 │
┌──────┴──────┐
↓             ↓
知识库       Agent
│             │
↓             ↓
标准校核     MCP工具
              │
              ↓
           SolidWorks
              │
              ↓
            三维模型
              │
┌─────────────┼─────────────┐
↓             ↓             ↓
STEP          PDF           BOM

甚至可以进一步加入:

有限元分析
运动仿真
干涉检查
材料校核
强度计算
成本分析

最终形成一个完整的:

AI CAD Engineer

十七、M3 Max 96GB 推荐配置

如果现在重新搭建,我推荐:

模块推荐
CPU/GPUApple M3 Max
统一内存96GB
主模型Qwen3.6-35B-A3B
量化MLX 4bit / MXFP4
推理框架MLX
APImlx-lm server
Web UIOpenWebUI
EmbeddingBGE-M3
RAGLlamaIndex
Vector DBQdrant / Milvus
AgentMCP
CADSolidWorks
CAD接口SolidWorks API + MCP
编程Python / C# / Qt
工业系统MES / ERPNext
数据接口MQTT / OPC / Modbus

十八、最终推荐

对于 M3 Max 96GB,如果目标是:

SolidWorks
+
机械设计
+
知识库
+
MES
+
ERPNext
+
Python/C#/Qt
+
Agent

我不建议一味追求参数最大的模型。

更合理的方案是:

       M3 Max 96GB
            │
            ↓
   Qwen3.6-35B-A3B
       MLX 4bit
            │
┌───────────┼───────────┐
↓           ↓           ↓
RAG         MCP        Coding
│           │           │
↓           ↓           ↓
企业知识  SolidWorks   Python/C#/Qt
            │
            ↓
    AI机械设计工作站

Qwen3.6-35B-A3B + MLX 4bit 是目前非常适合 M3 Max 96GB 的本地部署路线。

它不追求"最大的参数量",而是追求:

足够强的推理能力 + 较低的本地资源占用 + Agent能力 + 工具调用 + 企业知识库 + SolidWorks自动化。

对于实际工业应用,这种组合比单纯部署一个超大模型更加实用。

十九、下一步可以继续升级

如果进一步把这个系统做成你前面规划的"小龙虾":

小龙虾
 │
 Qwen3.6-35B
 │
┌────────────┼────────────┐
↓            ↓            ↓
SolidWorks   MES        ERPNext
  MCP        MCP          API
│            │            │
↓            ↓            ↓
CAD模型    生产数据      企业数据
│
↓
企业知识库
│
↓
设计规范

就可以从"本地聊天机器人"进一步发展成:

面向机械制造企业的本地 AI Agent 平台。

而 M3 Max 96GB 正好可以作为这套系统的本地 AI 主机。

评论(0