M3 Max 96GB 本地部署 Qwen3.6-35B-A3B:打造 SolidWorks 智能机械设计与企业知识库 AI 工作站
M3 Max 96GB 统一内存适合同时运行本地大模型与设计工具链。本文推荐 MoE 架构的 Qwen3.6-35B-A3B(总参数约 35B、单 Token 激活约 3B)配合 MLX 4bit 量化本地部署,打造 SolidWorks 智能机械设计与企业知识库 AI 工作站:mlx-lm 提供 OpenAI 兼容 API,OpenWebUI 做对话入口,通过 SolidWorks MCP 工具调用实现参数化建模,结合 BGE-M3 + Reranker 构建企业知识库 RAG,并规划多模型架构与“小龙虾”本地 AI Agent 平台的演进路线。
一、为什么选择 Apple M3 Max 96GB?
随着本地大模型的发展,Apple Silicon 的统一内存架构越来越适合运行中大型 AI 模型。
对于机械设计、工业自动化、MES、ERPNext、SolidWorks 二次开发等场景,本地部署 AI 有一个非常明显的优势:
设计资料、企业知识库、CAD 文件和源代码可以留在本地。
对于拥有 M3 Max 96GB 统一内存的 Mac Studio 来说,与其只把它当作普通开发电脑,不如将它打造成为一台:
本地 AI + SolidWorks + 企业知识库 + Agent 的智能设计工作站。
本文推荐的核心模型为:
Qwen3.6-35B-A3B
它采用 MoE(Mixture of Experts)架构,总参数规模约 35B,但每个 Token 实际激活的参数规模约为 3B,因此非常适合 Apple Silicon 本地推理。
目前已经存在针对 Apple Silicon 优化的 MLX 量化版本,例如 Qwen3.6-35B-A3B-OptiQ-4bit,可以直接使用 MLX 运行,无需将模型转换成 GGUF。
二、为什么不是 Qwen3-235B?
很多人看到 M3 Max 96GB,会第一时间考虑:
Qwen3-235B-A22B
但是对于实际生产使用,我反而更加推荐:
Qwen3.6-35B-A3B
原因很简单:
1. 运行压力更低
Qwen3.6-35B-A3B 是 MoE 模型。
虽然模型总参数达到 35B,但每次推理只激活其中一小部分参数。
因此:
35B 总参数
↓
MoE Router
↓
少量 Expert 被激活
↓
约 3B 级别激活参数
这使得它特别适合本地 Agent、代码生成和工具调用。
2. M3 Max 96GB 有充足空间
目前已经有 MLX 4bit 版本。
例如社区提供的 MLX-MXFP4 版本,模型权重约 17~20GB;另一个混合 4/8bit MLX 版本约 20GB。
因此:
M3 Max 96GB
模型
≈ 20GB
KV Cache
+
操作系统
+
SolidWorks/MCP
+
知识库
+
Embedding
+
数据库
仍然有较大的余量
这比在 96GB 机器上硬塞超大型模型更加合理。
三、推荐的模型版本
对于 M3 Max 96GB,我建议优先考虑:
Qwen3.6-35B-A3B
+
MLX 4bit
目前可以选择:
mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
该版本针对 Apple Silicon 的 MLX 推理进行了量化优化,并提供 mlx-lm 使用方式。
另外也存在:
Qwen3.6-35B-A3B-MXFP4
这类 MLX 原生 FP4 版本,模型权重约 17GB 左右。
四、M3 Max 96GB 推荐软件架构
整个 AI 工作站可以设计成:
┌─────────────────────────────┐
│ OpenWebUI │
│ AI 对话入口 │
└─────────────┬───────────────┘
│
↓
┌─────────────────────────────┐
│ Qwen3.6-35B-A3B │
│ MLX │
└─────────────┬───────────────┘
│
┌─────────────┼───────────────┐
↓ ↓ ↓
SolidWorks 知识库 编程开发
MCP RAG Python/C#/Qt
↓ ↓ ↓
SolidWorks PDF/Word Git/MES
自动建模 Excel/标准 ERPNext
最终目标不是简单地"聊天"。
而是:
让 AI 成为机械设计工程师的数字助手。
五、第一步:安装 MLX
Apple Silicon 最值得优先考虑的本地推理框架之一就是 MLX。
安装:
brew install uv
然后:
uv tool install mlx-lm
验证:
mlx_lm --help
六、直接运行 Qwen3.6
安装完成以后,可以直接运行:
mlx_lm.chat \
--model mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
第一次运行时会自动从 Hugging Face 获取模型。
也可以使用 MXFP4 版本:
mlx_lm.chat \
--model majentik/Qwen3.6-35B-A3B-MLX-MXFP4
对于 M3 Max 96GB,我建议优先测试 4bit/混合量化版本。
七、启动 OpenAI API Server
真正做 Agent 时,不建议一直使用命令行聊天。
更好的方式是:
Qwen3.6
↓
MLX Server
↓
OpenAI Compatible API
启动:
mlx_lm.server \
--model mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
默认服务:
http://127.0.0.1:8000
MLX 模型卡提供了 OpenAI-compatible API 的启动方式,因此后面的 OpenWebUI、Agent、MCP 客户端都可以围绕这个接口进行集成。
八、测试 API
可以通过:
curl http://127.0.0.1:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit",
"messages": [
{
"role": "user",
"content": "设计一个用于输送带的机械张紧机构"
}
]
}'
如果能够正常返回结果:
MLX
↓
Qwen3.6
↓
OpenAI API
就部署成功了。
九、为什么这个模型特别适合 SolidWorks?
SolidWorks 自动设计真正困难的地方,并不是"画一个圆"。
而是:
需求
↓
机械原理分析
↓
结构设计
↓
尺寸计算
↓
材料选择
↓
标准件选择
↓
参数化建模
↓
装配
↓
工程图
↓
BOM
这其实是一个典型的 Agent 问题。
例如用户输入:
设计一个用于滴灌带生产线的导向机构,速度 350m/min,要求减少管带跑偏。
AI 可以首先分析:
生产速度
材料
张力
摩擦
导向方式
安装空间
然后形成设计方案:
方案A:滚轮导向
方案B:V型槽导向
方案C:多滚轮限位
方案D:浮动导向
接下来调用 SolidWorks MCP。
十、SolidWorks + Qwen3.6
推荐架构:
用户
│
↓
Qwen3.6
│
↓
Agent
│
↓
SolidWorks MCP
│
↓
SolidWorks API
│
↓
SolidWorks
AI 不直接操作 SolidWorks。
而是通过工具调用:
create_part
create_sketch
create_extrude
create_hole
create_fillet
create_assembly
create_drawing
export_step
export_pdf
例如:
{
"tool": "create_part",
"parameters": {
"name": "Guide_Roller",
"diameter": 80,
"length": 120,
"material": "45#"
}
}
Agent 负责规划。
MCP 负责执行。
SolidWorks 负责建模。
这比让大模型直接生成一大段 VBA 更可靠。
十一、企业知识库
机械设计 AI 最重要的部分其实不是模型。
而是:
企业自己的知识。
例如建立:
/KnowledgeBase
│
├── 机械设计手册
├── GB国家标准
├── ISO标准
├── 电机选型
├── 减速机选型
├── 轴承选型
├── 螺栓标准
├── 公差标准
├── 企业设计规范
├── SolidWorks API
├── 设备说明书
├── 历史项目
└── MES技术文档
然后建立 RAG。
十二、RAG 推荐架构
PDF
Word
Excel
CAD文档
技术规范
历史项目
│
↓
Document Parser
│
↓
Chunk
│
↓
Embedding
│
↓
Vector Database
│
↓
Reranker
│
↓
Qwen3.6
Embedding 可以使用:
BGE-M3
检索结果经过 Reranker 后,再交给 Qwen3.6。
这样 AI 就不是"凭经验回答"。
而是:
问题
↓
检索企业知识
↓
找到相关标准
↓
Qwen3.6分析
↓
生成设计方案
十三、一个非常实用的例子
以后可以直接问:
M8螺栓用于这个铝型材结构,孔径应该怎么设计?
Agent:
① 查询企业机械设计规范
② 查询GB标准
③ 查询当前结构材料
④ 查询SolidWorks模型
⑤ 判断安装方式
⑥ 给出推荐尺寸
⑦ 调用SolidWorks修改模型
最终:
AI分析
↓
知识库校核
↓
SolidWorks修改
↓
重新检查
这才是真正意义上的:
AI机械设计 Agent
十四、M3 Max 96GB 为什么适合这种架构?
96GB 统一内存最大的优势不是"只能装一个大模型"。
而是可以同时运行:
Qwen3.6
+
Embedding
+
Reranker
+
Vector DB
+
MCP Server
+
SolidWorks
+
Python
+
Docker
+
数据库
例如:
M3 Max 96GB
│
┌────────────┼────────────┐
│ │ │
↓ ↓ ↓
Qwen3.6 Vector DB MCP
│ │ │
│ ↓ ↓
│ 企业知识库 SolidWorks
│
↓
Agent
│
├──── Python
├──── C#
├──── Qt
├──── ERPNext
├──── MES
└──── MQTT/OPC
这就是 M3 Max 96GB 真正的价值。
十五、不要把所有任务都交给一个模型
建议建立多模型架构。
主模型:Qwen3.6-35B-A3B
负责:
机械设计
Agent
知识库
技术分析
日常编程
视觉模型: 后续增加 Qwen3.6-VL 或适合 MLX 的视觉版本。
负责:
工程图
装配图
SolidWorks截图
设备照片
检测图片
Embedding:BGE-M3
负责知识库向量化。
Reranker
负责:
提高知识库检索准确率
十六、SolidWorks 自动设计的最终形态
最终可以形成:
用户
│
↓
"设计一个机构"
│
↓
Qwen3.6
│
┌──────┴──────┐
↓ ↓
知识库 Agent
│ │
↓ ↓
标准校核 MCP工具
│
↓
SolidWorks
│
↓
三维模型
│
┌─────────────┼─────────────┐
↓ ↓ ↓
STEP PDF BOM
甚至可以进一步加入:
有限元分析
运动仿真
干涉检查
材料校核
强度计算
成本分析
最终形成一个完整的:
AI CAD Engineer
十七、M3 Max 96GB 推荐配置
如果现在重新搭建,我推荐:
| 模块 | 推荐 |
|---|---|
| CPU/GPU | Apple M3 Max |
| 统一内存 | 96GB |
| 主模型 | Qwen3.6-35B-A3B |
| 量化 | MLX 4bit / MXFP4 |
| 推理框架 | MLX |
| API | mlx-lm server |
| Web UI | OpenWebUI |
| Embedding | BGE-M3 |
| RAG | LlamaIndex |
| Vector DB | Qdrant / Milvus |
| Agent | MCP |
| CAD | SolidWorks |
| CAD接口 | SolidWorks API + MCP |
| 编程 | Python / C# / Qt |
| 工业系统 | MES / ERPNext |
| 数据接口 | MQTT / OPC / Modbus |
十八、最终推荐
对于 M3 Max 96GB,如果目标是:
SolidWorks
+
机械设计
+
知识库
+
MES
+
ERPNext
+
Python/C#/Qt
+
Agent
我不建议一味追求参数最大的模型。
更合理的方案是:
M3 Max 96GB
│
↓
Qwen3.6-35B-A3B
MLX 4bit
│
┌───────────┼───────────┐
↓ ↓ ↓
RAG MCP Coding
│ │ │
↓ ↓ ↓
企业知识 SolidWorks Python/C#/Qt
│
↓
AI机械设计工作站
Qwen3.6-35B-A3B + MLX 4bit 是目前非常适合 M3 Max 96GB 的本地部署路线。
它不追求"最大的参数量",而是追求:
足够强的推理能力 + 较低的本地资源占用 + Agent能力 + 工具调用 + 企业知识库 + SolidWorks自动化。
对于实际工业应用,这种组合比单纯部署一个超大模型更加实用。
十九、下一步可以继续升级
如果进一步把这个系统做成你前面规划的"小龙虾":
小龙虾
│
Qwen3.6-35B
│
┌────────────┼────────────┐
↓ ↓ ↓
SolidWorks MES ERPNext
MCP MCP API
│ │ │
↓ ↓ ↓
CAD模型 生产数据 企业数据
│
↓
企业知识库
│
↓
设计规范
就可以从"本地聊天机器人"进一步发展成:
面向机械制造企业的本地 AI Agent 平台。
而 M3 Max 96GB 正好可以作为这套系统的本地 AI 主机。
