
如何快速上手LFM2.5-1.2B-Thinking-bf163步在Mac上跑通本地大模型【免费下载链接】LFM2.5-1.2B-Thinking-bf16项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/LFM2.5-1.2B-Thinking-bf16想在自己的 Mac 上运行本地大模型LFM2.5-1.2B-Thinking-bf16 是一款由 Liquid AI 打造、面向端侧设备的轻量级推理大模型经过 MLX 格式转换后专为 Apple Silicon 芯片深度优化。无需昂贵 GPU 服务器只需一台 Mac就能流畅体验带思考能力的本地 AI。本文用 3 个简单步骤带你从零完成环境准备、模型下载到本地推理的完整上手流程。LFM2.5-1.2B-Thinking-bf16 是什么专为 Mac 打造的本地大模型LFMLiquid Foundation Model是 Liquid AI 推出的新一代基础模型家族而LFM2.5-1.2B-Thinking-bf16正是其中的轻骑兵——约 12 亿参数却内置了类 o1 的思考Thinking推理能力并且支持中文、英文、日文、韩文等 8 种语言。它最大的亮点是使用bf16 精度存储权重文件仅约 2.3GB配合 MLX 框架在 Mac 的统一内存架构上运行速度与内存占用都非常友好。项目核心文件结构如下config.json模型架构配置层数、注意力头、上下文长度等model.safetensorsbf16 格式的模型权重文件chat_template.jinja对话模板内置思考模式与工具调用支持tokenizer_config.json分词器配置README.md官方使用说明从 config.json 可以看到它的上下文窗口高达128K tokens足以处理长文档、长对话等复杂任务这在同体量模型中非常罕见。项目参数模型架构LFM2Liquid Foundation Model 2.5参数量约 1.2B1,170,340,608权重精度bfloat16bf16模型体积约 2.3 GB上下文长度128K tokens支持语言中、英、日、韩、法、德、阿拉伯、西班牙语运行框架MLXApple Silicon 专用第1步一键安装 MLX 运行环境在开始前请确认你的设备满足以下条件✅ 一台搭载 M 系列芯片的 MacM1/M2/M3/M4 均可✅ 系统为 macOS 13 及以上版本✅ 已安装 Python 3.9 及以上版本MLX 是苹果官方开源的机器学习框架而mlx-lm是它的高层封装库提供了开箱即用的模型加载与推理能力。打开终端执行一条命令即可完成安装pip install mlx-lm建议顺手把mlx-lm升级到最新版本本项目转换时使用的是 0.30.4 版本以确保与模型完全兼容pip install --upgrade mlx-lm安装完成后输入mlx_lm.generate --help若能正常显示帮助信息说明环境已经就绪。第2步下载 LFM2.5 模型文件的两种方法拿到模型权重有两种途径任选其一即可。方法一命令行快速拉取推荐在终端中克隆模型仓库到本地git clone https://gitcode.com/hf_mirrors/mlx-community/LFM2.5-1.2B-Thinking-bf16方法二由 mlx-lm 自动下载如果你不想手动克隆也可以直接跳过本步骤。在后续加载模型时传入模型 IDmlx-community/LFM2.5-1.2B-Thinking-bf16mlx-lm 会自动联网下载权重文件并缓存到本地首次加载稍慢之后即可离线使用。第3步运行本地大模型推理含示例代码环境就绪、模型到手后就可以开始本地推理了。在终端进入模型目录例如cd LFM2.5-1.2B-Thinking-bf16新建一个 Python 文件并粘贴以下代码from mlx_lm import load, generate # 加载本地模型传入仓库目录路径即可 model, tokenizer load(LFM2.5-1.2B-Thinking-bf16) prompt 用三句话介绍西湖 if tokenizer.chat_template is not None: messages [{role: user, content: prompt}] prompt tokenizer.apply_chat_template( messages, add_generation_promptTrue, return_dictFalse, ) response generate(model, tokenizer, promptprompt, verboseTrue) print(response)运行脚本稍等片刻就能看到模型输出的中文回答。整个加载过程由 MLX 自动调用 Mac 的 GPUMetal加速速度飞快⚡如果你不想写代码用命令行一条命令也能直接对话mlx_lm.generate --model LFM2.5-1.2B-Thinking-bf16 --prompt 你好介绍一下你自己进阶玩法开启思考模式与工具调用这个模型的Thinking后缀大有乾坤。查看 chat_template.jinja 可以发现它的对话模板基于 ChatML 格式并内置了think思考标签机制——模型会先在内部想清楚再给出答案这也是它推理能力出色的关键。 小技巧在多轮对话中模板默认会裁剪掉历史回复中的思考过程以节省上下文空间如果你想保留完整的思考痕迹可以在应用模板时传入keep_past_thinkingTrue。此外该模板还原生支持工具调用Function Calling只需在apply_chat_template中传入tools参数就能让模型输出结构化工具调用轻松扩展成 AI 助手、自动化工作流等应用。Mac 本地部署常见问题FAQQ8GB 内存的 Mac 能跑吗A可以。bf16 权重约 2.3GB加上推理时的 KV 缓存开销8GB 内存的入门款 Mac 也能流畅运行16GB 及以上内存体验更佳。Q运行时报错找不到模型怎么办A请确认加载时传入的是克隆下来的目录名LFM2.5-1.2B-Thinking-bf16或使用完整模型 ID并保证mlx-lm已正确安装。Q模型生成速度如何A得益于 Apple Silicon 的统一内存架构与 MLX 的原生 Metal 加速1.2B 小模型的生成速度非常可观日常问答几乎无感延迟。Q可以在非 Mac 平台使用吗Abf16 权重理论上也可被其他框架加载但 MLX 生态专为 Apple 芯片设计推荐直接在 Mac 上使用以获得最佳体验。总结3 步快速上手本地大模型回顾一下上手 LFM2.5-1.2B-Thinking-bf16 只需三步① 安装 mlx-lm 环境 → ② 克隆模型仓库 → ③ 运行推理代码。整个过程不超过 10 分钟不依赖云端 API、无需付费数据完全留在本地隐私安全又省心。对于想体验思考型推理模型、又不想折腾复杂部署的朋友来说这款 Mac 本地大模型无疑是性价比极高的选择。现在就打开终端动手跑通你的第一个本地 AI 吧【免费下载链接】LFM2.5-1.2B-Thinking-bf16项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/LFM2.5-1.2B-Thinking-bf16创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考