IBM模块化AI开发工具 大语言模型像软件构建
IBM推出模块化AI开发工具GraniteLibraries与GraniteSwitch,通过适配器函数将大语言模型拆解为可组合的软件模块,实现特定任务精准定制。搭配Granite4 1系列小模型,在指令跟随等基准上性能显著提升,推理成本更低,为企业构建可预测、易适配的AI系统铺平道路。
先说一个核心判断:AI行业正经历一场关键的转型期。回顾历史,就在几年前,AI界引以为傲的前沿成果,还只是生成一张大致符合你描述的图片。短短几年间,AI能力已经迎来寒武纪式的大爆发——如今,它不仅能够写出流畅无误的文章,还能运行关键的企业级工作流,甚至协调多个智能体自主驱动整个应用程序。
但挑战也随之而来:尽管进展如此迅猛,我们构建与使用AI模型的方式,相比其他软件,仍然像是两个世界的产物。企业用户渴望精准、高效的模型,但对大多数开发者而言,实现这一目标却异常困难。究其根本,在于我们很难将AI模型拆解成传统软件中那种“即插即用”的积木模块。
现代软件应用,本质上是由多个小型、独立的功能模块组合而成。这就像用无数乐高积木搭建一座城堡,而不是拿一整块黏土直接塑造。哪个环节出问题,工程师能定位到对应模块,修复、测试、重新部署,完全不影响其他部分。功能之间通过接口解耦,不同团队可以各自开发,针对规范测试,随时替换。整套系统虽服务于统一目标,但其内部绝不是一坨无法分割的整体。
而当今的大语言模型,虽是技术奇迹,能轻松回答“哪个国家的首都是哪里”这类常识问题,也能帮你解读财报中的关键数据。但这些所有能力,仿佛都溶解在一整池参数权重中。假如你想改变模型对某种特定情境的反应方式,只有两条路可走:要么将整个模型重头训练一遍,要么写出一份极其详细、精准到变态的提示词。这两条路都不够快,更无法让多个团队像协作改进软件一样,共同提升AI模型的能力。
IBM研究院关注这个问题已久,他们一直试图将软件工程领域中那种严谨与模块化基因,注入到大语言模型之中。这条道路,他们称之为“生成式计算”。
IBM研究院语言与多模态模型总监Luis Lastras直言:“模型不过就是附带数据的代码,只是数据量远多于代码量。我们尚未将软件工程的那套经验真正应用到LLM上——而这些模块,我们完全可以分开构建。”
最近,IBM推出了一套协同工具,让生成式计算的愿景向前迈出了坚实一步。软件模块化的理念,被具象化为 Granite Libraries——一套适配器集合,可针对特定任务对AI模型进行精准定制。其核心概念是“适配器函数”,与你熟悉的软件库中的函数一样,拥有明确界定的输入和输出。
在这个体系里,适配器函数是一种经过专门训练的小型模型适配器,它不生成开放式的文本,而是执行特定任务。例如,对文档进行相关性评分、改写查询、检测幻觉,或做出安全性判断。
同步推出的还有 Granite Switch 项目——一套面向现有模型架构的实验性工具,可动态管理Granite Libraries中的专用组件。加上近期发布的 Granite 4.1 系列模型,以及IBM开源的生成式计算库 Mellea,开发者现在终于拥有了一套工具,能将不可预测的文本生成,转变为可靠、确定性的编程函数。
让AI模型像软件一样“可定制”
Granite Libraries的设计初衷,就是为AI模型带来软件级别的定制化能力。
IBM已发布三个面向常见企业工作流的库:
RAG库 包含检索增强生成关键任务的适配器,例如查询改写、可回答性评估、幻觉检测和引用生成。
核心库 提供基础能力,包括需求检查、确信度评分和上下文归因。
安全守护库 则让模型能直接执行内联的安全性、事实性和策略检查,不再需要独立的防护模型。
更重要的是,这些库都是模块化且独立训练的。企业可按需选用,逐步叠加更多能力,就像今天管理各类软件依赖一样。
效果有多显著?每个适配器函数都是它那一项任务的专家。拿“需求检查器”来说,它接收模型的回应和一系列约束条件,然后返回这些条件是否被满足的判断。当Granite 4.1 3B被要求直接执行这个任务时,在常用的指令跟随基准IFEval上,平衡准确率仅为51%。但同样这个模型,接上新的Granite Library需求检查适配器后,准确率直接飙升至84%。
适配器让小模型在特定任务上的表现,远远超越了单纯依赖精心设计提示词的大模型。而Mellea的出现,则让这些适配器函数真正具备了“软件”的品性:它自动插入激活特定适配器所需的标签,在运行中严格执行格式规则,并将这一切封装成标准的Python函数。这样一来,主应用与原始AI文本的不确定性之间,被彻底隔离开来。
借助Granite Libraries,Granite基础模型可以随时召唤针对特定任务的“专家”——低秩适配器(LoRA)或激活式低秩适配器(aLoRA)。这些小专家受过专门训练,能通过软件接口执行定义明确的功能。这意味着,一个小模型可以在窄域任务上,与体型大它几倍的通用模型正面竞争,而推理成本却低得多。
当库中的适配器被激活,模型会表现得既专注又出色。基础模型本身纹丝不动,但其行为可以被精确规定。切换aLoRA的成本,几乎可以忽略不计。
Granite Switch:一个模型,多套“剧本”
Granite Switch项目是一套已发布在GitHub上的实验性工具。其思路很巧妙:就像编译器从源代码和软件库生成二进制文件一样,Granite Switch能在几分钟内组合出一个新模型。
它允许基础Granite模型及其适配器函数作为一个整体运行,并在推理时高效地激活相应组件。具体做法,是在现有的Granite核心模型中加入一个新的“切换”层,这个层将适配器的权重粘合到基础模型上,再附加格式标签和新的对话模板。无需为每个不同任务启动一个全新的AI模型,Granite Switch会在恰当的时机,动态打开或关闭所需的适配器。基础模型始终可访问,新能力的加入,不会改变底层模型分毫。
这个独立的切换层,让LoRA和aLoRA能在vLLM(面向大规模部署的开源推理引擎)中运行。在实际业务中,一个任务往往由一系列动作组成:比如执行安全检查、检索数据、验证答案。如果每次切换适配器都迫使AI清空短期记忆、从头计算,运行速度就会变慢。但通过使用aLoRA,Granite Switch模型能在不同步骤间保留记忆,无需暂停重读,多步骤工作流的速度因此大幅提升。
其实现原理也不复杂:在基础模型中插入一个额外的Transformer层,利用它的注意力机制读取和保存与当前激活适配器状态相关的值;一个特殊的控制Token会向模型发出“切换专家”的信号,就像调度员在编组站里指挥列车去往哪条轨道,而切换层,就是轨道本身。
小模型,大本事
Granite Libraries和Granite Switch项目的潜力,离不开它们依托的基础模型。IBM刚发布的Granite 4.1系列,是迄今为止性能最强的模型家族。
这个系列的设计目标很明确:以小博大。8B模型的表现,与之前的Granite 32B混合专家模型持平甚至更优;30B模型在企业任务上,可以直接与Llama 3.3 70B这种体型大它一倍的模型一较高下。而小型高性能模型的服务成本,远低于那些在窄域任务上可能表现欠佳的大型通用模型。
这些模型在相对少量但高质量的数据上训练而成,在工具调用和指令跟随方面拿下了极具竞争力的分数。同时,相比许多前沿推理模型,它们保持了更低的延迟和运营成本。
这次发布是整个生态的一部分,还包括在表格与图表提取上表现出众的Granite Vision 4.1,以及全新的语音模型和防护模型。所有模型均在约15万亿Token上训练,以开源Apache 2.0许可证发布,支持12种主要语言,可用于全球部署。
说到底,IBM推出Granite Libraries,是为了实现一个更宏大的目标:将AI模型打造成像软件一样可组合,最终为企业用户创造更大的价值。将各项能力分离成模块化组件,开发者就能构建出更易适配、运营成本更低、在生产环境中更具可预测性的AI系统。
模块化当然不能解决大规模部署生成式AI的所有难题,但它为构建更可持续、更契合企业需求的系统,铺出了一条坚实的道路。
Q&A
Q1:Granite Libraries是什么?它能解决哪些问题?
A:Granite Libraries是IBM推出的一套模块化适配器集合,可针对特定任务定制AI模型,而无需重新训练整个模型。它包含RAG库、核心库和安全守护库三个部分,分别支持检索增强生成、基础能力评估和安全性检查等企业常见工作流。它能大幅提升模型在特定任务上的准确率,同时降低推理成本。
Q2:Granite Switch和普通模型部署有何不同?
A:普通部署往往需要为不同任务启动多个独立模型,切换时还会清空模型的短期记忆,导致多步骤任务效率低下。Granite Switch通过在基础模型中插入切换层,可在推理时动态激活不同适配器,同时保留上下文记忆,不改变底层模型,从而显著提升多步骤工作流的速度和灵活性。
Q3:Granite 4.1模型相比之前版本有哪些提升?
A:Granite 4.1系列主打以小博大:8B模型性能达到甚至超过此前32B混合专家模型的水平,30B模型可与Llama 3.3 70B等更大模型在企业任务上竞争。所有模型在约15万亿Token上训练,支持12种语言,以Apache 2.0开源许可证发布,在保持低延迟和低成本的同时,在工具调用和指令跟随基准上取得了极具竞争力的成绩。
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:IBM模块化AI开发工具 大语言模型像软件构建要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
相关热点OpenAI发布开源gpt-oss系列,含120B和20B两个版本,采用MoE架构,支持128k上下文,性能接近o4-mini与o3-mini,在工具调用与推理中超越o1和GPT-4o。本地部署需16GB内存,在线使用成本低廉。实测编程能力欠佳,数学推理优秀,复杂逻辑推理表现不理想。
人工智能和机器学习应用从传感器到云端分层协作,片上网络(NoC)作为关键连接技术,在芯片内部实现高速数据传输、降低集成风险并支持小芯片互连,确保AI ML系统高效可靠运行。
PolarDB在数据库内核中集成向量索引与Embedding能力,实现一条SQL管理向量全生命周期。通过内置HNSW索引、异步构建机制及优化器智能选择混合检索路径,支持事务级实时检索与标量向量联合查询,简化AI应用开发。
迅为RK3568核心板作为智能家居控制中枢,集成多协议通信、本地语音控制、安全监控、能源管理及场景自动化功能,支持4K视频解码与双屏异显,提供开源底板与深度定制能力,助力快速构建功能丰富的智能家居系统。
- 日榜
- 周榜
- 月榜
热点快看
