Google 宣布推出 Google Gen AI SDK for Kotlin(google-genai-kotlin)1.0 正式版。该 SDK 从零构建为 Kotlin Multiplatform(KMP)库,专门面向 JVM 环境(包括后端服务、无服务器函数和桌面应用),提供符合 Kotlin 惯用法的 API,涵盖一等公民级别的协程支持、异步 Flow 流式传输以及带有命名和默认参数的不可变数据类。
SDK 已发布至 Maven Central(com.google.genai:google-genai-kotlin)。多平台项目可将依赖添加至 commonMain 源集;标准单平台 JVM 项目中,Gradle 会通过 Module Metadata 自动选择最优变体。
统一接入两套 Gemini 平台
该 SDK 的核心入口是 Client 类,可统一管理 HTTP 连接与认证。根据环境变量配置,它能够以最小改动同时对接 Gemini Developer API(通过 GEMINI_API_KEY 或 GOOGLE_API_KEY 访问 Google AI Studio)和 Gemini Enterprise Agent Platform(设置 GOOGLE_GENAI_USE_ENTERPRISE=true 并使用标准的 Google Cloud Application Default Credentials)。
值得注意的是,尽管底层采用 KMP 架构,出于安全原因,该 SDK 不允许直接从移动应用中调用。移动端直接访问 Gemini 模型需改用 Firebase AI Logic。
文本生成、流式输出与多轮对话
在基础文本生成方面,SDK 支持单次请求和流式响应。使用 Kotlin 的 use 扩展函数可以确保客户端底层的网络引擎和 HTTP 连接被正确释放。针对交互式 UI 或命令行工具等低延迟场景,generateContentStream 会返回一个冷启动的 Kotlin Coroutine Flow,实时交付 token 块。
对于多轮对话,SDK 内置了专用的 chats 服务。它能够自动维护上下文、追加对话轮次、格式化历史记录并处理函数调用,免去了手动管理对话状态的繁琐工作。开发者也可通过 chat.sendMessageStream(...) 获取流式的多轮对话响应。
多模态分析与搜索接地
SDK 支持将 Gemini 的多模态推理能力与外部验证结合。例如在分析技术、医学或科学图表时,开发者可以挂载 Google Search Grounding,让模型对照实时网络来源交叉核验事实性声明。
在视觉生成方面,SDK 完整支持最新的图像生成模型系列。生成的图像字节会以 Blob 形式直接包含在响应部分中。同时,开发者可以在同一请求中传入已有图像和自然语言编辑指令,实现对话式的图生图编辑。
实时双向交互与结构化函数调用
针对低延迟语音、音频和实时多模态交互需求,SDK 通过 client.live.connect(...) 建立持久化 WebSocket 连接,支持 Gemini Live API。
在构建智能体工作流或将大模型与后端微服务桥接时,开发者可以通过 FunctionDeclaration 传入结构化的 JSON Schema,由模型判断何时调用相应工具。当使用 chats 服务时,还可启用自动函数调用(AFC)功能:对话中声明的函数可由 SDK 自动且透明地代为执行,无需开发者手动干预调用流程。
目前,该 SDK 可为 Ktor、Spring Boot、Quarkus、Micronaut 等主流 JVM 后端框架提供生成式 AI 集成基础。源码与示例已托管于 GitHub 仓库 googleapis/kotlin-genai。
