SDKGPT
Beta
Explore
Apps
Feedback
SDK
Search apps, SDKs, companies...
⌘K
Pricing
Sign in
Find bugs
AI and Machine Learning | SDKGPT
Categories
AI and Machine Learning
AI and Machine Learning
Featured
78 SDKs
AISpeech
思必驰语音交互 SDK,提供基于语音的人机交互能力,包括语音识别、语音合成、语义理解等,可集成到智能硬件和应用中实现语音助手功能。
AIUI
科大讯飞推出的 AIUI 人机交互解决方案,为开发者提供多种集成方式,帮助快速开发和接入多样化的语音交互应用,支持语音识别与语义理解。
Alibaba Cloud Voice SDK
阿里云智能语音交互(NLS)服务的 Android 客户端 SDK,提供语音识别、语音合成等语音 AI 功能。此为老版本包名,新版本已迁移至 com.alibaba.idst.nui。
Alibaba Cloud Wuying MobileAgent SDK
阿里云无影云手机 MobileAgent SDK,用于连接 MobileAgent 服务器,实现智能体任务的执行、管理和监控,封装 C++ MobileAgent SDK,提供 Kotlin/Java 接口。
app-builder
百度智能云千帆 AppBuilder Java SDK,帮助开发者快速搭建 AI 原生应用,提供工作流编排、RAG 应用构建、大模型能力组件等功能。
ARCore
Google 推出的 ARCore 增强现实平台,通过运动追踪、环境理解和光照估计等 API,帮助开发者在 Android 设备上构建 AR 体验应用。
Arcsoft
虹软提供的计算机视觉算法服务与软件解决方案 SDK,涵盖智能驾驶与影像技术,通过 libmpbase.so 原生库为应用提供底层算法支持。
Ascend CANN
华为昇腾 CANN(神经网络计算架构)SDK,基于华为 HiAI 平台开放芯片级 AI 处理能力,提供神经网络模型推理与构建支持。
Baidu AI SDK
百度 AI 开放平台 Java SDK,为百度 AI 各项能力提供统一 Java API 接入,覆盖语音、图像、NLP 等多项人工智能技术,便于应用集成百度 AI 服务。
Baidu Face Recognition
百度智能云人脸识别 SDK,提供人脸检测、人脸对比、活体检测、人脸属性分析等能力,支持 1:1 和 1:N 识别场景,广泛应用于金融认证、门禁考勤、安防监控等领域。
Baidu Voice SDK
百度语音识别 SDK,提供语音识别、语音合成、语音唤醒等功能,支持在线和离线模式,支持多种语言和方言,适用于语音交互场景。
Baidu Voice Synthesis SDK
百度语音合成(TTS)SDK,提供在线和离线语音合成功能,支持中英文混合、多音色选择及情感化表达,适用于教育、导航、智能家居等语音播报场景。
BARDUmix
百度智能云实时音视频(RTC)PaaS 平台的 Android SDK,依托百度云流媒体处理与全球低延时网络,提供稳定、超低延时、高质量的实时音视频通信能力。
BarHopper
Google ML Kit 中的 BarHopper 条码识别库,用于在 Android 设备上识别和解码各类条形码与二维码,通过原生库实现高效的端侧条码扫描能力。
com.stkouyu
声通科技(苏州声通信息科技有限公司)在线口语评测 SDK 的原生组件。该 .so 是 SDK 中对开源 LAME MP3 编码器的 JNI 封装(JNI 包名 com.stkouyu.lame),用于将口语录音编码为 MP3 后进行语音评测。在 speakguru 等 App 的隐私政策中被列为第三方 SDK「口语评测SDK (com.stkouyu)」。
CV SDK
字节跳动提供的特效 SDK(CV SDK),提供人脸识别、美颜、滤镜、AR 特效等计算机视觉特效能力,为应用提供丰富的视觉特效库,常用于短视频、直播等场景。
CZXing
ZXing 和 ZBar 的 C++ 移植版本,为 Android 提供条码/二维码扫描与解析能力,通过原生 .so 库实现高性能识别。
DartCV
DartCV 是 Dart 语言与 Flutter 的 OpenCV 绑定库,为 Flutter 应用提供计算机视觉能力,包括图像处理、特征检测等功能。
EasyAR
视辰信息科技(上海)有限公司推出的增强现实(AR)引擎 SDK,提供图像识别、平面检测、SLAM 等 AR 核心能力,帮助开发者快速搭建 AR 应用。
Executorch
ExecuTorch 是 PyTorch 官方推出的端侧推理部署框架,可将训练好的 PyTorch 模型高效转换并运行于 Android、iOS 等多种移动和嵌入式平台,支持端侧机器学习推理。
Face Verification SDK
腾讯云人脸验证(FaceID)SDK,提供活体检测、人脸比对、身份核验等功能,用于金融开户、实名认证等需要身份验证的场景。
Faceunity Nama SDK
相芯 Faceunity Nama SDK 是杭州相芯科技提供的人脸追踪与视频特效开发包,支持人脸关键点检测、美颜美型、AR 特效和虚拟形象等功能的集成,广泛应用于美颜相机和社交应用。
FastCV
FastCV 是高通推出的计算机视觉库,针对移动设备进行底层优化,提供图像处理、特征检测、几何变换等 CV 算法,充分发挥高通处理器的计算性能。
Fcitx 5
Fcitx 5 是通用的输入法框架,提供灵活的输入法引擎和插件体系,支持中文、日文等多种语言输入,Fcitx 5 for Android 将该框架移植到 Android 平台。
Financial-grade Real-person Authentication SDK
阿里巴巴金融级实人认证 SDK,提供 Android 客户端接入流程,支持简单接入与进阶使用两个阶段,结合示例代码完成活体检测与人脸识别认证。
Google MediaPipe
Google MediaPipe 跨平台机器学习推理框架的 native 组件,提供实时音视频处理、手势识别、人脸检测等能力。
GPUImage
GPUImage 是 CyberAgent 开源的 Android 图像与视频处理库,基于 GPU 着色器实现高性能的滤镜和图像处理。它提供丰富的内置滤镜效果,支持实时相机预览处理和视频录制处理。
GPUImage-Plus
GPUImage-Plus 是一个 C++ 与 Java 混合实现的图像滤镜处理库,支持静态图片、实时相机画面和视频的滤镜处理。相比 GPUImage,它在性能和滤镜效果上做了增强,适用于美颜、特效等场景。
Huawei HMS ML Kit
华为 HMS 机器学习服务,提供视觉识别(文本、人脸、图像分割、物体检测)和语言处理(翻译、语音识别、语言检测)等 AI 能力,支持本地和云端推理。
iFlytek AIKit
讯飞 AIKit 是离线语音交互 SDK,提供命令词识别、语音唤醒等能力,支持无网络环境下的实时语音交互,适用于智能终端、智能家居等场景。
iFlytek Spark
科大讯飞星火认知大模型 SDK,是新一代认知智能大模型,拥有跨领域知识和语言理解能力,可在应用中集成星火大模型的对话与认知能力。
iFlytek Speech
科大讯飞 MSC 语音 SDK,提供语音识别、语音合成、语音评测等 AI 语音能力,支持在线和离线模式,包含语音听写、实时语音转写、语音唤醒等功能。
Krisp AI Voice SDK
Krisp 提供的 AI 语音处理 SDK,集成世界级 AI 降噪技术,通过 libkrisp-audio-sdk.so 原生库实现实时语音降噪与语音增强,适用于通话和录音场景。
Leptonica
Dan Bloomberg 开发的开源图像处理库,涵盖图像分割、形态学操作、OCR 预处理等广泛实用的图像处理功能,通过 libleptonica.so 等原生库提供能力,常用于 Tesseract OCR 的底层支持。
Liblouis
Liblouis 是一套开源的盲文翻译与反向翻译工具,支持多种语言与盲文编码格式,广泛用于辅助技术与无障碍软件。
LiteRT
LiteRT(原名 TensorFlow Lite)是 Google 推出的高性能设备端机器学习运行时框架,支持在移动与边缘设备上部署 GenAI 与 ML 模型。
MACE
MACE(Mobile AI Compute Engine)是小米开源的移动端异构计算神经网络框架,针对移动设备的 CPU/GPU/DSP 进行了深度优化,通过 libmace.so 提供高效的模型推理能力。
MediaPipe LLM Inference
MediaPipe LLM Inference 是 Google AI Edge 提供的端侧大语言模型推理 API,支持在 Android 设备上完全本地运行大语言模型(LLM),无需联网即可完成文本生成、理解等推理任务,适用于隐私敏感或离线场景。
MediaPipe Tasks
MediaPipe Tasks 是 Google AI Edge 推出的一套核心编程接口解决方案,为 MediaPipe 提供统一的任务式调用入口,涵盖视觉、文本、音频等多模态 AI 能力,便于开发者在移动端快速集成机器学习推理功能。
Megvii Portrait Beauty SDK
旷视(Megvii)人像美化 SDK,提供美颜、美形、滤镜、AR 贴纸、美妆等图像美化特效能力,可快速集成到相机、直播、短视频等场景。
Megvii SDK
旷视科技(Megvii)Face++ 人脸识别 SDK,提供人脸检测、人脸比对、活体检测、人脸属性分析等 AI 视觉能力,是国内领先的人脸识别技术服务。
Microsoft Cognitive Services Speech SDK for Java
微软认知服务语音 SDK,提供语音转文字、文字转语音、语音翻译、实时对话转写等功能,支持多种语言和方言,可用于 Java 和 Android 平台集成语音能力。
MindSpore Lite
MindSpore Lite 是华为与 MindSpore 社区联合推出的端侧 AI 推理引擎,具备快速、智能、轻量的特点,支持在移动端及各类边缘设备上运行机器学习模型,实现全场景智能应用部署。
ML Kit
ML Kit 是 Google 面向移动开发者的端侧机器学习工具包,提供强大易用的 ML 能力,包括文字识别、人脸检测、条码扫描等,通过 libmlkit 等原生库实现端侧推理。
MNN
MNN 是阿里巴巴开源的高效轻量级深度学习框架,支持深度模型的推理与训练,针对移动端进行了深度优化,通过 libmnn 系列原生库提供跨平台的模型推理能力。
MobileGlues
MobileGlues 是一个在移动端基于 OpenGL ES 实现的 GL 兼容层库,名称意为"on Mobile, GL uses ES",通过在硬件 OpenGL ES 之上模拟完整 OpenGL 接口,使依赖桌面 OpenGL 的应用得以在移动设备上运行。
ncnn
ncnn 是腾讯开源的高性能神经网络前向推理框架,针对移动端深度优化,支持 Vulkan、ARM 等多种后端,体积小、依赖少,广泛用于手机端 AI 推理场景。
nmmp
nmmp 是一个 Android class dex 文件保护库,采用 dex-vm 技术将 Java 类转换为自定义虚拟机字节码,防止代码被反编译和逆向分析,提升应用安全性。
onnxruntime
ONNX Runtime 是微软开源的跨平台机器学习推理与训练加速器,支持 ONNX 模型格式,提供高性能 CPU/GPU 推理能力,兼容 PyTorch、TensorFlow 等框架导出的模型。
OpenCC
BYVoid 开源的中文简繁转换项目,支持繁体中文与简体中文之间的双向转换,兼顾地区用词差异,广泛用于跨地区中文内容处理。
OpenCV
OpenCV 是跨平台计算机视觉库,提供实时图像处理与机器视觉算法,涵盖图像滤波、特征检测、目标识别等功能,广泛用于图像处理与视觉应用开发。
Paddle Lite
百度开源的 Paddle Lite 是高性能、轻量级、高灵活性的深度学习推理框架,支持移动端和边缘端的多硬件平台推理部署,适用于端侧 AI 模型推理场景。
Rime Core
Rime Core 是 Rime 输入法引擎的核心库,由 lotem 创建,为各类输入法前端提供底层输入处理与方案加载能力。
Sinovoice HCI Sys
捷通华声(Sinovoice) HCI 语音交互系统 SDK 的 native 组件,提供语音识别、语音合成基础能力。
SNPE SDK
SNPE(Snapdragon Neural Processing Engine)是高通骁龙提供的神经网络推理运行时,支持在骁龙平台上加速 AI 模型推理,可利用 DSP、GPU 和 CPU 进行异构计算。
SparkChain
科大讯飞星火链(SparkChain)大模型 SDK 的 native 库,包含语音识别(ASR)、实时转写(RAASR/RTASR)、语音合成(TTS)、语音翻译(IST/ITS)等核心能力。JNI 包名 com.iflytek.sparkchain.core 为确定性证据。
Speech Recognition SDK
百度智能云语音识别 SDK,提供实时语音转文字、录音文件识别、短语音识别等能力,支持多语言、多方言,是国内领先的语音识别技术服务。
speechEngine
Audiokinetic 为 Wwise 项目提供的文本转语音(TTS)支持引擎,集成语音合成能力到游戏音频中间件中。
SpeechSuper
SpeechSuper 语音评测 Android SDK,用于语音发音评估和评分。
Tencent Cloud Intelligent Voice Service
腾讯云智能语音服务实时语音识别 SDK,提供边说边上传的流式语音识别功能,支持中文普通话和英文,具备端点检测和语音采集能力。
Tencent Cloud TTS
腾讯云语音合成(TTS)Android SDK,提供文字转语音功能,支持在线、离线、混合三种模式,支持多音色选择,可调节语速、音量等参数。
Tencent Youtu Liveness SDK
腾讯优图人脸活体检测模块,支持彩色图活体、红外活体、深度活体等多种检测方式,防止照片、视频等攻击,用于判断摄像头前是否为活体。
tensorflow
Google TensorFlow Lite 移动端机器学习推理框架,用于在 Android 设备上运行 TensorFlow 模型,支持硬件加速和低延迟推理,可部署生成式 AI 与 ML 模型。
Tesseract
Tesseract 是一款开源 OCR 引擎,支持多语种文字识别,可从图片中提取文本信息,广泛应用于文档数字化、票据识别等场景。
TNN
TNN 是腾讯开源的高性能、轻量级神经网络推理框架,支持多平台部署,提供端侧 AI 模型推理能力,适用于移动端和边缘端的深度学习应用。
TVM
Apache TVM 是一个深度学习编译器栈,旨在弥合深度学习模型与不同硬件后端之间的性能差距,支持跨平台模型优化和部署。
Unisound SDK
云知声语音 AI SDK,提供语音识别、语音合成、语音输入等功能,支持离线 TTS、实时语音转写、音频文件转写等服务,通过云知声 AI 开放平台分发。
vad
DUI 是思必驰推出的全链路人机交互系统,覆盖语音唤醒、语音识别、语义理解、对话管理、TTS 播报等能力,面向智能家居、车载、机器人等 IoT 场景。
Vosk
alphacephei 推出的离线语音识别 API,支持 Android、iOS、树莓派及服务器端,提供 Python、Java、C# 等多语言接口。
xgboost-predictor
XGBoost 预测库的纯 Java 实现,用于在线机器学习预测任务,相比官方 C++ 实现性能更优,支持 Spark 集成
Xiansheng Intelligent Speaking Assessment SDK
先声智能(Singsound)口语评测 SDK,提供语音评测和发音打分功能,用于英语口语学习场景。
Xiaoai SDK
小米小爱开放平台 SDK,依托小米硬件生态和海量数据,提供全球可用的人工智能语音助手能力,支持语音识别、语义理解等小爱同学核心功能。
xnn
xnn 是一个 C++ 神经网络预测 API 库,封装了 Caffe、MXNet 等深度学习框架的推理能力,提供统一的预测接口。
Yandex SpeechKit
Yandex SpeechKit 允许应用开发者使用 Yandex 语音技术,提供语音识别和语音合成能力,适用于俄语等多语种语音交互场景。
Youdao AI Cloud SDK
有道智云 Android SDK,提供语音合成、文本翻译等 AI 能力,支持有道词典、有道云笔记等产品集成。
ZXing
ZXing 是开源的多格式一维和二维条码图像处理库,用 Java 实现,支持条码的生成与解析,是 Android 平台最广泛使用的条码识别核心库。
ZXing Android Embedded
JourneyApps 开发的 Android 条码扫描库,基于 ZXing 进行解码,提供更易用的 Android 嵌入式封装,简化条码扫描功能的集成。
zxing-cpp
zxing-cpp 是 ZXing(斑马线)二维码解析库的 C++ 实现,支持多种线性条码和矩阵条码(二维码)的识别与生成。