大家好,我是肖君枫,AI 工程师,专注大模型评测、AI Agent 工程与 AI 产品研究。
我曾在中国信息通信研究院负责 Qwen、GLM、Yi、DeepSeek 等模型的基准测试,在智谱 AI 参与智能体 API 的微信、飞书等多平台集成。目前在北京从事 AI 工程,搭建 Agent 能力评测体系,参与 OpenClaw 二次开发、模型与 API 评测,以及 AI 产品需求和行业情报研究。
我设计过 20 个场景的 Agent 能力评测集,覆盖工具恢复、多智能体推理、记忆、长上下文、提示注入防御与调用预算控制;也在 1000+ 数据集上完成多系列模型评估,累计输出 5 篇测评报告。
我长期独立做开源和交付项目:UniFuncs Python SDK(已发布 PyPI)、EduRAG、OpenScan、hf-community-guard、LLM-API-TestSuite 等,熟悉 Python、Go、C/C++、C#/.NET、TypeScript/JavaScript、FastAPI、LangChain/LangGraph、MCP、RAG、OpenCompass、Gradio、Qt 和 Docker。参与过 ACL 2024 接收论文相关项目。
目前希望寻找 AI Agent、大模型应用、模型评测或 AI 产品工程方向的机会,期待加入重视技术落地、工程质量和用户价值的团队。欢迎通过 Bonjour 私信交流 Agent 评测、MCP、RAG 和 AI 工程实践。
GitHub:https://github.com/2404589803