
AI Benchmark Leaderboards & Model Evals | BenchmarkList
对比和评估 AI 模型在编码、推理、代理和其他基准测试中的表现。
davidtsong · HN
Benchmarklist: track AI benchmarks (2.4k+), models, and capabilities
完整作品展
技术栈
33 projects

对比和评估 AI 模型在编码、推理、代理和其他基准测试中的表现。
davidtsong · HN
Benchmarklist: track AI benchmarks (2.4k+), models, and capabilities

与Sable AI代理聊天扫描Web应用和API的漏洞。
@SableOffensive · X
Building Sable. An AaaS where specialized AI security agents perform penetration testing for web apps and APIs, helping teams find vulnerabilities before they reach production.

在云平台构建和部署AI代理,支持持久线程、Webhook和计划任务。
@computer_agents · X


编写目标,AI代理(Claude、Cursor、Codex)分解并执行编程任务。
dudemanAtl · HN
PlanWright – A control plane for AI coding agents

向AI团队负责人分配任务,由其调度AI专家完成工作。
@StevenCen75554 · X
我们最新推出的 Product Hunt 上线了! 专为电商团队而生,让你只需一句话,就能拥有一整支 AI 团队——写SEO Blog、做用户调研、优化Listing、生成AI短视频,全都不在话下。不用招人,不用在一堆工具间来回切换,只需要说出你想要什么。 专为想要「一个人打出一支团队的仗」的电商运营团队打造。 如果这个理念打动了你,今天的一个 upvote 对我们来说意义重大 🙏 #ProductHunt #BuildInPublic #AIAgents #IndieHackers

为 AI 代理分配任务和管理依赖关系的优先级工作队列平台。
Olscore · HN
Pullboard – a work queue for agents, built to run a quant desk

按职业场景语义搜索 AI Skills,保存收藏集,一键装入 Claude Code。
SkillForge — Claude Skill 发现与分发平台,按职业场景组织 5700+ skill 覆盖 30 个垂直领域,一行命令装到 Claude Code / Cursor,登录后可留存自己的工具集

用友好界面管理AI代理团队。
jackcollinshq · Product Hunt
YAGNI Proactive agent teams you manage like humans